LTX 2.3 Крупные планы: изображение портрета-видео с родным аудио#
LTX 2.3 Крупные планы - это готовый к запуску ComfyUI рабочий процесс, который превращает один портрет в кинематографический клип с лицом вперед и одновременно сгенерированным родным аудио. "Крупные планы" описывает цель кадрирования и стиль подсказки, а не отдельный вариант модели LTX или LoRA. График запускает дистиллированный путь LTX 2.3 v1.1 GGUF без активного деталировщика LoRA, используя двухступенчатый скрытый конвейер и x2 пространственный увеличитель для обеспечения стабильной идентичности, естественного синхронизации губ и четкого кадрирования.
Разработан для модных портретов, диалогов, интервью и отточенных социальных клипов, эта сборка ComfyUI подчеркивает плотную композицию и согласованное аудио-видео движение. С LTX 2.3 Крупные планы вы предоставляете неподвижное изображение и краткое описание сцены; рабочий процесс обрабатывает движение, время и голос для создания готового к распространению MP4.
Основные модели в рабочем процессе ComfyUI LTX 2.3 Крупные планы#
- LTX-2.3 22B Distilled 1.1 (только трансформер). Основной генератор видео-аудио, дистиллированный для более быстрого вывода и меньшего потребления памяти при сохранении качества. Источник: Lightricks/LTX-2.3.
- LTX-2.3 x2 Spatial Upscaler 1.1. Родной скрытый увеличитель, который улучшает детали и стабильность движения во время второго прохода. Упакован в выпуск LTX 2.3: Lightricks/LTX-2.3.
- LTX-2.3 Video VAE (bf16) и LTX-2.3 Audio VAE (bf16). Декодеры, которые превращают скрытые видео и аудио в кадры и звуковую волну, сохраняя синхронизацию. Кураторные веса: Kijai/LTX2.3_comfy.
- Квантованные GGUF веса для LTX 2.3 22B 1.1. Эффективные по памяти UNet/трансформер и текстовый стек, оптимизированные для разгрузки на CPU или низко-ВРП GPU. Распространение: QuantStack/LTX-2.3-GGUF.
- Gemma 3 12B Инструктивный текстовый кодировщик с проекцией текста LTX. Обеспечивает надежное понимание подсказок и временные токены для обеих модальностей, подключенные к интерфейсу CLIP ComfyUI. Включено через пакет GGUF: QuantStack/LTX-2.3-GGUF.
- Опциональный маленький VAE для быстрых предварительных просмотров. Полезен для предпросмотров сэмплера во время итерации: madebyollin/taehv.
Как использовать рабочий процесс ComfyUI LTX 2.3 Крупные планы#
Этот рабочий процесс выполняется в двух координированных стадиях. Первый проход устанавливает крупный план движения и родное аудио на базовом размере. Второй проход увеличивает пространственно и уточняет идентичность и синхронизацию губ, затем декодирует и мультиплексирует видео с аудио.
- МОДЕЛИ Загружает дистиллированную модель LTX 2.3 22B 1.1 в GGUF, текстовый стек на основе Gemma 3 и видео- и аудио-VAE LTX. Также включает вспомогательные средства последовательного параллелизма и предварительного просмотра для более плавной итерации. По умолчанию активный деталировщик LoRA отсутствует, что сохраняет чистый и согласованный вид LTX 2.3 Крупные планы.
- Настройки видео Установите здесь целевую ширину, высоту, частоту кадров и длину клипа. График обеспечивает допустимые размеры внутренне, но выбор значений, подходящих для производства, дает более стабильные результаты и более плавное воспроизведение. Если вы планируете быстро итерации, начните скромно и увеличивайте во втором проходе.
- T2V — Режим текст-видео Когда вы хотите генерировать только из текста, переключите предоставленный переключатель текст-видео. Для LTX 2.3 Крупные планы по умолчанию путь — изображение-видео, который сохраняет идентичность и кадрирование, привязанные к вашему портрету.
- Входное изображение Предоставьте чистое неподвижное изображение портрета с открытым лицом. Рабочий процесс предварительно обрабатывает и изменяет размер изображения, затем использует
LTXVImgToVideoInplace(#161), чтобы закрепить идентичность и геометрию объектива. Минимизируйте беспорядок на фоне и оставьте немного пространства сверху, чтобы медленное приближение казалось естественным. - Подсказка Используйте одну краткую позитивную подсказку, чтобы описать кадр со временем, включая реплики, дыхание, микродвижения и слышимые события. Сосредоточьте негативную подсказку на удалении артефактов, а не на контроле стиля. Не повторяйте детали, уже видимые на изображении, так как это может снизить четкость и стабильность.
- Подготовка скрытых LTX График создает пустые скрытые видео и аудио, которые соответствуют вашим настройкам, объединяет их в один AV скрытый и прикрепляет вашу позитивную и негативную кондиционировку с выбранной частотой кадров. Это сохраняет синхронизацию времени, движения и аудио с самого начала.
- Сэмплер — Первый проход Первый проход использует
CFGGuider(#129) с сэмплером, оптимизированным по скорости, чтобы сгенерировать согласованный низкорез AV скрытый. Этот этап фиксирует поведение камеры крупным планом, темп речи и базовую синхронизацию губ. Считайте это повествовательным проходом, который устанавливает, что происходит. - Сэмплер — Второй проход увеличения AV скрытый разделяется, и видео путь увеличивается x2 с помощью
LTXVLatentUpsampler(#118). Идентичность перепроецируется сLTXVImgToVideoInplace(#160), чтобы сохранить лицо стабильным при большем размере, затем аудио и видео соединяются и уточняются с сэмплером, ориентированным на четкость. Этот проход улучшает детали, уменьшает мерцание и полирует вид LTX 2.3 Крупные планы. - Декодирование Видео кадры декодируются с помощью плиточного VAE для экономии памяти, аудио декодируется через аудио VAE, и
VHS_VideoCombineобъединяет все в H.264 MP4 со стандартным форматом пикселей 4:2:0. Вы можете предварительно просмотреть аудио во время итерации и обрезать окончательную длительность, чтобы она соответствовала сгенерированной речи. - Опционально Если VRAM ограничен, включите опцию с подачей по частям, чтобы обменять немного скорости на стабильность. Для более быстрого этапа разработки используйте маленький предварительный VAE. Пользователи с несколькими GPU могут воспользоваться патчером последовательного параллелизма, чтобы поддерживать длинные последовательности плавными.
Основные узлы в рабочем процессе ComfyUI LTX 2.3 Крупные планы#
LTXVImgToVideoInplace(#161 и #160) Закрепляет портрет в скрытом видео, чтобы лицо оставалось стабильным, пока играют тонкие приближения и микродвижения. Держите его активным для изображения-видео; переключайте егоbypassтолько при использовании режима текст-видео. Для лучших результатов LTX 2.3 Крупные планы начните с четкого, равномерно освещенного эталона и избегайте перекрытия рта.LTXVLatentUpsampler(#118) Применяет родной LTX 2.3 x2 пространственный увеличитель в скрытом пространстве перед уточнением второго прохода. Это сохраняет согласованность движения при увеличении детализации. Для крупного плана, сохранение увеличения на x2 обычно предлагает лучший баланс между четкостью и стабильностью.CFGGuider(#129 и #103) Объединяет вашу позитивную и негативную кондиционировку в единый сигнал управления для обеих модальностей. Небольшие корректировки силы управления могут укрепить или ослабить приверженность вашему сценарию и кадрированию. Если вы увеличиваете управление, подумайте о небольшом смягчении негативного списка, чтобы избежать чрезмерного ограничения выражений.SamplerCustomAdvanced(#113 и #119) Первый проход предпочитает стратегию, ориентированную на скорость, чтобы быстро установить движение и аудио, в то время как второй проход переключается на стратегию, ориентированную на четкость, чтобы улучшить детали. Если вы меняете стратегию сэмплера, держите первый проход быстрым, а второй проход точным, чтобы LTX 2.3 Крупные планы сохранял свой кинематографический блеск.LTX2_NAG(#342) Вводит шумосознательное руководство, которое балансирует видео и аудио кондиционирование. Увеличение акцента на видео может укрепить кадрирование и позу; увеличение акцента на аудио может усилить синхронизацию губ. Настраивайте консервативно и в тандеме сCFGGuider, чтобы избежать чрезмерного ограничения.LTXVConditioning(#107 и #22) Связывает ваши подсказки и частоту кадров с временной шкалой скрытого. Поддерживайте одну, сцену-уровневую позитивную подсказку и компактную негативную подсказку для наиболее чистого выравнивания. Прикрепленная частота кадров обеспечивает синхронизацию темпа речи и движения.VHS_VideoCombine(#140) Кодирует конечный результат в MP4 со стандартными настройками воспроизведения. Для доставки повысьте качество, снизивcrf; для редактирования включитеtrim_to_audio, чтобы длина клипа точно соответствовала сгенерированной речи.
Дополнительные опции#
- Советы по кадрированию для LTX 2.3 Крупные планы Обрежьте так, чтобы глаза располагались ближе к верхней трети, оставьте немного пространства сверху и держите рот полностью видимым, чтобы улучшить синхронизацию губ. Избегайте сильного заднего света или тяжелых фильтров на эталоне.
- Подсказки, которые работают Пишите, что происходит со временем, включая слышимые моменты, такие как дыхание, смех и тон комнаты. Исключите атрибуты, уже присутствующие на изображении. Держите негативный список коротким и практичным.
- Размеры и производительность Если у вас мало VRAM, попробуйте сначала умеренные базовые размеры, затем позвольте второму проходу увеличить. Размеры, которые соответствуют сеточным ограничениям LTX, будут сэмплироваться более предсказуемо, и более высокие частоты кадров требуют большего вычислительного ресурса.
- Итерационный рабочий процесс Заблокируйте изображение и подсказку, итерационно выполняйте первый проход, пока движение и чтение не будут правильными, затем переходите ко второму проходу для детализации. Используйте маленький предварительный VAE, чтобы ускорить проверки, и включайте полное декодирование только тогда, когда вы готовы к экспорту.
- Когда использовать T2V Переключайтесь в режим текст-видео для дополнительных кадров и абстрактных крупных планов, управляемых исключительно повествованием. Для кадров с акцентом на идентичность, держите портретный путь включенным, чтобы сохранить эстетику LTX 2.3 Крупные планы.
Благодарности#
Этот рабочий процесс реализует и основывается на следующих работах и ресурсах. Мы искренне благодарим Lightricks за модель LTX‑2.3, LTX Docs за руководство по рабочему процессу изображение-видео, QuantStack за квантования LTX‑2.3‑GGUF и iiTzMYUNG за демонстрацию исходного кода LTX 2.3 за их вклад и поддержку. Для авторитетных деталей, пожалуйста, обращайтесь к оригинальной документации и репозиториям, указанным ниже.
Ресурсы#
- Lightricks/LTX-2.3
- GitHub: Lightricks/LTX-2
- Hugging Face: Lightricks/LTX-2.3
- arXiv: arXiv:2601.03233
- LTX Docs/Image-to-Video Workflow Guide
- GitHub: Lightricks/ComfyUI-LTXVideo
- Docs / Release Notes: Image-to-Video Workflow Guide
- QuantStack/LTX-2.3-GGUF
- Hugging Face: QuantStack/LTX-2.3-GGUF
- iiTzMYUNG/LTX 2.3 Close-Up Shots Are Absolutely Insane!
- Docs / Release Notes: LTX 2.3 Close-Up Shots Are Absolutely Insane!
Примечание: Использование указанных моделей, датасетов и кода подлежит соответствующим лицензиям и условиям, предоставленным их авторами и поддерживающими.

