LTX 2.5 ComfyUI Изображение в Видео с Синхронизированным Аудио#
Этот готовый к RunComfy рабочий процесс LTX 2.5 ComfyUI превращает один первый кадр и подсказку движения в короткое кинематографическое видео с согласованным аудио в модели. Он работает на семействе Lightricks LTX-2.5, объединяя Pixel Diffusion, усилитель подсказок на основе Gemma, видео и аудио VAE, а также латентное повышение разрешения для четкого движения и сильного следования подсказкам.
Используйте этот граф LTX 2.5 ComfyUI для анимации портретов, атмосферных локаций, продуктов, животных и концептуальных снимков, оставаясь внутри ComfyUI. Предоставьте начальное изображение, опишите действие и камеру, установите продолжительность и частоту кадров и создайте кадр, который сохраняет характер, освещение и стиль на протяжении всех кадров.
Ключевые модели в рабочем процессе Comfyui LTX 2.5 ComfyUI#
- Дистиллированный трансформер Lightricks LTX-2.5. Основной генератор изображений в видео создает временно согласованное движение и объединяет аудиовизуальные латенты. Карта модели: Lightricks/LTX-2.5.
- Видео VAE LTX-2.5. Декодирует видео латенты в кадры с более высоким качеством и меньшим количеством пятен при быстром движении. Веса: ltx-2.5-video-vae-bf16.safetensors.
- Аудио VAE LTX-2.5. Генерирует синхронизированное аудио, соответствующее визуальному действию и времени. Веса: ltx-2.5-audio-vae-bf16.safetensors.
- Текстовый энкодер Gemma 4 12B с проекцией LTX. Интерпретирует богатые, многообъектные подсказки и направления камеры. Веса: gemma4-12b-with-proj-ltx-2.5-comfy-int8-convrot.safetensors.
- Вариант инструкции Gemma 4 E2B для Усилителя Подсказок. Расширяет короткие подсказки в кинематографические направления с низкими вычислительными затратами. Веса: gemma4_e2b_it_bf16.safetensors.
- Латентный пространственный апскейлер LTX-2.5 x2. Увеличивает детали, увеличивая разрешение в латентном пространстве перед декодированием. Веса: ltx-2.5-latent-spatial-upscaler-x2-bf16-1.0.safetensors.
- Эталонная реализация для конвейеров и планировщиков: LTX-2.5 Diffusers.
Как использовать рабочий процесс Comfyui LTX 2.5 ComfyUI#
Этот рабочий процесс расширяет и обусловливает вашу подсказку, создает видео и аудио латенты, выполняет проход с низким разрешением, выполняет латентное повышение разрешения, затем декодирует в кадры и синхронизированное аудио для окончательного смешивания. Верхний контроллер - это Image to Video (LTX-2.5) (#398), который принимает ваш первый кадр, текстовую подсказку и ключевые настройки, затем маршрутизирует в подграф.
Предварительная обработка изображения#
Предоставьте свое начальное изображение в Load First Frame (#395). Кадр стандартизируется в LTXVPreprocess (#350) до чистого, дружественного к модели базового значения. Используйте ResolutionSelector (#403) для выбора аспекта и масштаба; он выводит ширину и высоту, выровненные по дружественным к модели кратным значениям. Хорошие первые кадры четкие, хорошо освещенные и скомпонованы для описываемого вами движения. Предварительный процессор избегает разрушительных изменений, подготавливая изображение для латентной выборки.
Усиление Подсказок#
Напишите свою подсказку движения и камеры в Prompt (#376). Если вы включите встроенный усилитель, TextGenerateLTX2Prompt (#380) обогатит ваш текст деталями о действиях, непрерывности и кадрировании с использованием модели на основе Gemma. Переключатель ComfySwitchNode (#382) позволяет вам маршрутизировать либо ваш исходный текст, либо улучшенную версию для кондиционирования. Этот шаг улучшает следование подсказкам для коротких вводов и помогает поддерживать объекты и стиль на протяжении всех кадров. Вы можете предварительно просмотреть расширенный текст в PreviewAny (#381) перед рендерингом.
Модель#
Подграф загружает дистиллированный генератор в UNETLoader (#384) и декодеры в VAELoader для видео (#385) и аудио (#386). Модель латентного апскейлера подготавливается LatentUpscaleModelLoader (#371) для чистого прохода с деталями x2 позже. Этот блок гарантирует использование одного и того же семейства моделей LTX-2.5 на всех этапах кодирования, выборки и декодирования, что сохраняет временную согласованность.
Подсказка#
CLIPLoader (#387) и CLIPTextEncode положительный (#364) превращают вашу описательную подсказку в кондиционирование. Специальный отрицательный энкодер (#373) подавляет нежелательные черты, такие как низкое качество или артефакты. LTXVConditioning (#365) объединяет текстовое кондиционирование с выбранной вами частотой кадров, чтобы руководство по времени поступало в аудиовизуальный латентный поток. Сохранение ясного языка камеры и действий приводит к более стабильному движению и возможности редактирования.
Настройки Видео#
Продолжительность, ширина, высота, частота кадров и начальное значение устанавливаются в группе Video Settings (например, Duration (#362) и Frame Rate (#361)). Простые математические помощники вычисляют общее количество кадров и передают единообразные значения, где это необходимо. Выберите частоту кадров, которая соответствует желаемому ощущению; медленное действие может выглядеть лучше при низкой частоте кадров, в то время как быстрое движение выигрывает от более высокой частоты кадров. Для воспроизводимых кадров зафиксируйте начальное значение; измените его, чтобы исследовать альтернативы.
Пустой Латент#
EmptyLTXVLatentVideo (#356) создает видео латент нужного размера и длины, в то время как LTXVEmptyLatentAudio (#366) создает аудио латент, выровненный по времени. Это гарантирует, что видео и аудио потоки с самого начала разделяют время. С длиной, определенной по продолжительности и частоте кадров, выборщик получает правильно сформированные тензоры. Результат - синхронизированная основа для совместного аудиовизуального устранения шума.
Генерация с Низким Разрешением#
Первый проход выборки создает согласованное движение при управляемом разрешении. LTXVDualCFGGuider (#388) применяет руководство с двойной модальностью, чтобы как текст, так и время формировали видео и аудио латенты вместе. SamplerCustomAdvanced (#344) выполняет шаги диффузии с выбранным вами выборщиком и расписанием, засеянным RandomNoise (#339). Ограничение первого кадра обеспечивается LTXVImgToVideoInplace (#357), который сохраняет идентичность, освещение и композицию, закрепленные за предоставленным вами изображением. После выборки LTXVConcatAVLatent и LTXVSeparateAVLatent перемешивают аудио и видео латенты по мере необходимости для следующих этапов.
Латентное Повышение Разрешения#
LTXVLatentUpsampler (#348) выполняет повышение разрешения в латентном пространстве x2, чтобы улучшить текстуры и микродетали перед декодированием. LTXVImgToVideoInplace (#349) повторно выравнивает увеличенный латент с начальным кадром, чтобы идентичность и макет оставались устойчивыми. Выполнение этого в латентном пространстве лучше сохраняет временную плавность, чем изменение размера в пиксельном пространстве. Этот этап значительно способствует окончательной четкости.
Генерация с Высоким Разрешением#
Рефинементный выборщик (KSamplerSelect (#341) плюс SamplerCustomAdvanced (#368)) работает на увеличенном латенте с более коротким расписанием, стабилизируя края и обогащая детали. LTXVDualCFGGuider (#391) сохраняет руководство, согласованное с вашим текстом, при этом сохраняя движение, установленное на первом проходе. Затем объединенный латент разделяется LTXVSeparateAVLatent (#369) для декодирования. VAEDecodeTiled (#374) превращает видео латент в кадры, а LTXVAudioVAEDecode (#358) производит синхронизированное аудио.
Рендеринг и Сохранение#
CreateVideo (#370) соединяет кадры и аудио с выбранной вами частотой кадров в один видео поток. На внешнем графе SaveVideo (#75) записывает результат в ваш обычный выход ComfyUI. Вы также можете прослушать только аудио через узел предварительного просмотра в верхнем уровне обертки перед полными рендерами.
Ключевые узлы в рабочем процессе Comfyui LTX 2.5 ComfyUI#
Image to Video (LTX-2.5) (#398)#
Это универсальный контроллер для всего конвейера. Предоставьте первый кадр, вашу подсказку, продолжительность, разрешение, частоту кадров и возможность включения усиления подсказок. Используйте его для быстрой итерации; когда вы будете готовы к точной настройке, нажмите Enter subgraph, чтобы настроить выборщики, руководство и декодирование. Если вам нужно только текстовое видео, откройте подграф и переключите внутренний обход текст-видео на узлах изображение-видео.
LTXVDualCFGGuider (#388)#
Применяет руководство без классификатора через совместный аудиовизуальный латент, балансируя следование подсказкам с временной стабильностью. Увеличьте руководство для более сильного следования подсказкам и более выразительного движения; уменьшите его, чтобы снизить мерцание или сохранить больше нюансов начального кадра. Держите руководство видео и аудио в одном диапазоне, чтобы саундтрек оставался согласованным с действием на экране.
SamplerCustomAdvanced (#344)#
Управляет диффузией с выбранным вами выборщиком и пользовательским расписанием сигмы. Используйте этот узел, чтобы исследовать качество движения по сравнению со стабильностью, переключая варианты выборщика или редактируя расписания. Соедините его с фиксированным начальным значением, чтобы сравнить настройки "яблоко к яблоку", затем случайно измените начальное значение, чтобы найти лучший дубль.
LTXVLatentUpsampler (#348)#
Увеличивает разрешение в латентном пространстве с помощью специальной модели LTX-2.5 x2, улучшая детали без введения временного колебания. Если вы планируете сильное обрезание или плотные крупные планы, держите это включенным, чтобы мелкие детали выжили при декодировании. Для экстремальных ограничений VRAM вы можете обойти повышение разрешения за счет некоторой четкости.
VAEDecodeTiled (#374)#
Декодирует видео латенты высокого разрешения в кадры с использованием тайлинга для контроля использования памяти. На низком VRAM предпочитайте меньшие тайлы, чтобы избежать ошибок из-за нехватки памяти. На высоком VRAM, большие тайлы могут уменьшить швы и ускорить декодирование.
CreateVideo (#370)#
Объединяет декодированные кадры с созданным аудио в один видео поток с выбранной вами частотой кадров. Настройте частоту кадров здесь, чтобы соответствовать творческому замыслу или соответствовать требованиям платформы. Затем смешанный вывод передается на сохранитель во внешнем графе.
Дополнительные опции#
- Держите подсказки краткими, но конкретными: кто/что, действие, движение камеры, освещение, настроение. Пусть Усилитель Подсказок добавит кинематографическую фразировку.
- Избегайте конфликтующих направлений камеры. Одно сильное движение (вперед, панорамирование, движение камеры) обычно дает более стабильные результаты, чем наложение нескольких.
- Используйте чистые, высококонтрастные первые кадры для портретов и снимков продуктов; модель лучше сохранит идентичность и края.
- Начинайте с умеренных длительностей, чтобы настроить движение и кадрирование; продлите только после того, как вам понравится поведение.
- Если выходы выглядят мягкими, проверьте, совпадают ли ширина и высота с кратными 32 и держите латентный апскейлер включенным.
- Для согласованных итераций зафиксируйте начальное значение. При исследовании альтернатив измените начальное значение, сохраняя другие настройки нетронутыми.
Благодарности#
Этот рабочий процесс реализует и основывается на следующих работах и ресурсах. Мы признательны Comfy Org за шаблон рабочего процесса LTX-2.5: Изображение в Видео ComfyUI, Lightricks за веса модели LTX-2.5, Lightricks за проект LTX-2.5 Diffusers и Lightricks за ресурсы организации Hugging Face за их вклад и поддержку. Для авторитетных деталей, пожалуйста, обратитесь к оригинальной документации и репозиториям, указанным ниже.
Ресурсы#
- Comfy.org/Source шаблон рабочего процесса
- GitHub: Comfy-Org
- Документы / Примечания к выпуску: Source шаблон рабочего процесса
- Веса модели Lightricks/LTX-2.5
- GitHub: Lightricks/LTX-2
- Hugging Face: Lightricks/LTX-2.5
- arXiv: 2601.03233
- Проект Lightricks/LTX-2.5 Diffusers
- Hugging Face: Lightricks/LTX-2.5-Diffusers
- arXiv: 2601.03233
- Организация Lightricks/Hugging Face
- GitHub: Lightricks
- Hugging Face: [Lightricks](https://hugjson
gingface.co/Lightricks)
Примечание: Использование упомянутых моделей, наборов данных и кода подлежит соответствующим лицензиям и условиям, предоставленным их авторами и поддерживающими организациями.

