LTX 2.5 First Last Frame to Video: двухкадровые кинематографические клипы с синхронизированным аудио#
Этот рабочий процесс, готовый к RunComfy, превращает совпадающие начальное и конечное изображение в короткое кинематографическое видео с синхронизированным аудио. Управляя генерацией от ваших первых и последних кадров, он сохраняет композицию, освещение, идентичность объекта и стиль, создавая последовательное движение между ними. LTX 2.5 First Last Frame to Video идеально подходит для контролируемых действий персонажей, продуктовых кадров, движений камеры и переходов сцен внутри ComfyUI.
Внутри он объединяет трансформер Lightricks’ LTX-2.5 с выделенными видео- и аудио-VAE, а также усилителем подсказок на основе Gemma. График поставляется с четкими группами для Подсказки, Настроек видео, Подготовки первого/последнего кадра, Условий, Семплирования и Декодирования, чтобы вы могли получить надежные, повторяемые результаты без необходимости трогать низкоуровневую проводку.
Ключевые модели в рабочем процессе Comfyui LTX 2.5 First Last Frame to Video#
- Lightricks LTX-2.5 дистиллированный трансформер. Основной генератор видео, который изучает движение, внешний вид и временную согласованность из текстовых и визуальных гидов. Model page
- LTX-2.5 Video VAE. Сжимает и декодирует латенты видео для четких кадров, сохраняя при этом практическое использование памяти. Включено в репозиторий LTX-2.5. Model page
- LTX-2.5 Audio VAE. Генерирует и восстанавливает синхронизированные аудио-латенты для соответствия визуальным событиям. Включено в репозиторий LTX-2.5. Model page
- Gemma 4 12B текстовый энкодер с проекцией для LTX-2.5. Кодирует вашу подсказку в насыщенные условия, охватывающие объекты, действия, освещение и направление камеры. Включено в активы LTX-2.5. Model page
- Gemma 4 E2B вариант с настройкой инструкций для улучшения подсказок. Расширяет короткие вводы в кинематографические направления, когда включено улучшение. Model page
- Опциональная ссылка на Diffusers для LTX-2.5 конвейеров и поведения расписания. Полезно для понимания компромиссов семплирования. Project page
Как использовать рабочий процесс Comfyui LTX 2.5 First Last Frame to Video#
Рабочий процесс берет два изображения в качестве якорей, преобразует их в руководство, затем удаляет шум в видео- и аудио-латентах под текстовым контролем перед декодированием в готовый для совместного использования клип. Каждая группа ниже выполняет определенную роль; большинство пользователей коснется только Подсказки, Улучшения подсказок и Настроек видео.
Подсказка#
Напишите краткую, но описательную инструкцию в узле Prompt (#252). Положительный текст кодируется CLIPTextEncode (#222) с использованием энкодера Gemma 4 12B, чтобы модель понимала объекты, действия, освещение и намерение камеры. Описывайте конечное состояние, а также начальный удар, чтобы помочь модели уважать оба якоря. Если вам нужны строгие формулировки или брендовые термины, напишите их явно в подсказке.
Улучшение подсказок#
Короткие подсказки могут быть автоматически расширены с помощью TextGenerateLTX2Prompt (#247). Узел ComfySwitchNode (#248) направляет либо вашу необработанную подсказку, либо улучшенный текст в энкодер, а PreviewAny (#249) позволяет вам просмотреть окончательный текст. Включите улучшение, когда хотите кинематографические фразы и более богатые подсказки движения; отключите его, когда формулировка подсказки должна оставаться точной.
Настройки видео#
Установите длину клипа, частоту кадров и разрешение с помощью Duration (#198), Frame Rate(int) (#205), Width (#215) и height (#216). График вычисляет общее количество кадров через ComfyMathExpression (#226) и выделяет латенты видео в EmptyLTXVLatentVideo (#201) и латенты аудио в LTXVEmptyLatentAudio (#197). Более высокое разрешение или частота кадров увеличивает использование VRAM и время; начните скромно, затем увеличивайте, как только вы останетесь довольны движением.
Первый кадр#
Загрузите ваше начальное изображение, которое изменяется в ResizeImageMaskNode (#213) для соответствия целевому разрешению. LTXVPreprocess (#199) нормализует тон и детали для стабильного руководства. Чистые, хорошо экспонированные и композиционно четкие изображения позволяют модели быстрее фиксироваться и уменьшают непреднамеренный дрейф от якоря.
Последний кадр#
Загрузите ваше конечное изображение; оно изменяется в ResizeImageMaskNode (#214) и нормализуется в LTXVPreprocess (#195). Постарайтесь, чтобы соотношение сторон, перспектива и масштаб объекта соответствовали первому кадру, чтобы переход казался физически правдоподобным и якорь сохранялся в конце.
Условие#
Текстовые условия составляются в LTXVConditioning (#202), который также получает целевую частоту кадров, чтобы синхронизация совпадала между ветвями. Руководство по изображениям прикрепляется в два прохода с LTXVAddGuide (#206) для первого кадра и LTXVAddGuide (#204) для последнего кадра, гарантируя, что оба якоря влияют на траекторию. LTXVCropGuides (#200) уравнивает любые остаточные различия размеров, чтобы линии руководства идеально совпадали с латентным холстом.
Семплирование#
Шум засеивается в RandomNoise (#196), и денойзинг осуществляется SamplerCustomAdvanced (#211) с помощью SamplerEulerAncestral (#208) и расписания ManualSigmas (#239) для четких, стабильных в движении обновлений. Руководство обеспечивается LTXVDualCFGGuider (#235), управляемым UNETLoader (#230), сочетая положительные и отрицательные условия, чтобы направлять внешний вид и движение. Латенты аудио и видео объединяются и позже разделяются с помощью LTXVConcatAVLatent (#210) и LTXVSeparateAVLatent (#221), чтобы движение и звук развивались вместе.
Декодирование и вывод#
Латенты декодируются в кадры с помощью VAEDecodeTiled (#219) с использованием видео-VAE и в аудио с помощью LTXVAudioVAEDecode (#220) с использованием аудио-VAE. CreateVideo (#218) объединяет изображения и аудио с вашей выбранной частотой кадров для создания финального клипа. В верхнем графике SaveVideo (#68) записывает результат; переименуйте или измените местоположение там, если нужно.
Ключевые узлы в рабочем процессе Comfyui LTX 2.5 First Last Frame to Video#
TextGenerateLTX2Prompt (#247)#
Расширяет краткие вводы в кинематографическую, совместимую с LTX подсказку. Используйте его, когда хотите более богатые глаголы, язык освещения и камеры с минимальными усилиями. Если вам нужна точная формулировка или безопасные для бренда формулировки, отключите улучшение через ComfySwitchNode (#248) и предоставьте окончательный текст самостоятельно.
LTXVDualCFGGuider (#235)#
Комбинирует модель LTX-2.5 с положительными и отрицательными условиями для баланса соблюдения и свободы. Увеличьте руководство для более сильной точности подсказок и якорей; уменьшите его для более свободного, органичного движения. Чрезмерно высокое руководство может чрезмерно ограничить движение или вызвать насыщение, поэтому настраивайте параллельно с силой вашей отрицательной подсказки.
SamplerCustomAdvanced (#211)#
Запускает цикл денойзинга с использованием SamplerEulerAncestral (#208) и выбранного расписания сигм. Используйте более короткие расписания для тестов скорости и более длинные, когда вам нужно больше сохранения деталей в движении. Если движение выглядит дерганым, попробуйте более гладкий наклон сигм или слегка уменьшите руководство, чтобы уменьшить чрезмерную коррекцию между шагами.
ManualSigmas (#239)#
Определяет расписание шума, которое обменивает четкость на временную плавность. Шум с начала может стимулировать более крупные движения на ранних этапах, в то время как более мягкий хвост может сохранить детали около конечного якоря. Настраивайте только после того, как вы довольны подсказкой и якорями.
VAEDecodeTiled (#219)#
Декодирует латенты видео в изображения с использованием плиточной обработки, чтобы вместить более высокие разрешения в память. Меньшие плитки сокращают использование VRAM, но могут вызвать швы плиток; более крупные плитки чище, но тяжелее. Держите разрешение и размер плиток в балансе для вашего GPU.
LTXVAudioVAEDecode (#220)#
Восстанавливает синхронизированную аудиодорожку из аудио-латентов. Чтобы экспортировать немой клип, временно отключите аудиоветвь внутри подграфика перед CreateVideo (#218). Если финальный звук кажется слишком насыщенным, уменьшите плотность действий в подсказке, чтобы аудиомодель следовала за более простым ритмом.
RandomNoise (#196)#
Засеивает генерацию. Для воспроизводимых результатов откройте подграфик и установите фиксированное семя вместо рандомизации. При исследовании вариантов движения от тех же якорей и подсказки варьируйте семя, чтобы испытать разные траектории.
Дополнительные советы#
- Для самых чистых переходов держите первые и последние кадры в одном соотношении сторон, горизонте и масштабе объекта; несоответствия заставляют модель искажать геометрию.
- Описывайте движение явно: "начинается с поворота влево, поворачивается к камере, рука открывается, синий кристалл поднимается над ладонью" звучит лучше, чем только стильная подсказка.
- Длительность и FPS взаимодействуют; увеличение обоих повышает использование памяти и время рендеринга. Растягивайте по одному за раз и предварительно просматривайте перед увеличением.
- Если края мерцают, уменьшите количество прилагательных мелкой текстуры в подсказке или слегка уменьшите руководство, чтобы повысить временную стабильность.
- Чтобы ускорить итерацию, тестируйте при меньшем разрешении, затем увеличивайте ширину и высоту, когда движение и кадрирование заблокированы.
- Когда вам нужны бренд-идеальные конечные кадры, подчеркивайте их в подсказке и держите последний кадр чистым и с высоким контрастом, чтобы LTX 2.5 First Last Frame to Video мог надежно зафиксироваться.
Благодарности#
Этот рабочий процесс реализует и основывается на следующих работах и ресурсах. Мы искренне благодарим Comfy.org за шаблон исходного рабочего процесса, Lightricks за веса модели LTX-2.5 и проект Lightricks для LTX-2.5 Diffusers за их вклад и поддержку. Для получения авторитетной информации, пожалуйста, обратитесь к оригинальной документации и репозиториям, ссылка на которые приведена ниже.
Ресурсы#
- Comfy.org/Source workflow template
- Документы / Примечания к выпуску: Source workflow template
- Lightricks/LTX-2.5
- Hugging Face: Lightricks/LTX-2.5
- Lightricks/LTX-2.5-Diffusers
- Hugging Face: Lightricks/LTX-2.5-Diffusers
- Lightricks/Hugging Face organization
- Hugging Face: Lightricks
Примечание: использование упомянутых моделей, наборов данных и кода подчиняется соответствующим лицензиям и условиям, предоставленным их авторами и поддерживающими.

