LTX 2.5 ComfyUI Text to Video: от подсказки к видео с синхронизированным звуком#
LTX 2.5 ComfyUI Text to Video — это workflow, готовый к запуску в RunComfy, который превращает короткую письменную подсказку в кинематографическое видео с выровненной аудиодорожкой. Он сочетает в себе дистиллированный трансформер Lightricks’ LTX-2.5 для генерации текста в видео, компактные VAE для видео/аудио для реконструкции, латентный апскейлер для более четких деталей и усиление подсказок на основе Gemma для более сильного соответствия подсказкам.
Создан для создателей, которые хотят быструю, локальную итерацию внутри ComfyUI, этот график отлично подходит для атмосферных сцен, продуктовых снимков, моментов с персонажами и настроенческих фрагментов. С LTX 2.5 ComfyUI Text to Video вы можете перейти от идеи к предварительному просмотру за считанные минуты, а затем уточнить движение, внешний вид и тайминг, не покидая RunComfy.
Ключевые модели в workflow Comfyui LTX 2.5 ComfyUI Text to Video#
- Lightricks LTX-2.5. Основной дистиллированный трансформер, который синтезирует временно согласованное видео из текста. Он балансирует верность подсказкам и реализм движения, сохраняя быструю инференцию. Смотрите официальную модельную карту на Lightricks/LTX-2.5 и референсный пайплайн на Lightricks/LTX-2.5-Diffusers.
- Google Gemma 2 Instruct. Компактная языковая модель, настроенная на инструкции, используется для расширения и уточнения пользовательских подсказок перед генерацией, улучшая руководство по стилю и намерение съемки. Представительный контрольный пункт — google/gemma-2-9b-it.
- Центр организации Lightricks. Центральный список для выпусков и обновлений LTX в семействе текст-видео, полезный для заметок о модели и известных поведений: huggingface.co/Lightricks.
Как использовать workflow Comfyui LTX 2.5 ComfyUI Text to Video#
Этот workflow следует чистому пути от подсказки к видео: улучшение подсказок, текстовая кондиционирование, латентный синтез видео, апскейлинг, декодирование, выравнивание звука и экспорт. Разделы ниже объясняют каждый этап простым языком, чтобы вы знали, что изменять и почему.
Подсказки и пресеты#
Начните с написания краткой подсказки, в которой указаны субъект, обстановка, освещение, ощущение объектива или камеры и намерение движения. При необходимости добавьте отрицательную подсказку, чтобы избежать нежелательных элементов. Выберите стиль пресета, если он предоставлен, чтобы быстро установить цветовые и контрастные тенденции. Если график раскрывает контроль семени, держите семя стабильным, пока вы изменяете формулировку, чтобы различия отражали ваши правки, а не случайность. LTX 2.5 ComfyUI Text to Video выигрывает от явных глаголов движения, таких как "медленный дольли вперёд", "ручная съёмка" или "лёгкий ветерок".
Текстовая кондиционирование#
Ваша подсказка токенизируется и кодируется, затем слегка переписывается Gemma, чтобы усилить намерение и убрать двусмысленность. Улучшенный текст создаёт векторы кондиционирования, которые видео-модель использует для определения макета, внешнего вида субъекта и движущих подсказок. Держите описания конкретными и визуальными; избегайте длинных списков модификаторов, конкурирующих друг с другом. Если вам нужна консистентная идентичность или брендинг, разместите эти термины в начале подсказки. На этом этапе LTX 2.5 ComfyUI Text to Video фиксирует значение, прежде чем будут сгенерированы какие-либо пиксели.
Латентный синтез видео#
Рабочий процесс инициализирует латентный таймлайн, соответствующий вашему выбранному аспектному соотношению и продолжительности. LTX-2.5 итеративно убирает шум из этого латентного видео, вплетая структуру, движение и внешний вид в каждый кадр, сохраняя временную согласованность. Более короткие кадры сходятся быстрее и их легче направлять; увеличивайте продолжительность только после того, как вам понравится первый акцент. Используйте отрицательные подсказки, чтобы подавить артефакты, такие как лишние конечности, мерцание или текстовые наложения. Цель здесь — чистый, соответствующий задаче латентный клип, который уже читается как ваша предполагаемая сцена.
Движение и тайминг#
Во время удаления шума модель балансирует пространственные детали с плавным движением. Сильные подсказки о движении в вашей подсказке помогают избежать статичных клипов; слишком много требований к мелкой текстуре может снизить ясность движения. Если график включает контроль силы движения, увеличьте его для динамичных кадров и уменьшите для портретов или макрокадров продуктовых углов. При тестировании вариаций изменяйте один элемент за раз, чтобы можно было приписать различия конкретной правке. LTX 2.5 ComfyUI Text to Video обычно вознаграждает чёткие глаголы камеры и фокус на одном субъекте.
Латентный апскейлинг#
Специальный латентный апскейлер уточняет детали, не нарушая временной стабильности. Включите этот проход, когда базовое движение и композиция выглядят правильно. Если подсветка расплывается или края излишне заострены, слегка уменьшите силу и перезапустите; если изображение кажется мягким, увеличьте её. Апскейлинг после того, как движение стабилизируется, лучше сохраняет согласованность, чем начинать с более высокого базового разрешения. Этот этап придаёт LTX 2.5 ComfyUI Text to Video его чёткость без введения мерцания.
Декодирование и цвет#
Видео VAE декодирует латенты в кадры, применяя цветовое пространство и тональную карту, подходящую для предварительного просмотра и экспорта. Если доступно, выберите профиль внешнего вида, который соответствует вашему намерению: нейтральный для дальнейшей градации, кинематографический для готовых к обмену ежедневников. Небольшая полоса или мерцание часто указывает на слишком агрессивное усиление выше по потоку; настройте силу апскейлера, а не принуждайте более тяжёлый постконтраст. Держите соотношение сторон постоянным во всех запусках, чтобы справедливо сравнивать результаты. Декодирование — это место, где ваши кадры становятся пикселями, которые вы можете оценить.
Генерация и синхронизация звука#
Аудиомодуль генерирует лёгкий саундтрек из той же подсказки и выравнивает его с временной шкалой видео. Используйте слова настроения, такие как "зловещий дрон", "весёлый синтез" или "мягкий дождевой фоли", чтобы направлять основу. Если workflow раскрывает аудиопереключатель, вы можете отключить его во время исследования движения, затем включить его для финалов. Лёгкие изменения подсказок могут изменить ритм и интенсивность; зафиксируйте ваш визуальный seed при прослушивании вариаций аудио. Цель — связное аудио, которое поддерживает сцену, не противореча ей.
Экспорт и обзор#
Выберите контейнер и пресет кодека для компактного предварительного просмотра или более качественного файла для обмена. Если график включает экспорт кадров, вы можете проверить отдельные кадры на наличие артефактов, прежде чем приступать к полному запуску. Храните запись подсказки, seed и любых переключателей, чтобы вы могли воспроизвести или разветвить идеи. Для социальных или продуктовых обзоров используйте пресет предварительного просмотра; для роликов или клиентских презентаций используйте высококачественный пресет. LTX 2.5 ComfyUI Text to Video оптимизирован, чтобы вы могли быстро итерировать, затем апскейлить и экспортировать, когда готовы.
Дополнительные возможности#
- Пишите подсказки на языке съёмки: субъект + обстановка + освещение + объектив + движение (например, "герой продукта на мраморе, мягкое заднее освещение, 50 мм, медленный арк влево").
- Предпочитайте один решительный стиль, чем много слабых. Слишком много прилагательных размывают руководство.
- Используйте отрицательные подсказки, чтобы подавить текстовые наложения, чрезмерное зерно или формы, похожие на логотипы, когда они не нужны.
- Заблокируйте seed, чтобы сравнить правки подсказок; измените seed, чтобы исследовать свежие композиции.
- Начните с коротких, затем увеличивайте продолжительность, когда движение читается ясно; более длинные клипы усугубляют мелкие проблемы.
- Если лица центральны, держите движение камеры мягким и освещение стабильным, чтобы уменьшить временной дрейф.
- Для чистых экспортов избегайте изменения размера в посте; установите соотношение и разрешение в графике и держите их постоянными.
Этот workflow LTX 2.5 ComfyUI Text to Video разработан, чтобы помочь вам получить убедительное движение, чёткие детали и выровненный звук с минимальными настройками. Быстро итерируйте, направляйте с чётким намерением и позвольте графику справляться с тяжёлой работой от текста к видео.
Благодарности#
Этот workflow реализует и основывается на следующих работах и ресурсах. Мы с благодарностью признаём Comfy.org за исходный шаблон workflow, Lightricks за веса модели LTX-2.5 и проект LTX-2.5 Diffusers за их вклад и поддержку. Для авторитетных деталей, пожалуйста, обратитесь к оригинальной документации и репозиториям, указанным ниже.
Ресурсы#
- Comfy.org/Source workflow template
- Документы / Примечания к выпуску: Source workflow template
- Lightricks/LTX-2.5
- Hugging Face: Lightricks/LTX-2.5
- Lightricks/LTX-2.5-Diffusers
- Hugging Face: Lightricks/LTX-2.5-Diffusers
- Lightricks/Hugging Face organization
- Hugging Face: Lightricks
Примечание: использование указанных моделей, наборов данных и кода подлежит соответствующим лицензиям и условиям, предоставленным их авторами и владельцами.

