ComfyUI>Рабочие процессы>LTX 2.5 GGUF ComfyUI | Кинематографическое преобразование изображений в видео

LTX 2.5 GGUF ComfyUI | Кинематографическое преобразование изображений в видео

Workflow Name: RunComfy/LTX-2.5-GGUF-ComfyUI
Workflow ID: 0000...1501
Преобразуйте исходное изображение в короткое кинематографическое видео. Управляйте движением персонажа, машины или окружения с помощью текстовой подсказки. Генерируйте синхронизированное аудио для каждого кадра. Используйте вывод LTX-2.5 GGUF для снижения требований к памяти. Добавьте латентное увеличение разрешения для более чистых результатов. Создавайте быстрее с помощью готового графа.

LTX 2.5 GGUF ComfyUI Workflow

LTX 2.5 GGUF ComfyUI | Image-to-Video with Synced Audio
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

LTX 2.5 GGUF ComfyUI Examples

LTX 2.5 GGUF ComfyUI преобразование изображений в видео с синхронизированным аудио#

Этот рабочий процесс LTX 2.5 GGUF ComfyUI превращает одно исходное изображение и подсказку на естественном языке в короткое видео с сгенерированной, синхронизированной аудиодорожкой. Он использует официальную модельную семью LTX‑2.5 для генерации видео и аудио, проходящую через GGUF‑квантованный путь UNet для снижения VRAM, сохраняя кинематографическое движение и согласованность сцены.

Граф разработан для быстрого повторения кадров с персонажами, машин и движений окружения. Он включает переключатель для преобразования изображений в видео или текста в видео, двухступенчатый латентный конвейер (грубый проход, затем латентное увеличение разрешения) и декодирование плитками для снижения нагрузки на память. Если вам нужен компактный, готовый к производству путь, этот рабочий процесс LTX 2.5 GGUF ComfyUI является практичной отправной точкой.

Основные модели в рабочем процессе ComfyUI LTX 2.5 GGUF ComfyUI#

  • LTX‑2.5 (официальная, от Lightricks). Основная модель генерации видео и аудио, используемая для синтеза движения и многомодальной направленности. Model card
  • LTX‑2.5 Video VAE (bf16). Кодирует и декодирует латенты видео для эффективной генерации, в паре с основной моделью. Включена в репозиторий LTX‑2.5 в разделе vae/. Video VAE
  • LTX‑2.5 Audio VAE (bf16). Обрабатывает латентный аудиопуть, чтобы финальный рендер включал синхронизированный звук. Включена в репозиторий LTX‑2.5 в разделе vae/. Audio VAE
  • Gemma‑based 12B текстовый кодировщик с проекцией LTX‑2.5. Обеспечивает встраивание подсказок, соответствующих LTX‑2.5, упакованных репозиторием LTX в разделе text_encoders/. Text encoder
  • LTX‑2.5 Latent Spatial Upscaler x2 1.0. Модель суперразрешения в латентном пространстве, которая добавляет детали после грубого прохода. Upscaler
  • LTX‑2.5 Distilled UNet (GGUF квантованный). Квантованные веса UNet загружаются через загрузчик ComfyUI‑GGUF для сокращения использования памяти при сохранении приемлемого качества. GGUF - это формат вывода, а не официальное название модели. ComfyUI‑GGUF

Как использовать рабочий процесс ComfyUI LTX 2.5 GGUF ComfyUI#

Конвейер работает в два этапа: управляемый низкоразрешенный проход для установления движения и времени, за которым следует латентное увеличение разрешения и уточнение в высоком разрешении. Аудио переносится как пара латентов на протяжении всего процесса, затем декодируется и объединяется с финальными кадрами.

Модель#

Загрузите GGUF‑квантованный UNet с помощью UnetLoaderGGUF (#406). Видео и аудио VAE выбираются с помощью VAELoader (#385, #386), а текстовый кодировщик на основе Gemma предоставляется CLIPLoader (#387). Увеличитель разрешения выбирается с помощью LatentUpscaleModelLoader (#371). Эта группа определяет основу, на которой полагаются все другие группы.

Подсказка#

Напишите описание сцены в поле Prompt, сосредоточившись на объектах, движении и одном ясном движении камеры. Текстовый кодировщик встраивает положительные и отрицательные подсказки через LTXVConditioning (#365), который также принимает выбранную частоту кадров для согласования времени. Если вам нужно аудио, похожее на речь, включите короткие цитируемые фразы; аудиопуть будет реагировать на текстовый контекст, оставаясь осведомленным о сцене. Держите подсказки краткими и конкретными, чтобы избежать конфликта направленности.

Настройки видео#

Задайте продолжительность, частоту кадров и целевой размер. Утилиты преобразуют секунды и fps в количество кадров, чтобы граф выделял правильную временную длину. Придерживайтесь размеров, кратных 32, для стабильности и скорости. Используйте селектор разрешения, чтобы выбрать распространенное соотношение сторон, затем настройте его до желаемого масштаба.

Предварительная обработка изображения#

Загрузите первый (эталонный) кадр и позвольте LTXVPreprocess (#350) нормализовать его для LTX‑2.5. Переключатель Switch to Text to Video? (#363) управляет тем, используется ли изображение как пространственный якорь или обходится для чистого преобразования текста в видео. Помощник по изменению размера сохраняет ваш ввод в соответствии с рабочим разрешением. Хорошая предварительная обработка улучшает сохранение идентичности и компоновку.

Пустой латент#

EmptyLTXVLatentVideo (#356) и LTXVEmptyLatentAudio (#366) предварительно выделяют временной холст для видео и аудио. Эти длины зависят от ваших выборов продолжительности и fps. Это разделение обеспечивает синхронизацию видео и аудиопутей по мере их прохождения через выборку и уточнение.

Генерация низкого разрешения#

Первый блок выборки использует LTXVDualCFGGuider (#388) с вашими условиями подсказки для управления движением и динамикой сцены, затем синтезирует грубый латент с SamplerCustomAdvanced (#344). Если вы преобразуете изображение в видео, LTXVImgToVideoInplace (#357) встраивает эталонный кадр в латент для стабилизации идентичности и композиции; он обходится для текста в видео. Этот проход намеренно легче для установления движения и времени перед увеличением разрешения.

Латентное увеличение разрешения#

LTXVSeparateAVLatent (#367) разделяет аудио и видео, чтобы латент видео можно было улучшить с помощью LTXVLatentUpsampler (#348) с моделью x2. Предварительно обработанное изображение при необходимости повторно применяется с LTXVImgToVideoInplace (#349), чтобы сохранить детали после увеличения разрешения. Затем латент аудио повторно прикрепляется через LTXVConcatAVLatent (#340), сохраняя синхронизацию.

Генерация высокого разрешения#

Второй блок выборки (LTXVDualCFGGuider (#391) и SamplerCustomAdvanced (#368)) уточняет детали и временную согласованность на более высоком масштабе. LTXVSeparateAVLatent (#369) передает аудио в LTXVAudioVAEDecode (#358), в то время как латент видео декодируется с VAEDecodeTiled (#374) для снижения пиков VRAM. CreateVideo (#370) собирает кадры и аудио в финальный MP4 с вашей целевой частотой кадров.

Основные узлы в рабочем процессе ComfyUI LTX 2.5 GGUF ComfyUI#

UnetLoaderGGUF (#406)#

Загружает дистиллированный UNet LTX‑2.5 в формате GGUF. Выберите квантованный файл, соответствующий вашему бюджету VRAM; более легкая квантование снижает использование памяти и ускоряет вывод с некоторым снижением качества. Если вы обновитесь до менее квантованного файла, ожидайте более четких текстур и более стабильного мелкого движения.

LTXVImgToVideoInplace (#357 и #349)#

Встраивает первый кадр в латент, чтобы движение развивалось из вашего изображения, а не уходило далеко. Переключите вход bypass, когда переключаетесь между преобразованием изображения в видео и текста в видео. Используйте узел низкого разрешения (#357) для начальной стабилизации и узел высокого разрешения (#349) для повторного закрепления деталей после увеличения разрешения.

LTXVLatentUpsampler (#348)#

Применяет LTX‑2.5 Latent Spatial Upscaler для добавления деталей без декодирования в пиксели. Используйте его, когда хотите больше четкости почти за ту же стоимость памяти, что и грубый проход. Если вы видите мерцание после увеличения разрешения, слегка усилите направленность на следующем этапе уточнения.

ManualSigmas (#397 и #396)#

Управляет расписанием шумоподавления, используемым выборщиками. Более короткие расписания быстрее, но могут снизить приверженность или временную плавность; более длинные или загруженные вперед расписания добавляют стабильности за дополнительную стоимость. Сочетайте это с выбором выборщика, чтобы сбалансировать скорость и качество для вашей сцены.

VAEDecodeTiled (#374)#

Декодирует латентное видео высокого разрешения в кадры с использованием плиток для ограничения использования VRAM. Если у вас заканчивается память, уменьшите размер плитки или включите более сильную плитку; если вы видите швы, увеличьте перекрытие или попробуйте более крупную плитку. Держите свой выбор VAE в соответствии с официальным LTX‑2.5 видео VAE.

CreateVideo (#370)#

Объединяет последовательность изображений и декодированное аудио в окончательный видеофайл. Установите fps, чтобы соответствовать частоте кадров вашего поколения, чтобы избежать растяжения времени. Используйте это как единственную точку рендеринга для согласованных выходов во всех итерациях.

Дополнительные возможности#

  • Для преобразования изображения в видео опишите только одно ясное движение камеры и действие объекта; избегайте нескольких конкурирующих движений.
  • Для преобразования текста в видео держите подсказки краткими и добавляйте короткие цитируемые фразы для аудио, похожего на речь, когда это уместно.
  • Советы по разрешению: придерживайтесь кратных 32; общие размеры 16:9 включают 960x544 (быстро) и 1344x768 или 1504x832 (более четко). Увеличивайте только если у вас есть запас VRAM.
  • Если результаты игнорируют подсказку, увеличьте направленность в блоке выборщика или упростите язык подсказки.
  • Для воспроизводимости между запусками установите фиксированное семя в узле шума; случайные семена лучше всего подходят для исследования.
  • Если VRAM ограничен, предпочтите уровень GGUF Q, который вы можете себе позволить, и держите увеличитель разрешения включенным; он добавляет детали при минимальной стоимости памяти.

Ссылки для справки: официальные модели и активы LTX‑2.5 находятся на Hugging Face, а загрузчик GGUF UNet предоставляется ComfyUI‑GGUF.

Благодарности#

Этот рабочий процесс реализует и опирается на следующие работы и ресурсы. Мы искренне благодарим Lightricks за LTX-2.5 и city96 за ComfyUI-GGUF за их вклад и поддержку. Для авторитетных деталей, пожалуйста, обратитесь к оригинальной документации и репозиториям, указанным ниже.

Ресурсы#

Примечание: использование упомянутых моделей, наборов данных и кода подчиняется соответствующим лицензиям и условиям, предоставленным их авторами и поддерживающими.

Want More ComfyUI Workflows?

RunComfy
Авторское право 2026 RunComfy. Все права защищены.

RunComfy - ведущая ComfyUI платформа, предлагающая ComfyUI онлайн среду и услуги, а также рабочие процессы ComfyUI с потрясающей визуализацией. RunComfy также предоставляет AI Models, позволяя художникам использовать новейшие инструменты AI для создания невероятного искусства.