LTX 2.5 GGUF ComfyUI преобразование изображений в видео с синхронизированным аудио#
Этот рабочий процесс LTX 2.5 GGUF ComfyUI превращает одно исходное изображение и подсказку на естественном языке в короткое видео с сгенерированной, синхронизированной аудиодорожкой. Он использует официальную модельную семью LTX‑2.5 для генерации видео и аудио, проходящую через GGUF‑квантованный путь UNet для снижения VRAM, сохраняя кинематографическое движение и согласованность сцены.
Граф разработан для быстрого повторения кадров с персонажами, машин и движений окружения. Он включает переключатель для преобразования изображений в видео или текста в видео, двухступенчатый латентный конвейер (грубый проход, затем латентное увеличение разрешения) и декодирование плитками для снижения нагрузки на память. Если вам нужен компактный, готовый к производству путь, этот рабочий процесс LTX 2.5 GGUF ComfyUI является практичной отправной точкой.
Основные модели в рабочем процессе ComfyUI LTX 2.5 GGUF ComfyUI#
- LTX‑2.5 (официальная, от Lightricks). Основная модель генерации видео и аудио, используемая для синтеза движения и многомодальной направленности. Model card
- LTX‑2.5 Video VAE (bf16). Кодирует и декодирует латенты видео для эффективной генерации, в паре с основной моделью. Включена в репозиторий LTX‑2.5 в разделе vae/. Video VAE
- LTX‑2.5 Audio VAE (bf16). Обрабатывает латентный аудиопуть, чтобы финальный рендер включал синхронизированный звук. Включена в репозиторий LTX‑2.5 в разделе vae/. Audio VAE
- Gemma‑based 12B текстовый кодировщик с проекцией LTX‑2.5. Обеспечивает встраивание подсказок, соответствующих LTX‑2.5, упакованных репозиторием LTX в разделе text_encoders/. Text encoder
- LTX‑2.5 Latent Spatial Upscaler x2 1.0. Модель суперразрешения в латентном пространстве, которая добавляет детали после грубого прохода. Upscaler
- LTX‑2.5 Distilled UNet (GGUF квантованный). Квантованные веса UNet загружаются через загрузчик ComfyUI‑GGUF для сокращения использования памяти при сохранении приемлемого качества. GGUF - это формат вывода, а не официальное название модели. ComfyUI‑GGUF
Как использовать рабочий процесс ComfyUI LTX 2.5 GGUF ComfyUI#
Конвейер работает в два этапа: управляемый низкоразрешенный проход для установления движения и времени, за которым следует латентное увеличение разрешения и уточнение в высоком разрешении. Аудио переносится как пара латентов на протяжении всего процесса, затем декодируется и объединяется с финальными кадрами.
Модель#
Загрузите GGUF‑квантованный UNet с помощью UnetLoaderGGUF (#406). Видео и аудио VAE выбираются с помощью VAELoader (#385, #386), а текстовый кодировщик на основе Gemma предоставляется CLIPLoader (#387). Увеличитель разрешения выбирается с помощью LatentUpscaleModelLoader (#371). Эта группа определяет основу, на которой полагаются все другие группы.
Подсказка#
Напишите описание сцены в поле Prompt, сосредоточившись на объектах, движении и одном ясном движении камеры. Текстовый кодировщик встраивает положительные и отрицательные подсказки через LTXVConditioning (#365), который также принимает выбранную частоту кадров для согласования времени. Если вам нужно аудио, похожее на речь, включите короткие цитируемые фразы; аудиопуть будет реагировать на текстовый контекст, оставаясь осведомленным о сцене. Держите подсказки краткими и конкретными, чтобы избежать конфликта направленности.
Настройки видео#
Задайте продолжительность, частоту кадров и целевой размер. Утилиты преобразуют секунды и fps в количество кадров, чтобы граф выделял правильную временную длину. Придерживайтесь размеров, кратных 32, для стабильности и скорости. Используйте селектор разрешения, чтобы выбрать распространенное соотношение сторон, затем настройте его до желаемого масштаба.
Предварительная обработка изображения#
Загрузите первый (эталонный) кадр и позвольте LTXVPreprocess (#350) нормализовать его для LTX‑2.5. Переключатель Switch to Text to Video? (#363) управляет тем, используется ли изображение как пространственный якорь или обходится для чистого преобразования текста в видео. Помощник по изменению размера сохраняет ваш ввод в соответствии с рабочим разрешением. Хорошая предварительная обработка улучшает сохранение идентичности и компоновку.
Пустой латент#
EmptyLTXVLatentVideo (#356) и LTXVEmptyLatentAudio (#366) предварительно выделяют временной холст для видео и аудио. Эти длины зависят от ваших выборов продолжительности и fps. Это разделение обеспечивает синхронизацию видео и аудиопутей по мере их прохождения через выборку и уточнение.
Генерация низкого разрешения#
Первый блок выборки использует LTXVDualCFGGuider (#388) с вашими условиями подсказки для управления движением и динамикой сцены, затем синтезирует грубый латент с SamplerCustomAdvanced (#344). Если вы преобразуете изображение в видео, LTXVImgToVideoInplace (#357) встраивает эталонный кадр в латент для стабилизации идентичности и композиции; он обходится для текста в видео. Этот проход намеренно легче для установления движения и времени перед увеличением разрешения.
Латентное увеличение разрешения#
LTXVSeparateAVLatent (#367) разделяет аудио и видео, чтобы латент видео можно было улучшить с помощью LTXVLatentUpsampler (#348) с моделью x2. Предварительно обработанное изображение при необходимости повторно применяется с LTXVImgToVideoInplace (#349), чтобы сохранить детали после увеличения разрешения. Затем латент аудио повторно прикрепляется через LTXVConcatAVLatent (#340), сохраняя синхронизацию.
Генерация высокого разрешения#
Второй блок выборки (LTXVDualCFGGuider (#391) и SamplerCustomAdvanced (#368)) уточняет детали и временную согласованность на более высоком масштабе. LTXVSeparateAVLatent (#369) передает аудио в LTXVAudioVAEDecode (#358), в то время как латент видео декодируется с VAEDecodeTiled (#374) для снижения пиков VRAM. CreateVideo (#370) собирает кадры и аудио в финальный MP4 с вашей целевой частотой кадров.
Основные узлы в рабочем процессе ComfyUI LTX 2.5 GGUF ComfyUI#
UnetLoaderGGUF (#406)#
Загружает дистиллированный UNet LTX‑2.5 в формате GGUF. Выберите квантованный файл, соответствующий вашему бюджету VRAM; более легкая квантование снижает использование памяти и ускоряет вывод с некоторым снижением качества. Если вы обновитесь до менее квантованного файла, ожидайте более четких текстур и более стабильного мелкого движения.
LTXVImgToVideoInplace (#357 и #349)#
Встраивает первый кадр в латент, чтобы движение развивалось из вашего изображения, а не уходило далеко. Переключите вход bypass, когда переключаетесь между преобразованием изображения в видео и текста в видео. Используйте узел низкого разрешения (#357) для начальной стабилизации и узел высокого разрешения (#349) для повторного закрепления деталей после увеличения разрешения.
LTXVLatentUpsampler (#348)#
Применяет LTX‑2.5 Latent Spatial Upscaler для добавления деталей без декодирования в пиксели. Используйте его, когда хотите больше четкости почти за ту же стоимость памяти, что и грубый проход. Если вы видите мерцание после увеличения разрешения, слегка усилите направленность на следующем этапе уточнения.
ManualSigmas (#397 и #396)#
Управляет расписанием шумоподавления, используемым выборщиками. Более короткие расписания быстрее, но могут снизить приверженность или временную плавность; более длинные или загруженные вперед расписания добавляют стабильности за дополнительную стоимость. Сочетайте это с выбором выборщика, чтобы сбалансировать скорость и качество для вашей сцены.
VAEDecodeTiled (#374)#
Декодирует латентное видео высокого разрешения в кадры с использованием плиток для ограничения использования VRAM. Если у вас заканчивается память, уменьшите размер плитки или включите более сильную плитку; если вы видите швы, увеличьте перекрытие или попробуйте более крупную плитку. Держите свой выбор VAE в соответствии с официальным LTX‑2.5 видео VAE.
CreateVideo (#370)#
Объединяет последовательность изображений и декодированное аудио в окончательный видеофайл. Установите fps, чтобы соответствовать частоте кадров вашего поколения, чтобы избежать растяжения времени. Используйте это как единственную точку рендеринга для согласованных выходов во всех итерациях.
Дополнительные возможности#
- Для преобразования изображения в видео опишите только одно ясное движение камеры и действие объекта; избегайте нескольких конкурирующих движений.
- Для преобразования текста в видео держите подсказки краткими и добавляйте короткие цитируемые фразы для аудио, похожего на речь, когда это уместно.
- Советы по разрешению: придерживайтесь кратных 32; общие размеры 16:9 включают 960x544 (быстро) и 1344x768 или 1504x832 (более четко). Увеличивайте только если у вас есть запас VRAM.
- Если результаты игнорируют подсказку, увеличьте направленность в блоке выборщика или упростите язык подсказки.
- Для воспроизводимости между запусками установите фиксированное семя в узле шума; случайные семена лучше всего подходят для исследования.
- Если VRAM ограничен, предпочтите уровень GGUF Q, который вы можете себе позволить, и держите увеличитель разрешения включенным; он добавляет детали при минимальной стоимости памяти.
Ссылки для справки: официальные модели и активы LTX‑2.5 находятся на Hugging Face, а загрузчик GGUF UNet предоставляется ComfyUI‑GGUF.
- Модели и активы LTX‑2.5: Lightricks/LTX‑2.5
- Загрузчик GGUF: city96/ComfyUI‑GGUF
Благодарности#
Этот рабочий процесс реализует и опирается на следующие работы и ресурсы. Мы искренне благодарим Lightricks за LTX-2.5 и city96 за ComfyUI-GGUF за их вклад и поддержку. Для авторитетных деталей, пожалуйста, обратитесь к оригинальной документации и репозиториям, указанным ниже.
Ресурсы#
- Lightricks/LTX-2.5
- Hugging Face: Lightricks/LTX-2.5
- city96/ComfyUI-GGUF
- GitHub: city96/ComfyUI-GGUF
Примечание: использование упомянутых моделей, наборов данных и кода подчиняется соответствующим лицензиям и условиям, предоставленным их авторами и поддерживающими.


