VDN H3 MiniMax ComfyUI Text To Video#
VDN H3 ComfyUI Text To Video превращает подсказки на естественном языке в короткие кинематографические видео с синхронизированным аудио. Он объединяет семейство MiniMax H3 с гибридным вниманием Video DeltaNet и 8-шаговым семплированием для генерации видео и аудио из одной подсказки. Подходит для раскадровок, продуктовых клипов и стилизованных сцен, таких как кинематографическая фантастика, раллийные гонки и фехтование на мечах.
Граф включает две независимо выбираемые ветки. Ветка VDN-H3 применяет патч Video DeltaNet и использовалась для создания включенных примеров. Ветка FastVideo предоставляется для сравнения выходных данных и времени генерации с путем VDN. Обе ветки рендерят MP4 с аудио на выбранной вами частоте кадров.
Создано на основе открытых компонентов: VDN для MiniMax H3 GitHub и Hugging Face, узлы VDN-H3 ComfyUI от Saganaki22 GitHub, и базовые веса MiniMax H3 и VAE Hugging Face.
Основные модели в рабочем процессе Comfyui VDN H3 ComfyUI Text To Video#
- Модель диффузии MiniMax-H3 (UNet). Управляет процессом денойзинга, который превращает шум в когерентные пространственно-временные видео и аудио латенты. Веса предоставлены в пакете MiniMax H3 на Hugging Face.
- Текстовый энкодер Qwen3-VL 32B MiniMax-H3. Преобразует вашу подсказку в кондиционирование для генерации видео и аудио, настроенный для семейства H3. Включен в релиз MiniMax H3 на Hugging Face.
- Видео VAE MiniMax-H3. Декодирует видео латенты в RGB кадры. Доступно в разделе VAE на Hugging Face.
- Аудио VAE MiniMax-H3. Восстанавливает звуковую волну из аудио латентов. Также предоставлено на Hugging Face.
- Веса патча VDN-H3. Video DeltaNet применяет гибридное внимание к MiniMax H3. Получите контрольные точки на Hugging Face.
- Вариант FastVideo UNet. Ветка сравнения использует
minimax_h3_fastvideo_vsa_datafree_1300step_4step_int8_convrot.safetensorsот Kijai/MiniMax-H3-experimental.
Как использовать рабочий процесс Comfyui VDN H3 MiniMax ComfyUI Text To Video#
Начните с установки вашей подсказки, разрешения, продолжительности и частоты кадров. Выберите ветку VDN-H3 или ветку FastVideo для индивидуального запуска. Queue All может выполнить обе включенные ветки и создать два MP4; отдельные ветки графа не гарантируют одновременное выполнение на GPU. Обе ветки настроены на 8 шагов семплирования.
Ввод пользователя#
Используйте панель (input:prompt) Text Prompt, чтобы описать как визуальные, так и звуковые элементы на простом языке. Для аудио добавьте последнюю строку, начинающуюся с Audio:, чтобы запросить специфические звуковые эффекты или атмосферу, например "Audio: ритмичный стук копыт, ветер, дальний рев". Управляйте размером изображения с помощью (input:Resolution) Megapixels, который подает данные в ResolutionSelector, чтобы произвести ширину и высоту, которые подходят для вычислений. Установите (input:Duration) Seconds и (input:FPS), чтобы определить, насколько длинным и плавным должен быть клип. Рабочий процесс преобразует продолжительность и FPS в допустимое количество кадров и тихо устанавливает его на длину последовательности, которая хорошо работает с внутренними механизмами H3.
Модели#
CLIPLoader предоставляет текстовый энкодер, настроенный для MiniMax, используемый для кондиционирования. Два узла VAELoader загружают видео VAE и аудио VAE MiniMax-H3, чтобы декодированные кадры и звук соответствовали латентному пространству модели. Эти загрузчики используются обеими ветками для обеспечения одинаковых результатов A/B.
Кондиционирование#
MiniMaxH3ImageToVideo (#219) преобразует вашу подсказку плюс размер и длину в начальный видео-и-аудио латент вместе с положительным кондиционированием. Дополнительные входные изображения могут быть использованы для блокировки первого или последнего кадра, когда вам нужна конкретная поза входа или выхода. На этом этапе ваши повествовательные решения имеют наибольшее значение: движение камеры, действия субъекта, освещение и строка Audio: все становятся руководством для семплера.
Патч VDN-H3#
Ветка VDN применяет обновление Video DeltaNet с помощью ApplyVDNH3Advanced (#6126). Применяет выбранный гибридный патч внимания. MiniMaxChunkFeedForward и ModelPatchTorchSettings настраивают память и параметры выполнения. MiniMaxH3SigmaShift корректирует график шума для видео и аудио перед началом семплирования.
Семплирование (VDN-H3)#
Семплирование VDN начинается с RandomNoise (#6141), объединяет руководство с BasicGuider (#6134), выбирает решатель в KSamplerSelect (#6137) и планирует компактное количество шагов диффузии в BasicScheduler (#6136). SamplerCustomAdvanced (#6135) выполняет денойзинг по всей последовательности, чтобы произвести уточненные латенты видео и аудио. Оставьте семя фиксированным для повторяемости или измените его для свежих вариаций с той же подсказкой.
Декодирование и создание видео (VDN-H3)#
VAEDecode (#6146) восстанавливает кадры, в то время как VAEDecodeAudio (#6145) восстанавливает звуковую дорожку. VHS_VideoCombine (#6170) объединяет кадры и аудио в MP4, соблюдая частоту кадров, которую вы установили ранее, и сохраняя файл, готовый для предварительного просмотра. Выход VDN сохраняется с отличительным префиксом имени файла, чтобы было легко сравнить с результатом FastVideo.
Ветка сравнения FastVideo#
Путь FastVideo загружает оптимизированный по скорости MiniMax H3 UNet и применяет легкий патч внимания перед семплированием. Он повторно использует вашу подсказку, размер и количество кадров, чтобы вы могли напрямую сравнить время и внешний вид. Семплирование повторяет структуру ветки VDN и также настроено на 8 шагов. Кадры и аудио декодируются и объединяются с помощью VHS_VideoCombine (#6104), чтобы создать второй MP4. Используйте эти выходные данные бок о бок, чтобы решить, какая ветка лучше всего подходит для вашей сцены.
Основные узлы в рабочем процессе Comfyui VDN H3 ComfyUI Text To Video#
ApplyVDNH3Advanced(#6126). Включает Video DeltaNet на MiniMax H3, используя выбранную контрольную точку из релиза VDN-H3. Настраивайте только тогда, когда хотите изменить контрольную точку VDN или переключить бэкенды внимания; сохраняйте гибридные настройки внимания для общего использования. Референсная реализация: Saganaki22/ComfyUI-VDN-H3.MiniMaxH3ImageToVideo(#219). Центральная точка управления для истории и тайминга, принимающая текстовую подсказку, вычисленную ширину и высоту, и полученное количество кадров. Для аудио добавьте одну строкуAudio:к подсказке, чтобы управлять звуковыми эффектами и атмосферой, избегая речи, если это не запрошено явно.MiniMaxH3SigmaShift(#6131, #6007). Перебалансирует график сигмы для видео и аудио потоков, что может помочь уменьшить дрожание и сохранить детали при низком количестве шагов. Рассматривайте небольшие корректировки только если меняете варианты моделей или замечаете нестабильность движения.VHS_VideoCombine(#6170, #6104). Объединяет декодированные кадры и аудио в MP4 с выбранной вами частотой кадров и префиксом имени файла. Полезные опции включают обрезку до длины аудио и выбор желаемого формата пикселей H.264. Страница проекта: ComfyUI-VideoHelperSuite.
Дополнительные опции#
- Советы по подсказкам: начните с одного предложения, которое задает тему, действие и движение камеры, затем добавьте указания на внешний вид и одну строку
Audio:для звуковых эффектов. - Для более длинных клипов предпочтите умеренные мегапиксели вместо высокого разрешения, чтобы сохранить стабильность движения и контролировать использование памяти.
- Зафиксируйте семя в
RandomNoise, когда хотите последовательные итерации; измените его, чтобы исследовать вариации. - Сравните две ветки на вашей собственной сцене, чтобы оценить качество выхода и время генерации.
- Если вы столкнулись с ограничениями памяти, сначала уменьшите мегапиксели или продолжительность; уже помогает с более длинными последовательностями.
Благодарности#
Этот рабочий процесс реализует и основывается на следующих работах и ресурсах. Мы выражаем благодарность OpenVDN за модель vdn-minimax-h3, веса и репозиторий, Saganaki22 за узлы ComfyUI-VDN-H3 и Benji (AI Future Tech) за рабочий процесс VDN-H3 за их вклад и поддержку. Для получения авторитетной информации, пожалуйста, обратитесь к оригинальной документации и репозиториям, указанным ниже.
Ресурсы#
- OpenVDN/vdn-minimax-h3
- GitHub: OpenVDN/vdn-minimax-h3
- Hugging Face: OpenVDN/vdn-minimax-h3
- Saganaki22/ComfyUI-VDN-H3
- GitHub: Saganaki22/ComfyUI-VDN-H3
- Benji (AI Future Tech)/VDN-H3 Workflow
- Документы / Примечания к выпуску: AI Future Tech Patreon post
Примечание: Использование указанных моделей, наборов данных и кода подчиняется лицензиям и условиям, предоставленным их авторами и поддерживающими организациями.


