ComfyUI>Рабочие процессы>MiniMax H3 ComfyUI Текст-видео 4-ступенчатый Турбо

MiniMax H3 ComfyUI Текст-видео 4-ступенчатый Турбо

Workflow Name: RunComfy/MiniMax-H3-Turbo
Workflow ID: 0000...1483
Преобразуйте одну кинематографическую подсказку в короткое видео. Вы получаете естественный стереозвук на том же этапе. Создавайте четкие диалоги, пение и атмосферные сцены. Hailuo H3 Турбо использует четырехступенчатую выборку для более быстрых черновиков. Вы можете быстро тестировать идеи. Экспортируйте движение и аудио вместе.

MiniMax H3 ComfyUI Text-to-Video 4-step Turbo Workflow

MiniMax H3 ComfyUI Text-to-Video | 4-Step Turbo
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

MiniMax H3 ComfyUI Text-to-Video 4-step Turbo Examples

MiniMax H3 ComfyUI Текст-видео 4-ступенчатый Турбо: от подсказки к клипу с естественным аудио за один этап#

Этот процесс превращает одну кинематографическую подсказку в короткое видео с совместно сгенерированным стереозвуком с использованием MiniMax H3. Он применяет Турбо 4-ступенчатое ускорение LoRA, чтобы вы могли быстро итеративно прорабатывать диалоги, пение и атмосферные сцены, сохраняя движение и звук тесно связанными.

Создан для создателей, которые хотят черновики только по подсказкам, процесс MiniMax H3 ComfyUI Текст-видео 4-ступенчатый Турбо производит чистую речь или вокал, связный окружающий звук и последовательную кинематографию без ручной сборки аудио. График автоматически обрабатывает выравнивание длины, латентную выборку, декодирование и мультиплексирование, чтобы вы могли сосредоточиться на повествовании и исполнении.

Ключевые модели в процессе Comfyui MiniMax H3 ComfyUI Текст-видео 4-ступенчатый Турбо#

  • MiniMax H3 модель диффузии (FL2VA UNet). Основной аудиовизуальный генератор, который изучает общий латент для изображения и звука, обеспечивая синхронизированное движение и аудио из одной выборки. Весы: Comfy-Org/MiniMax-H3.
  • Qwen3-VL 32B текстовый энкодер для H3 (AWQ/NVFP4 вариант). Кодирует богатые, многопредложные подсказки в условия, управляющие компоновкой сцены, исполнением и аудиособытиями. Упакован в Comfy-Org/MiniMax-H3.
  • MiniMax H3 Видео VAE. Декодирует выборку видео латента в кадры с кинематографическим тоном и детализацией. Файл: minimax_h3_video_vae_fp16.safetensors.
  • MiniMax H3 Аудио VAE. Декодирует общий латент в синхронизированный стереозвук для речи, пения и атмосферы. Файл: minimax_h3_audio_vae_fp32.safetensors.
  • MiniMax H3 Турбо 4-ступенчатый LoRA. Применяет рецепт ускорения, который сохраняет точность сцены, позволяя очень быструю выборку. Файл: minimax_h3_turbo_4step_pruned_comfyui.safetensors.

Как использовать процесс Comfyui MiniMax H3 ComfyUI Текст-видео 4-ступенчатый Турбо#

На высоком уровне ваша подсказка кодируется, модель Turbo-усиленная H3 выбирает одиночный аудиовизуальный латент, и видео и аудио VAE декодируют этот латент перед тем, как клип мультиплексируется в воспроизводимый файл.

1) Напишите кинематографическую подсказку и установите продолжительность#

Используйте текстовое поле easy positive (#147), чтобы описать внешний вид, действие и исполнение. Чтобы направить голос или музыку, включите четкие указания, такие как "Аудио: мужской голос среднего возраста произносит реплику... звуки дождя... низкий триллеровый фон." Контроллер Float (duration) (#133) устанавливает длину клипа в секундах. Математический узел преобразует вашу продолжительность в кадры и тихо выравнивает количество к требуемому ритму H3, так что вам не нужно управлять математикой кадров.

2) Загрузите H3, текстовый энкодер, VAE и Турбо LoRA#

UNETLoader (#127) загружает модель диффузии MiniMax H3, а CLIPLoader (#128) загружает текстовый энкодер Qwen3-VL, адаптированный для H3. Два узла VAELoader загружают видео VAE (#119) и аудио VAE (#120). LoraLoaderModelOnly (#153) применяет MiniMax H3 Турбо 4-ступенчатый LoRA к модели, так что планировщик и выборщик работают в быстром режиме без потери аудиовизуальной согласованности.

3) Постройте условия и начальный аудиовизуальный латент#

MiniMaxH3ImageToVideo (#131) превращает вашу подсказку в положительное условие и подготавливает начальный латент, выровненный по выбранной ширине, высоте и количеству кадров. Существуют необязательные входы first_frame и last_frame для закрепления начального или конечного изображения, если вы решите расширить график позже. Узел выдает условия и латент, который будет дорабатываться в последующих выборках.

4) Выборка с Turbo#

BasicGuider (#126) связывает модель с вашими условиями, KSamplerSelect (#123) выбирает алгоритм выборки, а BasicScheduler (#124) устанавливает график шагов, который работает с Turbo LoRA. RandomNoise (#129) задает генерацию для воспроизводимости. SamplerCustomAdvanced (#125) выполняет денойзинг, чтобы получить окончательный общий латент, который кодирует как видео, так и аудио.

5) Декодируйте и экспортируйте окончательный клип#

VAEDecode (#122) реконструирует кадры изображения из латента, а VAEDecodeAudio (#121) реконструирует синхронизированный стереозвук. CreateVideo (#130) мультиплексирует кадры и аудио в один поток, затем SaveVideo (#92) записывает файл на диск с использованием заданного вами префикса имени файла.

Ключевые узлы в процессе Comfyui MiniMax H3 ComfyUI Текст-видео 4-ступенчатый Турбо#

MiniMaxH3ImageToVideo (#131)#

Создает положительное условие и инициализирует аудиовизуальный латент из вашей подсказки, разрешения и длины. Изменение width, height или length изменяет как масштаб движения, так и сколько действия может поместиться на экране. Если вы позже расширите график, first_frame и last_frame позволят закрепить непрерывность между кадрами.

LoraLoaderModelOnly (#153)#

Применяет Турбо 4-ступенчатый LoRA к загруженной модели H3. Держите планировщик в режиме низких шагов, чтобы воспользоваться Turbo; значительное увеличение шагов изменит внешний вид от предполагаемого поведения быстрой итерации. Этот LoRA специально создан для MiniMax H3 и находится вместе с основными весами в репозитории H3.

BasicScheduler (#124)#

Управляет графиком денойзинга, которому следует выборщик. Используйте его для балансировки скорости и точности, оставаясь совместимым с Turbo LoRA. Если вы измените алгоритм выборки, пересмотрите выбор графика, чтобы поддерживать стабильное движение и чистое аудио.

SamplerCustomAdvanced (#125)#

Выполняет фактический денойзинг, учитывая шум, руководителя, выборщик, сигмы и начальный латент. Это финальный арбитр текстуры, времени и аудиовизуальной резкости. Используйте тот же seed при сравнении изменений в подсказках, чтобы вы могли приписать различия изменениям текста, а не шуму.

PathchSageAttentionKJ (#150)#

Применяет оптимизацию внимания перед внедрением LoRA для улучшения пропускной способности при больших разрешениях. Предоставляется KJNodes, который предлагает средства повышения производительности для ComfyUI. Репозиторий: ComfyUI-KJNodes.

CreateVideo (#130)#

Объединяет декодированные кадры с декодированным аудио в синхронизированный клип. Вы можете изменить частоту кадров или глубину цвета здесь, если вам нужно соответствовать спецификациям доставки. Узел сохраняет синхронизацию аудио-видео, полученную из общего латента.

SaveVideo (#92)#

Записывает отрендеренный клип на диск с выбранным вами префиксом имени файла, контейнером и кодеком. Используйте последовательное именование, чтобы отслеживать итерации для одной и той же сцены и seed.

Дополнительные опции#

  • Подсказка для речи: поместите точную фразу после "Аудио:" и опишите возраст, пол, тон и темп голоса. Для пения укажите стиль и темп. Для атмосферы перечислите источники, интенсивность и хотите ли вы только фон.
  • Компромиссы разрешения и продолжительности: более высокие пиксельные значения и более длинные клипы требуют больше времени на выборку. Если вам нужно много дублей, начните с меньшего, затем увеличьте или удлините, когда время и подача будут правильными.
  • Воспроизводимость: держите тот же seed, когда вы просто изменяете текст, чтобы вы могли A/B сравнивать небольшие изменения в подсказках.
  • Выравнивание длины автоматически: график преобразует секунды в кадры и выравнивает количество к внутреннему ритму H3 для стабильного аудиовизуального синтеза.
  • Варианты непрерывности: узел модели открывает необязательные first_frame и last_frame. Если вы расширите процесс позже, подключите изображения туда, чтобы соответствовать началу или концу кадров между правками.
  • Безопасность: избегайте использования защищенных авторским правом персонажей, изображений реальных людей без согласия и логотипов или субтитров на экране в вашей подсказке.

Благодарности#

Этот процесс реализует и основывается на следующих работах и ресурсах. Мы с благодарностью признаем MiniMax за модель многомодальной генерации MiniMax H3 и анонс, Comfy.org за руководство по процессу ComfyUI MiniMax H3 и Comfy-Org за веса модели MiniMax-H3 за их вклад и поддержку. Для получения авторитетных деталей, пожалуйста, обратитесь к оригинальной документации и репозиториям, указанным ниже.

Ресурсы#

Примечание: Использование упомянутых моделей, наборов данных и кода подчиняется соответствующим лицензиям и условиям, предоставленным их авторами и поддерживающими организациями.

Want More ComfyUI Workflows?

RunComfy
Авторское право 2026 RunComfy. Все права защищены.

RunComfy - ведущая ComfyUI платформа, предлагающая ComfyUI онлайн среду и услуги, а также рабочие процессы ComfyUI с потрясающей визуализацией. RunComfy также предоставляет AI Models, позволяя художникам использовать новейшие инструменты AI для создания невероятного искусства.