MiniMax H3 ComfyUI Текст-видео 4-ступенчатый Турбо: от подсказки к клипу с естественным аудио за один этап#
Этот процесс превращает одну кинематографическую подсказку в короткое видео с совместно сгенерированным стереозвуком с использованием MiniMax H3. Он применяет Турбо 4-ступенчатое ускорение LoRA, чтобы вы могли быстро итеративно прорабатывать диалоги, пение и атмосферные сцены, сохраняя движение и звук тесно связанными.
Создан для создателей, которые хотят черновики только по подсказкам, процесс MiniMax H3 ComfyUI Текст-видео 4-ступенчатый Турбо производит чистую речь или вокал, связный окружающий звук и последовательную кинематографию без ручной сборки аудио. График автоматически обрабатывает выравнивание длины, латентную выборку, декодирование и мультиплексирование, чтобы вы могли сосредоточиться на повествовании и исполнении.
Ключевые модели в процессе Comfyui MiniMax H3 ComfyUI Текст-видео 4-ступенчатый Турбо#
- MiniMax H3 модель диффузии (FL2VA UNet). Основной аудиовизуальный генератор, который изучает общий латент для изображения и звука, обеспечивая синхронизированное движение и аудио из одной выборки. Весы: Comfy-Org/MiniMax-H3.
- Qwen3-VL 32B текстовый энкодер для H3 (AWQ/NVFP4 вариант). Кодирует богатые, многопредложные подсказки в условия, управляющие компоновкой сцены, исполнением и аудиособытиями. Упакован в Comfy-Org/MiniMax-H3.
- MiniMax H3 Видео VAE. Декодирует выборку видео латента в кадры с кинематографическим тоном и детализацией. Файл: minimax_h3_video_vae_fp16.safetensors.
- MiniMax H3 Аудио VAE. Декодирует общий латент в синхронизированный стереозвук для речи, пения и атмосферы. Файл: minimax_h3_audio_vae_fp32.safetensors.
- MiniMax H3 Турбо 4-ступенчатый LoRA. Применяет рецепт ускорения, который сохраняет точность сцены, позволяя очень быструю выборку. Файл: minimax_h3_turbo_4step_pruned_comfyui.safetensors.
Как использовать процесс Comfyui MiniMax H3 ComfyUI Текст-видео 4-ступенчатый Турбо#
На высоком уровне ваша подсказка кодируется, модель Turbo-усиленная H3 выбирает одиночный аудиовизуальный латент, и видео и аудио VAE декодируют этот латент перед тем, как клип мультиплексируется в воспроизводимый файл.
1) Напишите кинематографическую подсказку и установите продолжительность#
Используйте текстовое поле easy positive (#147), чтобы описать внешний вид, действие и исполнение. Чтобы направить голос или музыку, включите четкие указания, такие как "Аудио: мужской голос среднего возраста произносит реплику... звуки дождя... низкий триллеровый фон." Контроллер Float (duration) (#133) устанавливает длину клипа в секундах. Математический узел преобразует вашу продолжительность в кадры и тихо выравнивает количество к требуемому ритму H3, так что вам не нужно управлять математикой кадров.
2) Загрузите H3, текстовый энкодер, VAE и Турбо LoRA#
UNETLoader (#127) загружает модель диффузии MiniMax H3, а CLIPLoader (#128) загружает текстовый энкодер Qwen3-VL, адаптированный для H3. Два узла VAELoader загружают видео VAE (#119) и аудио VAE (#120). LoraLoaderModelOnly (#153) применяет MiniMax H3 Турбо 4-ступенчатый LoRA к модели, так что планировщик и выборщик работают в быстром режиме без потери аудиовизуальной согласованности.
3) Постройте условия и начальный аудиовизуальный латент#
MiniMaxH3ImageToVideo (#131) превращает вашу подсказку в положительное условие и подготавливает начальный латент, выровненный по выбранной ширине, высоте и количеству кадров. Существуют необязательные входы first_frame и last_frame для закрепления начального или конечного изображения, если вы решите расширить график позже. Узел выдает условия и латент, который будет дорабатываться в последующих выборках.
4) Выборка с Turbo#
BasicGuider (#126) связывает модель с вашими условиями, KSamplerSelect (#123) выбирает алгоритм выборки, а BasicScheduler (#124) устанавливает график шагов, который работает с Turbo LoRA. RandomNoise (#129) задает генерацию для воспроизводимости. SamplerCustomAdvanced (#125) выполняет денойзинг, чтобы получить окончательный общий латент, который кодирует как видео, так и аудио.
5) Декодируйте и экспортируйте окончательный клип#
VAEDecode (#122) реконструирует кадры изображения из латента, а VAEDecodeAudio (#121) реконструирует синхронизированный стереозвук. CreateVideo (#130) мультиплексирует кадры и аудио в один поток, затем SaveVideo (#92) записывает файл на диск с использованием заданного вами префикса имени файла.
Ключевые узлы в процессе Comfyui MiniMax H3 ComfyUI Текст-видео 4-ступенчатый Турбо#
MiniMaxH3ImageToVideo (#131)#
Создает положительное условие и инициализирует аудиовизуальный латент из вашей подсказки, разрешения и длины. Изменение width, height или length изменяет как масштаб движения, так и сколько действия может поместиться на экране. Если вы позже расширите график, first_frame и last_frame позволят закрепить непрерывность между кадрами.
LoraLoaderModelOnly (#153)#
Применяет Турбо 4-ступенчатый LoRA к загруженной модели H3. Держите планировщик в режиме низких шагов, чтобы воспользоваться Turbo; значительное увеличение шагов изменит внешний вид от предполагаемого поведения быстрой итерации. Этот LoRA специально создан для MiniMax H3 и находится вместе с основными весами в репозитории H3.
BasicScheduler (#124)#
Управляет графиком денойзинга, которому следует выборщик. Используйте его для балансировки скорости и точности, оставаясь совместимым с Turbo LoRA. Если вы измените алгоритм выборки, пересмотрите выбор графика, чтобы поддерживать стабильное движение и чистое аудио.
SamplerCustomAdvanced (#125)#
Выполняет фактический денойзинг, учитывая шум, руководителя, выборщик, сигмы и начальный латент. Это финальный арбитр текстуры, времени и аудиовизуальной резкости. Используйте тот же seed при сравнении изменений в подсказках, чтобы вы могли приписать различия изменениям текста, а не шуму.
PathchSageAttentionKJ (#150)#
Применяет оптимизацию внимания перед внедрением LoRA для улучшения пропускной способности при больших разрешениях. Предоставляется KJNodes, который предлагает средства повышения производительности для ComfyUI. Репозиторий: ComfyUI-KJNodes.
CreateVideo (#130)#
Объединяет декодированные кадры с декодированным аудио в синхронизированный клип. Вы можете изменить частоту кадров или глубину цвета здесь, если вам нужно соответствовать спецификациям доставки. Узел сохраняет синхронизацию аудио-видео, полученную из общего латента.
SaveVideo (#92)#
Записывает отрендеренный клип на диск с выбранным вами префиксом имени файла, контейнером и кодеком. Используйте последовательное именование, чтобы отслеживать итерации для одной и той же сцены и seed.
Дополнительные опции#
- Подсказка для речи: поместите точную фразу после "Аудио:" и опишите возраст, пол, тон и темп голоса. Для пения укажите стиль и темп. Для атмосферы перечислите источники, интенсивность и хотите ли вы только фон.
- Компромиссы разрешения и продолжительности: более высокие пиксельные значения и более длинные клипы требуют больше времени на выборку. Если вам нужно много дублей, начните с меньшего, затем увеличьте или удлините, когда время и подача будут правильными.
- Воспроизводимость: держите тот же seed, когда вы просто изменяете текст, чтобы вы могли A/B сравнивать небольшие изменения в подсказках.
- Выравнивание длины автоматически: график преобразует секунды в кадры и выравнивает количество к внутреннему ритму H3 для стабильного аудиовизуального синтеза.
- Варианты непрерывности: узел модели открывает необязательные
first_frameиlast_frame. Если вы расширите процесс позже, подключите изображения туда, чтобы соответствовать началу или концу кадров между правками. - Безопасность: избегайте использования защищенных авторским правом персонажей, изображений реальных людей без согласия и логотипов или субтитров на экране в вашей подсказке.
Благодарности#
Этот процесс реализует и основывается на следующих работах и ресурсах. Мы с благодарностью признаем MiniMax за модель многомодальной генерации MiniMax H3 и анонс, Comfy.org за руководство по процессу ComfyUI MiniMax H3 и Comfy-Org за веса модели MiniMax-H3 за их вклад и поддержку. Для получения авторитетных деталей, пожалуйста, обратитесь к оригинальной документации и репозиториям, указанным ниже.
Ресурсы#
- MiniMax/MiniMax H3: Открытая модель, разрушающая границы между задачами и модальностями
- GitHub: MiniMax-AI/MiniMax-H3
- Hugging Face: MiniMaxAI/MiniMax-H3
- Документация / Примечания к выпуску: Официальное объявление MiniMax H3
- Comfy.org/MiniMax H3: Примеры процесса ComfyUI
- GitHub: Comfy-Org/docs
- Документация / Примечания к выпуску: Руководство Comfy.org MiniMax H3
- Comfy-Org/MiniMax-H3
- Hugging Face: Comfy-Org/MiniMax-H3
Примечание: Использование упомянутых моделей, наборов данных и кода подчиняется соответствующим лицензиям и условиям, предоставленным их авторами и поддерживающими организациями.

