MiniMax H3 Высококачественный рабочий процесс с двойной выборкой: мультиреференсное видео с синхронизированным родным аудио#
Рабочий процесс MiniMax H3 высокого качества с двойной выборкой - это граф для преобразования референсов в видео, готовый к RunComfy, который превращает несколько изображений-референсов и необязательные видео или аудио подсказки в короткие кинематографические клипы с родным аудио, сгенерированным в том же проходе. Он балансирует сохранение идентичности, стабильное движение и четкие детали, объединяя расписание двойной выборки, память-эффективное внимание H3, специальные видео и аудио VAE, и турбо 4-шаговый LoRA путь.
Разработан для создателей, которым требуется непрерывность продуктов или персонажей, этот рабочий процесс MiniMax H3 с двойной выборкой позволяет вам определять темы, сцены и звук в одной подсказке, а затем производит отполированные выходы видео H3 без необходимости перестраивать граф. Введите набор статичных изображений, добавьте аудиостильный референс и экспортируйте готовый к обмену MP4.
Ключевые модели в рабочем процессе ComfyUI MiniMax H3 высокого качества с двойной выборкой#
- Модель диффузии MiniMax H3 Reference-to-Video (Ref2VA). Основной генератор, который преобразует референсы и текст в аудиовизуальный латент, обеспечивая и кадры, и родное аудио. См. пакет модели и веса в официальных репозиториях: MiniMaxAI/MiniMax-H3 и Comfy-Org/MiniMax-H3.
- Кодировщик текста Qwen3-VL 32B, настроенный для MiniMax H3. Интерпретирует структурированные подсказки, описывающие сюжеты, кадры и звук, затем кондиционирует H3 UNet через встраивания в стиле CLIP, включенные в модельный пакет Comfy-Org: Comfy-Org/MiniMax-H3.
- MiniMax H3 Video VAE. Сжимает и декодирует видео латенты для эффективной высококачественной генерации кадров, поставляется с выпуском Comfy-Org: Comfy-Org/MiniMax-H3.
- MiniMax H3 Audio VAE. Кодирует и декодирует родные аудио латенты, так что речь и амбиент создаются и синхронизируются внутри того же пайплайна: Comfy-Org/MiniMax-H3.
- MiniMax H3 Turbo 4-step LoRA. Легкий путь доработки, который улучшает детали и временную стабильность, сохраняя быстрое время выполнения. Он накладывается на базовую модель H3 Ref2VA в этом рабочем процессе.
Как использовать рабочий процесс ComfyUI MiniMax H3 высокого качества с двойной выборкой#
Этот граф организован в четкие группы, которые передают работу от референсов и подсказок через выборку H3 к декодированию и экспорту MP4. Двойная выборка сначала устанавливает движение и структуру, затем уточняет детали и аудио, сохраняя идентичности.
Область референсов#
Загрузите до девяти статичных референсов для людей, объектов или окружений. Эти данные подаются в узел H3 ref-to-video, чтобы модель могла зафиксировать идентичность, гардероб и элементы сцены. Вы также можете использовать короткий клип в качестве визуального референса, если это необходимо. Используйте референсы, которые уже соответствуют целевой перспективе или освещению для лучшего сохранения. Если вы приносите пакет или спрайт-лист, GetImageRangeFromBatch (#40) может извлечь кадры, которые вы хотите использовать далее.
Область видео референсов#
Если вы предпочитаете начать с референсного видео, используйте загрузчик видео, чтобы вытянуть кадры и при необходимости ограничить продолжительность. GetImageRangeFromBatch (#40) выбирает смежный фрагмент, чтобы рабочий процесс оставался легким. Эти кадры служат структурным или движущим ориентиром для первого прохода H3. Вы можете смешивать видео с изображениями; кодировщик H3 объединяет их перед выборкой.
Область аудио референсов#
Загрузите от одного до трех коротких аудио отрывков, чтобы направлять тембр голоса, ритм или амбиент. Они не копируются дословно; вместо этого они формируют аудиолатент, так что финальная речь или звуковая сцена следуют тому же стилю. Для произнесенных фраз лучше всего подходят короткие чистые голосовые отрывки с минимальным фоновым шумом. Если вы не добавите аудио, рабочий процесс все равно создаст правдоподобный амбиент из подсказки.
model#
Эта группа соединяет H3 UNet, кодировщик текста на основе Qwen и оба VAE, затем применяет память-эффективный патч внимания. Lora Loader Stack (rgthree) (#118) добавляет турбо 4-шаговый LoRA, чтобы вы получили более высокие детали без длительных расписаний. Узел патча внимания снижает нагрузку на VRAM, что полезно при больших разрешениях. Вместе они готовят кондиционирующий стек, который будут использовать выборщики.
Sampling#
MiniMaxH3ReferenceToVideo (#56) - это место, где ваша подсказка, референсы и разрешение объединяются для создания кондиционирования и начального аудиовизуального латента. Узел читает структурированные секции подсказок, такие как subject_definitions, summary, retention_analysis, detailed_description, overall_soundscape и non_diegetic_music. Здесь устанавливается базовое руководство и выбор выборщика, чтобы сохранить конфигурацию простой, при этом обеспечивая сильный контроль. Думайте об этом как о подготовительной зоне перед тем, как рафинированные двойные выборщики возьмут на себя.
Sigmas#
Короткий планировщик создает расписание сигм, которое затем разбивается, чтобы запустить структуру двойной выборки. Одна ветвь акцентирует стабильность и грубое движение, в то время как другая акцентирует высокочастотные детали и четкость. Небольшой логический переключатель позволяет вам расширить или обойти промежуточную зону, когда вам нужно больше очистки на сложных кадрах. Вам не нужно настраивать числа здесь; просто выберите, включать ли расширенный диапазон, когда лица или логотипы требуют дополнительной четкости.
SamplerCustomAdvanced#
Первый проход SamplerCustomAdvanced (#108) работает на более низком диапазоне сигм, чтобы установить макет, идентичности и ритм движения. Затем латент разделяется на видео и аудио, и видео латент может быть слегка увеличен в латентном пространстве, чтобы добавить пространство для деталей. Второй проход SamplerCustomAdvanced (#103) использует более высокий срез сигмы, чтобы улучшить края и текстуры, уважая руководство из первого прохода. Сопутствующий проход SamplerCustomAdvanced (#106) может избирательно шумоподавлять или сохранять регионы, и узел переключателя решает, какой финальный латент лучше всего подходит перед декодированием. Этот двухпроходный танец придает рабочему процессу MiniMax H3 высокого качества с двойной выборкой его надежное сочетание стабильности и четких деталей.
Acceleration Nodes#
Для GPU с более жесткими ограничениями VRAM, UniBlockSwap помогает, временно перемещая блоки UNet в системную память, а VRAMReserver оставляет достаточно места для декодирования и финального мультиплексирования. Эти ускорители скорости и памяти оказывают минимальное воздействие на качество и могут быть включены, когда вы видите предупреждения о нехватке памяти. Держите их рядом с путем UNet, как указано в графе.
Save Video#
Финальный латент декодируется выделенными видео и аудио VAE, затем PixaromaSaveMp4 (#115) мультиплексирует кадры и аудио в MP4. Установите целевую частоту кадров здесь и выберите, обрезать ли видео до длины сгенерированного аудио. Префикс имени файла и подпапка облегчают организацию дублей. Когда вы перезапускаете с новым семенем или референсами, выходы будут складываться в ту же папку.
Ключевые узлы в рабочем процессе ComfyUI MiniMax H3 высокого качества с двойной выборкой#
MiniMaxH3ReferenceToVideo (#56)#
Объединяет текст, изображение и необязательные видео или аудио референсы в кондиционирование и начальный аудиовизуальный латент для H3. Настройте prompt, чтобы определить темы, непрерывность сцены, тайминг кадра и звуковой дизайн, и установите width, height и length, чтобы задать целевой аспект и продолжительность. Используйте несколько референсных изображений, чтобы зафиксировать идентичность и гардероб, когда важна непрерывность.
Lora Loader Stack (rgthree) (#118)#
Применяет MiniMax H3 турбо 4-шаговый LoRA поверх базовой модели, чтобы улучшить детали при коротких расписаниях. Измените силу LoRA, если края становятся слишком резкими или если стиль базовой модели начинает подавляться. Сведите наложение LoRA к минимуму, когда референсы уже несут сильную текстуру.
MiniMaxH3MemoryEfficientSageAttentionPatch (#70)#
Включает память-эффективное внимание для H3 UNet, чтобы вы могли запускать более высокие разрешения или более длинные клипы на скромных GPU. Включите его для карт с 8 до 12 ГБ или когда вы видите всплески VRAM. Отключайте только если вы тестируете чистую пропускную способность на GPU с большим объемом памяти.
SplitSigmas (#99)#
Разбивает планировщик на дополнительные полосы сигм, которые питают два прохода выборщика. Если ваша сцена стабильна, но не хватает остроты, перенесите больше веса на ветвь с высокой сигмой. Если движение дергается или идентичности дрейфуют, отдайте предпочтение ветви с низкой сигмой и держите расширенный промежуточный переключатель выключенным.
SamplerCustomAdvanced (#108)#
Первый проход выборщика, который закладывает структуру, движение и идентичность. Держите руководство согласованным с вашей подсказкой и референсами, чтобы второй проход имел чистую основу. Используйте этот проход, чтобы быстро тестировать семена и кадрирование, прежде чем приступать к доработке.
SamplerCustomAdvanced (#103)#
Выборщик доработки, который использует более высокий срез сигмы для улучшения деталей и исправления краев. Работает лучше всего после надежного первого прохода; избегайте переработки, когда лица или логотипы начинают переочерчиваться. Совмещайте его с латентным увеличением только тогда, когда вам нужно дополнительное пространство для текстур.
ComfySwitchNode (#107)#
Выбирает между альтернативными доработками латента после двойной выборки. Переключайте его при сравнении результатов из вспомогательной ветви шумоподавления против прямой ветви доработки. Записывайте, какой путь лучше сохраняет идентичность для вашего набора объектов.
PixaromaSaveMp4 (#115)#
Мультиплексирует декодированные кадры и аудио в MP4. Установите fps, чтобы соответствовать ощущению движения, и используйте trim_to_audio для плотной аудиовизуальной синхронизации. Обновите filename_prefix, чтобы организовать дубли по кадру или объекту.
Дополнительные возможности#
- Начните с официального шаблона H3 R2V, чтобы изучить основной паттерн перед настройкой этого графа: Comfy-Org workflow template.
- Используйте
ResolutionSelector(#73), чтобы выбрать аспект и целевое количество мегапикселей, которое может обработать ваш GPU, затем увеличивайте постепенно, когда кадрирование выглядит правильно. - Подсказывайте в структурированных секциях, которые модель понимает: subject_definitions, summary, retention_analysis, detailed_description, overall_soundscape, non_diegetic_music. Этот стиль дает H3 более четкие ограничения.
- Для критически важных для идентичности кадров предоставьте 3-5 высококачественных статичных изображений одного и того же объекта при совпадающем освещении и угле. Избегайте тяжелых фильтров на референсах.
- Предоставьте чистый 1-5 секундный голосовой стильный клип в качестве аудио референса для последовательного тембра между персонажами. Держите шум и музыку на низком уровне.
- Если вы достигаете пределов VRAM, включите патч внимания и группу узлов ускорения. Сначала снизьте разрешение, затем длину.
- Когда движение правильное, но текстуры мягкие, сохраните первый проход как есть и увеличьте зависимость от второй ветви выборщика, а не расширяйте общее количество шагов.
- Сохраняйте версии часто. Небольшие изменения в подсказке оказывают большое влияние, потому что рабочий процесс MiniMax H3 высокого качества с двойной выборкой кондиционирует как видео, так и аудио вместе.
Благодарности#
Этот рабочий процесс реализует и опирается на следующие работы и ресурсы. Мы с благодарностью признаем MiniMaxAI за модель MiniMax-H3, Comfy-Org/Comfy.org за шаблоны ComfyUI, веса и учебник для MiniMax H3, и RunningHub.ai за референс рабочего процесса за их вклад и поддержку. Для авторитетных деталей, пожалуйста, обратитесь к оригинальной документации и репозиториям, связанным ниже.
Ресурсы#
- RunningHub.ai/Источник и референс рабочего процесса
- Документы / Примечания к выпуску: Источник и референс рабочего процесса
- MiniMaxAI/MiniMax-H3 (официальная модель)
- Hugging Face: MiniMaxAI/MiniMax-H3
- Comfy-Org/MiniMax-H3 (веса модели)
- Hugging Face: Comfy-Org/MiniMax-H3
- Comfy.org/Учебник MiniMax H3
- Документы / Примечания к выпуску: Учебник
- Comfy-Org/Шаблон ComfyUI MiniMax H3 R2V
- GitHub: Comfy-Org/workflow_templates
Примечание: Использование упомянутых моделей, наборов данных и кода подлежит соответствующим лицензиям и условиям, предоставленным их авторами и поддерживающими.

