MiniMax H3 Reference to Video ComfyUI: нативное стерео аудио Ref2VA рабочий процесс#
Этот готовый к RunComfy рабочий процесс MiniMax H3 Reference to Video ComfyUI превращает связанные эталонные изображения в короткое кинематографическое видео с совместно сгенерированным нативным стерео аудио. Построенный на основе шаблона Comfy.org Reference-to-Video и проверенный с использованием открытых весов Comfy-Org MiniMax-H3, он идеален для кадров с сохранением консистентности персонажей, тестов стилизованных сцен и концептуальных клипов, где имеют значение формулировка подсказок и теги, такие как <Picture 1> и <Picture 2>.
В стандартной комплектации граф проводит две ссылки на изображения и свободную подсказку для создания видео с синхронизированным звуком за один проход. Основной узел также открывает дополнительные входы для большего количества эталонных изображений, эталонных видео с их аудио и отдельных аудиоссылок, чтобы вы могли масштабировать силу кондиционирования по мере необходимости. Если вам нужен начальный пункт, соответствующий оригинальному дизайну, смотрите файл шаблона Comfy.org на GitHub video_minimax_h3_r2v.json.
Ключевые модели в рабочем процессе MiniMax H3 Reference to Video ComfyUI#
- Comfy-Org/MiniMax-H3 diffusion weights (Ref2VA): Генеративное ядро, специализированное для reference-to-video-and-audio, используется через
UNETLoader. Оно обучается на текстовых и визуальных/аудио ссылках для создания единого латента, который несет как видео, так и стерео аудио. Model card and files - MiniMax H3 Video VAE (FP16): Декодирует видео часть совместного латента в кадры с высокой визуальной точностью. minimax_h3_video_vae_fp16.safetensors
- MiniMax H3 Audio VAE (FP32): Декодирует аудио часть совместного латента в нативную стерео волну. minimax_h3_audio_vae_fp32.safetensors
- Qwen3-VL 32B MiniMax-H3 text-image encoder (AWQ): Кодирует вашу подсказку плюс теги ссылок и визуальные токены для кондиционирования. qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
Как использовать рабочий процесс MiniMax H3 Reference to Video ComfyUI#
Этот рабочий процесс направляет ваши ссылки и подсказку в ядро MiniMax H3’s Ref2VA, отбирает один латент, который содержит как видео, так и аудио, затем декодирует и объединяет результат в MP4 с синхронизированным звуком. Группы ниже сопоставлены с графом, чтобы вы могли видеть, что изменить и почему.
Входные данные пользователя#
Используйте LoadImage (#137) и LoadImage (#139), чтобы предоставить две визуальные ссылки. Подсказка вводится в Input Text (Prompt) (#138); укажите каждую входную ссылку явно по тегу в порядке их подключения, например <Picture 1> и <Picture 2>, перед описанием сцены, движения и звука. Установите целевой аспект и количество пикселей в Resolution Selector (Size) (#115). Выберите продолжительность видео в секундах с помощью Float (Duration) (#132); она автоматически преобразуется в допустимую длину кадра ComfyMathExpression (#131), чтобы аудио и видео оставались выровненными.
Модели#
UNETLoader (#127) загружает веса диффузии MiniMax H3 Ref2VA, которые приводят к генерации. CLIPLoader (#128) загружает кодировщик Qwen3-VL 32B, используемый для токенизации вашего текста и тегов ссылок. Два узла VAELoader (#119 видео, #120 аудио) предоставляют парные декодеры, которые позже распакуют совместный латент обратно в кадры и стерео аудио. Эти модели - единственные ресурсы, которые вам нужно заменить при переходе на другие варианты MiniMax H3 в пределах той же семейства задач.
Кондиционирование#
MiniMaxH3ReferenceToVideo (#136) - это сердце конвейера. Он принимает вашу текстовую подсказку, ширину, высоту и вычисленную length (кадры), плюс любые подключенные ref_images, ref_videos и дополнительные аудиоссылки. Узел излучает положительный поток кондиционирования для наведения и инициализированный латент, который закрепляет идентичность, композицию, движение и звуковой дизайн в соответствии с вашими ссылками и тегами. Для сохранения идентичности из изображений подключите хорошо освещенные, соответствующие модели ссылки и точно их укажите в подсказке; для движения или темпа вы можете добавить видео ссылки с их аудио или без него.
Семплинг#
RandomNoise (#129) инициализирует процесс, в то время как KSamplerSelect (#123) выбирает вариант семплера, а BasicScheduler (#124) устанавливает расписание шагов. BasicGuider (#126) применяет кондиционирование, полученное узлом MiniMax H3, и SamplerCustomAdvanced (#125) выполняет фактические шаги денойзинга для развития совместного аудио+видео латента. Выбор здесь в основном меняет скорость на точность и соответствие ссылкам; начните с настроек по умолчанию, затем экспериментируйте, когда получите базовый вид и звук.
Декодирование и создание видео#
Совместный латент семплера переходит к VAEDecode (#122) для кадров и VAEDecodeAudio (#121) для стерео звука. CreateVideo (#130) объединяет декодированные изображения и аудио в воспроизводимый поток, а SaveVideo (#92) записывает окончательный файл в вашу выходную папку. Поскольку видео и аудио были сгенерированы вместе, синхронизация сохраняется без какой-либо пост-выравнивания или внешнего TTS.
Ключевые узлы в рабочем процессе MiniMax H3 Reference to Video ComfyUI#
MiniMaxH3ReferenceToVideo (#136) Этот узел компилирует текстовые, визуальные и дополнительные аудиоссылки в кондиционирование MiniMax H3’s Ref2VA и начальный латент, который уже "знает" об идентичности, стиле, движении и звуке. Используйте точные теги ссылок в вашей подсказке, которые соответствуют порядку подключения, и выбирайте ref_image_size в зависимости от вашей цели: более быстрые итерации при соответствии разрешению генерации, более сильная идентичность при сохранении больших референсных токенов. Для длинных кадров отдавайте предпочтение четким описаниям сцен и действий, чтобы модель могла поддерживать непрерывность.
Resolution Selector (Size) (#115) Управляет целевым аспектом и количеством пикселей, которые будет учитывать весь граф. Выберите форму, соответствующую тому, как вы будете представлять клип, и сбалансируйте детали с пропускной способностью, чтобы вы могли быстро итератировать. Более высокие разрешения увеличивают VRAM и время, но лучше сохраняют тонкие черты из ваших референсов.
ComfyMathExpression (#131) Преобразует продолжительность в секундах, видимую пользователю, в количество кадров, которое устраивает семплер и декодер. Выражение ограничивает минимальный порог и привязывает к внутренне-дружественному шагу, чтобы видео и аудио оставались в синхроне. Регулируйте только вход секунд; узел обрабатывает математику.
KSamplerSelect (#123) и BasicScheduler (#124) Вместе они определяют путь денойзинга. Начните с предоставленного семплера и расписания для надежного соответствия ссылкам; если ваш кадр дрейфует или кажется недостаточно детализированным, протестируйте альтернативное расписание или немного другую семью семплеров и сравните результаты бок о бок.
Дополнительные возможности#
- Держите подсказки конкретными и ориентированными на ссылки: начинайте с тегов, таких как <Picture 1> и <Picture 2>, затем описывайте тип кадра, движение, освещение и ожидаемые звуки.
- Для более сильной идентичности из изображений увеличьте точность ссылок, используя режим большего размера; для более быстрого разработки внешнего вида используйте режим совпадения размера.
- Если вы не подключаете никаких аудиоссылок, MiniMax H3 синтезирует нативное стерео аудио только из подсказки; опишите атмосферу, фоли и тон голоса, чтобы направлять его.
- Добавьте короткое референсное видео, когда вы больше всего заботитесь о ритме движения или поведении камеры; добавьте его парное аудио, когда вы хотите, чтобы этот звуковой характер был перенесен в генерацию.
- Сначала итератируйте при умеренном разрешении и продолжительности, затем увеличивайте, когда синхронизация, идентичность и композиция будут согласованы.
Ссылки#
- Веса и модельные активы MiniMax H3 на Hugging Face: Comfy-Org/MiniMax-H3
- Официальный шаблон Comfy.org, которому следует этот рабочий процесс: video_minimax_h3_r2v.json
- Восходящая интеграция ComfyUI для MiniMax H3: ComfyUI PR #15224
Признания#
Этот рабочий процесс реализует и опирается на следующие работы и ресурсы. Мы искренне признательны Comfy-Org за шаблон рабочего процесса MiniMax H3 R2V ComfyUI и учебник MiniMax, MiniMax за модель MiniMax H3 и официальное объявление, а также Comfy-Org за веса модели MiniMax-H3 за их вклад и поддержку. Для авторитетной информации, пожалуйста, обращайтесь к оригинальной документации и репозиториям, указанным ниже.
Ресурсы#
- Comfy-Org/MiniMax H3 R2V шаблон рабочего процесса
- Comfy-Org/MiniMax H3 учебник
- GitHub: Comfy-Org/docs
- Hugging Face: Comfy-Org/MiniMax-H3
- Документы / Примечания к выпуску: MiniMax H3 учебник
- MiniMax/MiniMax H3 официальное объявление
- Документы / Примечания к выпуску: MiniMax H3 официальное объявление
- Comfy-Org/MiniMax-H3 веса модели
- Hugging Face: Comfy-Org/MiniMax-H3
Примечание: Использование указанных моделей, наборов данных и кода подлежит соответствующим лицензиям и условиям, предоставленным их авторами и поддерживающими лицами.

