ComfyUI>Рабочие процессы>MiniMax H3 Reference to Video ComfyUI | Стерео

MiniMax H3 Reference to Video ComfyUI | Стерео

Workflow Name: RunComfy/MiniMax-H3-Ref2Video
Workflow ID: 0000...1473
Преобразуйте две ссылки в кинематографический клип. Сохраняйте консистентность ваших персонажей. Генерируйте нативное стерео аудио с видео. Используйте точные теги изображений для контроля подсказок. Быстро тестируйте стилизованные сцены. Создавайте отточенные аудио-видео концепции с графом MiniMax H3 Ref2VA.

MiniMax H3 Reference to Video ComfyUI Workflow

MiniMax H3 Ref to Video in ComfyUI | Native Stereo Audio
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

MiniMax H3 Reference to Video ComfyUI Examples

MiniMax H3 Reference to Video ComfyUI: нативное стерео аудио Ref2VA рабочий процесс#

Этот готовый к RunComfy рабочий процесс MiniMax H3 Reference to Video ComfyUI превращает связанные эталонные изображения в короткое кинематографическое видео с совместно сгенерированным нативным стерео аудио. Построенный на основе шаблона Comfy.org Reference-to-Video и проверенный с использованием открытых весов Comfy-Org MiniMax-H3, он идеален для кадров с сохранением консистентности персонажей, тестов стилизованных сцен и концептуальных клипов, где имеют значение формулировка подсказок и теги, такие как <Picture 1> и <Picture 2>.

В стандартной комплектации граф проводит две ссылки на изображения и свободную подсказку для создания видео с синхронизированным звуком за один проход. Основной узел также открывает дополнительные входы для большего количества эталонных изображений, эталонных видео с их аудио и отдельных аудиоссылок, чтобы вы могли масштабировать силу кондиционирования по мере необходимости. Если вам нужен начальный пункт, соответствующий оригинальному дизайну, смотрите файл шаблона Comfy.org на GitHub video_minimax_h3_r2v.json.

Ключевые модели в рабочем процессе MiniMax H3 Reference to Video ComfyUI#

  • Comfy-Org/MiniMax-H3 diffusion weights (Ref2VA): Генеративное ядро, специализированное для reference-to-video-and-audio, используется через UNETLoader. Оно обучается на текстовых и визуальных/аудио ссылках для создания единого латента, который несет как видео, так и стерео аудио. Model card and files
  • MiniMax H3 Video VAE (FP16): Декодирует видео часть совместного латента в кадры с высокой визуальной точностью. minimax_h3_video_vae_fp16.safetensors
  • MiniMax H3 Audio VAE (FP32): Декодирует аудио часть совместного латента в нативную стерео волну. minimax_h3_audio_vae_fp32.safetensors
  • Qwen3-VL 32B MiniMax-H3 text-image encoder (AWQ): Кодирует вашу подсказку плюс теги ссылок и визуальные токены для кондиционирования. qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors

Как использовать рабочий процесс MiniMax H3 Reference to Video ComfyUI#

Этот рабочий процесс направляет ваши ссылки и подсказку в ядро MiniMax H3’s Ref2VA, отбирает один латент, который содержит как видео, так и аудио, затем декодирует и объединяет результат в MP4 с синхронизированным звуком. Группы ниже сопоставлены с графом, чтобы вы могли видеть, что изменить и почему.

Входные данные пользователя#

Используйте LoadImage (#137) и LoadImage (#139), чтобы предоставить две визуальные ссылки. Подсказка вводится в Input Text (Prompt) (#138); укажите каждую входную ссылку явно по тегу в порядке их подключения, например <Picture 1> и <Picture 2>, перед описанием сцены, движения и звука. Установите целевой аспект и количество пикселей в Resolution Selector (Size) (#115). Выберите продолжительность видео в секундах с помощью Float (Duration) (#132); она автоматически преобразуется в допустимую длину кадра ComfyMathExpression (#131), чтобы аудио и видео оставались выровненными.

Модели#

UNETLoader (#127) загружает веса диффузии MiniMax H3 Ref2VA, которые приводят к генерации. CLIPLoader (#128) загружает кодировщик Qwen3-VL 32B, используемый для токенизации вашего текста и тегов ссылок. Два узла VAELoader (#119 видео, #120 аудио) предоставляют парные декодеры, которые позже распакуют совместный латент обратно в кадры и стерео аудио. Эти модели - единственные ресурсы, которые вам нужно заменить при переходе на другие варианты MiniMax H3 в пределах той же семейства задач.

Кондиционирование#

MiniMaxH3ReferenceToVideo (#136) - это сердце конвейера. Он принимает вашу текстовую подсказку, ширину, высоту и вычисленную length (кадры), плюс любые подключенные ref_images, ref_videos и дополнительные аудиоссылки. Узел излучает положительный поток кондиционирования для наведения и инициализированный латент, который закрепляет идентичность, композицию, движение и звуковой дизайн в соответствии с вашими ссылками и тегами. Для сохранения идентичности из изображений подключите хорошо освещенные, соответствующие модели ссылки и точно их укажите в подсказке; для движения или темпа вы можете добавить видео ссылки с их аудио или без него.

Семплинг#

RandomNoise (#129) инициализирует процесс, в то время как KSamplerSelect (#123) выбирает вариант семплера, а BasicScheduler (#124) устанавливает расписание шагов. BasicGuider (#126) применяет кондиционирование, полученное узлом MiniMax H3, и SamplerCustomAdvanced (#125) выполняет фактические шаги денойзинга для развития совместного аудио+видео латента. Выбор здесь в основном меняет скорость на точность и соответствие ссылкам; начните с настроек по умолчанию, затем экспериментируйте, когда получите базовый вид и звук.

Декодирование и создание видео#

Совместный латент семплера переходит к VAEDecode (#122) для кадров и VAEDecodeAudio (#121) для стерео звука. CreateVideo (#130) объединяет декодированные изображения и аудио в воспроизводимый поток, а SaveVideo (#92) записывает окончательный файл в вашу выходную папку. Поскольку видео и аудио были сгенерированы вместе, синхронизация сохраняется без какой-либо пост-выравнивания или внешнего TTS.

Ключевые узлы в рабочем процессе MiniMax H3 Reference to Video ComfyUI#

MiniMaxH3ReferenceToVideo (#136) Этот узел компилирует текстовые, визуальные и дополнительные аудиоссылки в кондиционирование MiniMax H3’s Ref2VA и начальный латент, который уже "знает" об идентичности, стиле, движении и звуке. Используйте точные теги ссылок в вашей подсказке, которые соответствуют порядку подключения, и выбирайте ref_image_size в зависимости от вашей цели: более быстрые итерации при соответствии разрешению генерации, более сильная идентичность при сохранении больших референсных токенов. Для длинных кадров отдавайте предпочтение четким описаниям сцен и действий, чтобы модель могла поддерживать непрерывность.

Resolution Selector (Size) (#115) Управляет целевым аспектом и количеством пикселей, которые будет учитывать весь граф. Выберите форму, соответствующую тому, как вы будете представлять клип, и сбалансируйте детали с пропускной способностью, чтобы вы могли быстро итератировать. Более высокие разрешения увеличивают VRAM и время, но лучше сохраняют тонкие черты из ваших референсов.

ComfyMathExpression (#131) Преобразует продолжительность в секундах, видимую пользователю, в количество кадров, которое устраивает семплер и декодер. Выражение ограничивает минимальный порог и привязывает к внутренне-дружественному шагу, чтобы видео и аудио оставались в синхроне. Регулируйте только вход секунд; узел обрабатывает математику.

KSamplerSelect (#123) и BasicScheduler (#124) Вместе они определяют путь денойзинга. Начните с предоставленного семплера и расписания для надежного соответствия ссылкам; если ваш кадр дрейфует или кажется недостаточно детализированным, протестируйте альтернативное расписание или немного другую семью семплеров и сравните результаты бок о бок.

Дополнительные возможности#

  • Держите подсказки конкретными и ориентированными на ссылки: начинайте с тегов, таких как <Picture 1> и <Picture 2>, затем описывайте тип кадра, движение, освещение и ожидаемые звуки.
  • Для более сильной идентичности из изображений увеличьте точность ссылок, используя режим большего размера; для более быстрого разработки внешнего вида используйте режим совпадения размера.
  • Если вы не подключаете никаких аудиоссылок, MiniMax H3 синтезирует нативное стерео аудио только из подсказки; опишите атмосферу, фоли и тон голоса, чтобы направлять его.
  • Добавьте короткое референсное видео, когда вы больше всего заботитесь о ритме движения или поведении камеры; добавьте его парное аудио, когда вы хотите, чтобы этот звуковой характер был перенесен в генерацию.
  • Сначала итератируйте при умеренном разрешении и продолжительности, затем увеличивайте, когда синхронизация, идентичность и композиция будут согласованы.

Ссылки#

  • Веса и модельные активы MiniMax H3 на Hugging Face: Comfy-Org/MiniMax-H3
  • Официальный шаблон Comfy.org, которому следует этот рабочий процесс: video_minimax_h3_r2v.json
  • Восходящая интеграция ComfyUI для MiniMax H3: ComfyUI PR #15224

Признания#

Этот рабочий процесс реализует и опирается на следующие работы и ресурсы. Мы искренне признательны Comfy-Org за шаблон рабочего процесса MiniMax H3 R2V ComfyUI и учебник MiniMax, MiniMax за модель MiniMax H3 и официальное объявление, а также Comfy-Org за веса модели MiniMax-H3 за их вклад и поддержку. Для авторитетной информации, пожалуйста, обращайтесь к оригинальной документации и репозиториям, указанным ниже.

Ресурсы#

Примечание: Использование указанных моделей, наборов данных и кода подлежит соответствующим лицензиям и условиям, предоставленным их авторами и поддерживающими лицами.

Want More ComfyUI Workflows?

RunComfy
Авторское право 2026 RunComfy. Все права защищены.

RunComfy - ведущая ComfyUI платформа, предлагающая ComfyUI онлайн среду и услуги, а также рабочие процессы ComfyUI с потрясающей визуализацией. RunComfy также предоставляет AI Models, позволяя художникам использовать новейшие инструменты AI для создания невероятного искусства.