MiniMax H3 T2V ComfyUI: от запроса к видео с родным стерео звуком#
MiniMax H3 T2V ComfyUI превращает один запрос в короткое кинематографическое видео с синхронизированным стерео звуком. Создано на основе официального шаблона Comfy.org и открытых весов MiniMax-H3 компании Comfy-Org, следует пути FL2VA, так что движение и звук генерируются вместе, а не сшиваются после факта. Это идеально подходит для быстрого изучения сцен только по запросу, клипов с диалогами или пением и концептуальных кадров, которым нужны как визуальные, так и звуковые эффекты за один проход.
Опишите кадры, камеру, исполнение и аудиоподсказки в одном блоке, выберите размер и продолжительность, затем поставьте график в очередь. Рабочий процесс загружает правильные компоненты MiniMax-H3, отбирает совместные аудио-визуальные латенты, декодирует их в кадры и стерео звук, монтирует результат и сохраняет готовый видеофайл.
Ключевые модели в рабочем процессе Comfyui MiniMax H3 T2V ComfyUI#
- MiniMax-H3 FL2VA диффузионная модель. Основной UNet, который выполняет совместное аудио-видео удаление шума, чтобы движение и звук оставались фазово согласованными. Веса предоставлены Comfy-Org под diffusion_models. Файлы модели
- MiniMax-H3 Video VAE. Кодирует и декодирует визуальные латенты в RGB кадры, сохраняя кинематографическую детализацию и непрерывность движения. minimax_h3_video_vae_fp16.safetensors
- MiniMax-H3 Audio VAE. Кодирует и декодирует аудиолатенты в временно-синхронизированную стерео форму волны для каждого клипа. minimax_h3_audio_vae_fp32.safetensors
- Qwen3-VL 32B текстовый кодировщик (AWQ для MiniMax-H3). Интерпретирует запрос в кондиционирование, охватывающее семантику сцены, тайминг и аудио намерение. qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
Если вы хотите сравнить оригинальный шаблон, на котором строится этот график, смотрите справочник Comfy.org. Шаблон JSON
Как использовать рабочий процесс Comfyui MiniMax H3 T2V ComfyUI#
На высоком уровне вы устанавливаете целевое разрешение и продолжительность, пишете один запрос, который включает как визуальные, так и аудио элементы, при необходимости добавляете первые и последние кадры, затем запускаете. Внутри подграфа MiniMax-H3 создаёт синхронизированные видео и аудио латенты, которые декодируются, объединяются в фильм с частотой 24 кадра в секунду и сохраняются.
ResolutionSelector (#115)#
Выберите соотношение сторон и масштаб для установки width и height. Селектор округляет до эффективных кратных 32 и передаёт эти значения в подграф MiniMax-H3, так что вам не нужно вручную рассчитывать размеры. Начинайте с умеренных размеров для более быстрой итерации, затем увеличивайте масштаб, как только ваш запрос будет правильно прочитан. Изменение соотношения сторон - мощный творческий рычаг для трейлеров, вертикальных клипов и квадратных превью.
Image to Video (MiniMax H3) (#105)#
Этот подграф управляет конвейером MiniMax H3 T2V ComfyUI. Вставьте один связный запрос, который описывает кадры, правки и саундтрек вместе, и при необходимости предоставьте изображения first_frame и last_frame для фиксации входа и выхода. Установите удобную для человека duration, и график преобразует её в допустимое количество кадров для модели. Подграф возвращает синхронизированные аудио-визуальные латенты, которые затем декодируются и монтируются.
Группа моделей#
Группа моделей загружает точные компоненты MiniMax-H3 для этого рабочего процесса. UNETLoader (#6) загружает FL2VA диффузионную модель, CLIPLoader (#13) загружает кодировщик Qwen3-VL, а два узла VAELoader (#11 видео, #24 аудио) подготавливают декодеры. Эти узлы указывают на файлы Comfy-Org MiniMax-H3, так что вы можете запускать без ручного подключения. Централизованное хранение моделей здесь делает будущие замены или обновления простыми.
Группа кондиционирования#
MiniMaxH3ImageToVideo (#104) превращает ваш запрос, опциональные first_frame и last_frame, и выбранные width, height и length в кондиционирование MiniMax-H3 плюс начальный латент. Идея состоит в том, чтобы позволить модели считывать как содержание сцены, так и аудио намерение одновременно, что ведёт к более плотной синхронизации. Если вы предоставите опорные кадры, вход и выход будут направлены на непрерывность; если оставите их пустыми, генерация начнётся с нуля.
Группа семплинга#
Семплинг осуществляется RandomNoise (#15), KSamplerSelect (#17), BasicScheduler (#9), BasicGuider (#16) и основным SamplerCustomAdvanced (#14). Вместе они убирают шум из совместного латента, чтобы движение изображения и звуковые события развивались синхронно. Вы можете повторно запустить с новым семенем для альтернативных дублей, сохраняя то же творческое направление. Когда будете довольны, экспериментирование с выбором семплера или расписанием может слегка изменить энергетику движения и звуковую текстуру.
Декодирование и создание видео группа#
VAEDecode (#10) восстанавливает последовательность кадров из видео латента, а VAEDecodeAudio (#23) восстанавливает стерео форму волны из аудио латента. CreateVideo (#91) мультиплексирует кадры и аудио в готовый клип с частотой 24 кадра в секунду. Именно здесь чистые разрезы и удары, указанные в запросе, объединяются на временной шкале. Выходной результат отправляется на сохранение.
SaveVideo (#92)#
Записывает финальное видео в ваш выходной ComfyUI под video/MiniMax_H3. Узел использует автоматическое именование, так что вы можете быстро итератировать, и вы можете изменить путь, чтобы разделить разные проекты. Выход содержит как сгенерированное изображение, так и стерео звук.
Ключевые узлы в рабочем процессе Comfyui MiniMax H3 T2V ComfyUI#
MiniMaxH3ImageToVideo (#104)#
Основной узел кондиционирования для MiniMax-H3, который принимает prompt, опциональные first_frame и last_frame, плюс width, height и length. Держите запросы краткими, но кинематографичными, и включайте аудиоподсказки, такие как атмосфера, SFX, диалоги и музыкальные удары в одном текстовом блоке. Используйте опорные кадры, когда вам нужен конкретный вход или выход; опустите их для более свободной постановки.
ComfyMathExpression (#107)#
Отображает читаемую человеком duration в секундах на целое число length, которое модель ожидает, привязываясь к сетке кадров модели для чистого времени. Установите float на желаемую длину клипа и дайте узлу обработать преобразование. Немного более короткие клипы, как правило, сохраняют четкость движения и синхронизацию звука при более высоких разрешениях.
SamplerCustomAdvanced (#14)#
Управляет процессом удаления шума на основе выбранного семплера и расписания. Используйте фиксированное noise_seed, чтобы зафиксировать дубль для сравнения, затем измените только семя, чтобы исследовать новые вариации. Если движение кажется слишком хаотичным или слишком жёстким, попробуйте другой семплер в KSamplerSelect (#17) или отрегулируйте расписание в BasicScheduler (#9).
CreateVideo (#91)#
Объединяет декодированные кадры и стерео аудио в один видеопоток с выбранной частотой кадров. Для редактирования, управляемого ритмом, установите fps так, чтобы он соответствовал каденции, описанной в запросе. Узел также является местом, где вы можете изменить fps, если хотите более медленное или более бодрое ощущение.
ResolutionSelector (#115)#
Один контроллер для соотношения сторон и общего количества пикселей с автоматическим округлением до размеров, подходящих для модели. Сначала выберите соотношение, затем подкорректируйте масштаб для баланса скорости и качества. Большие холсты вознаграждают тщательное составление запросов и более короткие продолжительности.
SaveVideo (#92)#
Завершает клип на диске. Укажите его в подпапку проекта, чтобы эксперименты были организованы, и разумно переименуйте, когда найдёте удачный вариант.
Дополнительные возможности#
- Пишите запросы как мини-сториборды с временными метками и явными аудио ударами для надёжной синхронизации.
- Включайте аудио намерения, такие как ветер, шаги, толпа, реверберация или конкретные инструменты, чтобы управлять саундтреком.
- Добавляйте строки для диалогов или пения прямо в запрос и указывайте тональность говорящего.
- Закрепите
noise_seed, когда сравниваете изменения запроса, изменяйте только семя, когда исследуете альтернативные дубля. - Используйте
first_frameиlast_frame, чтобы ограничить движение, когда вам нужна непрерывность между разрезами или точная финальная поза.
Благодарности#
Этот рабочий процесс реализует и основывается на следующих работах и ресурсах. Мы с благодарностью признаём Comfy-Org за шаблон рабочего процесса MiniMax H3 T2V и веса модели MiniMax-H3, Comfy.org за учебник MiniMax H3 и MiniMax за официальное объявление о MiniMax H3 за их вклад и обслуживание. Для получения авторитетной информации, пожалуйста, обратитесь к оригинальной документации и репозиториям, указанным ниже.
Ресурсы#
- Шаблон рабочего процесса Comfy-Org/MiniMax H3 T2V
- GitHub: video_minimax_h3_t2v.json
- Учебник Comfy.org/MiniMax H3
- Документация / Примечания к выпуску: MiniMax H3 tutorial
- Официальное объявление MiniMax/MiniMax H3
- Документация / Примечания к выпуску: MiniMax H3 official announcement
- Веса модели Comfy-Org/MiniMax-H3
- Hugging Face: Comfy-Org/MiniMax-H3
Примечание: использование упомянутых моделей, наборов данных и кода подлежит соответствующим лицензиям и условиям, предоставленным их авторами и сопровождающими.



