ComfyUI>Рабочие процессы>MiniMax H3 T2V ComfyUI - Генератор AI Text-to-Video

MiniMax H3 T2V ComfyUI - Генератор AI Text-to-Video

Workflow Name: RunComfy/MiniMax-H3-T2V
Workflow ID: 0000...1472
Превратите один запрос в полноценную видеосцену. Вы получите кинематографическое движение и родной стерео звук вместе. Создавайте диалоги, пение или концептуальные кадры. График MiniMax H3 text-to-video сохраняет синхронизацию аудио. Вы можете быстрее тестировать идеи. Запустите готовый на RunComfy.

MiniMax H3 T2V ComfyUI Workflow

MiniMax H3 T2V ComfyUI - Video and Native Stereo Audio
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

MiniMax H3 T2V ComfyUI Examples

MiniMax H3 T2V ComfyUI: от запроса к видео с родным стерео звуком#

MiniMax H3 T2V ComfyUI превращает один запрос в короткое кинематографическое видео с синхронизированным стерео звуком. Создано на основе официального шаблона Comfy.org и открытых весов MiniMax-H3 компании Comfy-Org, следует пути FL2VA, так что движение и звук генерируются вместе, а не сшиваются после факта. Это идеально подходит для быстрого изучения сцен только по запросу, клипов с диалогами или пением и концептуальных кадров, которым нужны как визуальные, так и звуковые эффекты за один проход.

Опишите кадры, камеру, исполнение и аудиоподсказки в одном блоке, выберите размер и продолжительность, затем поставьте график в очередь. Рабочий процесс загружает правильные компоненты MiniMax-H3, отбирает совместные аудио-визуальные латенты, декодирует их в кадры и стерео звук, монтирует результат и сохраняет готовый видеофайл.

Ключевые модели в рабочем процессе Comfyui MiniMax H3 T2V ComfyUI#

  • MiniMax-H3 FL2VA диффузионная модель. Основной UNet, который выполняет совместное аудио-видео удаление шума, чтобы движение и звук оставались фазово согласованными. Веса предоставлены Comfy-Org под diffusion_models. Файлы модели
  • MiniMax-H3 Video VAE. Кодирует и декодирует визуальные латенты в RGB кадры, сохраняя кинематографическую детализацию и непрерывность движения. minimax_h3_video_vae_fp16.safetensors
  • MiniMax-H3 Audio VAE. Кодирует и декодирует аудиолатенты в временно-синхронизированную стерео форму волны для каждого клипа. minimax_h3_audio_vae_fp32.safetensors
  • Qwen3-VL 32B текстовый кодировщик (AWQ для MiniMax-H3). Интерпретирует запрос в кондиционирование, охватывающее семантику сцены, тайминг и аудио намерение. qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors

Если вы хотите сравнить оригинальный шаблон, на котором строится этот график, смотрите справочник Comfy.org. Шаблон JSON

Как использовать рабочий процесс Comfyui MiniMax H3 T2V ComfyUI#

На высоком уровне вы устанавливаете целевое разрешение и продолжительность, пишете один запрос, который включает как визуальные, так и аудио элементы, при необходимости добавляете первые и последние кадры, затем запускаете. Внутри подграфа MiniMax-H3 создаёт синхронизированные видео и аудио латенты, которые декодируются, объединяются в фильм с частотой 24 кадра в секунду и сохраняются.

ResolutionSelector (#115)#

Выберите соотношение сторон и масштаб для установки width и height. Селектор округляет до эффективных кратных 32 и передаёт эти значения в подграф MiniMax-H3, так что вам не нужно вручную рассчитывать размеры. Начинайте с умеренных размеров для более быстрой итерации, затем увеличивайте масштаб, как только ваш запрос будет правильно прочитан. Изменение соотношения сторон - мощный творческий рычаг для трейлеров, вертикальных клипов и квадратных превью.

Image to Video (MiniMax H3) (#105)#

Этот подграф управляет конвейером MiniMax H3 T2V ComfyUI. Вставьте один связный запрос, который описывает кадры, правки и саундтрек вместе, и при необходимости предоставьте изображения first_frame и last_frame для фиксации входа и выхода. Установите удобную для человека duration, и график преобразует её в допустимое количество кадров для модели. Подграф возвращает синхронизированные аудио-визуальные латенты, которые затем декодируются и монтируются.

Группа моделей#

Группа моделей загружает точные компоненты MiniMax-H3 для этого рабочего процесса. UNETLoader (#6) загружает FL2VA диффузионную модель, CLIPLoader (#13) загружает кодировщик Qwen3-VL, а два узла VAELoader (#11 видео, #24 аудио) подготавливают декодеры. Эти узлы указывают на файлы Comfy-Org MiniMax-H3, так что вы можете запускать без ручного подключения. Централизованное хранение моделей здесь делает будущие замены или обновления простыми.

Группа кондиционирования#

MiniMaxH3ImageToVideo (#104) превращает ваш запрос, опциональные first_frame и last_frame, и выбранные width, height и length в кондиционирование MiniMax-H3 плюс начальный латент. Идея состоит в том, чтобы позволить модели считывать как содержание сцены, так и аудио намерение одновременно, что ведёт к более плотной синхронизации. Если вы предоставите опорные кадры, вход и выход будут направлены на непрерывность; если оставите их пустыми, генерация начнётся с нуля.

Группа семплинга#

Семплинг осуществляется RandomNoise (#15), KSamplerSelect (#17), BasicScheduler (#9), BasicGuider (#16) и основным SamplerCustomAdvanced (#14). Вместе они убирают шум из совместного латента, чтобы движение изображения и звуковые события развивались синхронно. Вы можете повторно запустить с новым семенем для альтернативных дублей, сохраняя то же творческое направление. Когда будете довольны, экспериментирование с выбором семплера или расписанием может слегка изменить энергетику движения и звуковую текстуру.

Декодирование и создание видео группа#

VAEDecode (#10) восстанавливает последовательность кадров из видео латента, а VAEDecodeAudio (#23) восстанавливает стерео форму волны из аудио латента. CreateVideo (#91) мультиплексирует кадры и аудио в готовый клип с частотой 24 кадра в секунду. Именно здесь чистые разрезы и удары, указанные в запросе, объединяются на временной шкале. Выходной результат отправляется на сохранение.

SaveVideo (#92)#

Записывает финальное видео в ваш выходной ComfyUI под video/MiniMax_H3. Узел использует автоматическое именование, так что вы можете быстро итератировать, и вы можете изменить путь, чтобы разделить разные проекты. Выход содержит как сгенерированное изображение, так и стерео звук.

Ключевые узлы в рабочем процессе Comfyui MiniMax H3 T2V ComfyUI#

MiniMaxH3ImageToVideo (#104)#

Основной узел кондиционирования для MiniMax-H3, который принимает prompt, опциональные first_frame и last_frame, плюс width, height и length. Держите запросы краткими, но кинематографичными, и включайте аудиоподсказки, такие как атмосфера, SFX, диалоги и музыкальные удары в одном текстовом блоке. Используйте опорные кадры, когда вам нужен конкретный вход или выход; опустите их для более свободной постановки.

ComfyMathExpression (#107)#

Отображает читаемую человеком duration в секундах на целое число length, которое модель ожидает, привязываясь к сетке кадров модели для чистого времени. Установите float на желаемую длину клипа и дайте узлу обработать преобразование. Немного более короткие клипы, как правило, сохраняют четкость движения и синхронизацию звука при более высоких разрешениях.

SamplerCustomAdvanced (#14)#

Управляет процессом удаления шума на основе выбранного семплера и расписания. Используйте фиксированное noise_seed, чтобы зафиксировать дубль для сравнения, затем измените только семя, чтобы исследовать новые вариации. Если движение кажется слишком хаотичным или слишком жёстким, попробуйте другой семплер в KSamplerSelect (#17) или отрегулируйте расписание в BasicScheduler (#9).

CreateVideo (#91)#

Объединяет декодированные кадры и стерео аудио в один видеопоток с выбранной частотой кадров. Для редактирования, управляемого ритмом, установите fps так, чтобы он соответствовал каденции, описанной в запросе. Узел также является местом, где вы можете изменить fps, если хотите более медленное или более бодрое ощущение.

ResolutionSelector (#115)#

Один контроллер для соотношения сторон и общего количества пикселей с автоматическим округлением до размеров, подходящих для модели. Сначала выберите соотношение, затем подкорректируйте масштаб для баланса скорости и качества. Большие холсты вознаграждают тщательное составление запросов и более короткие продолжительности.

SaveVideo (#92)#

Завершает клип на диске. Укажите его в подпапку проекта, чтобы эксперименты были организованы, и разумно переименуйте, когда найдёте удачный вариант.

Дополнительные возможности#

  • Пишите запросы как мини-сториборды с временными метками и явными аудио ударами для надёжной синхронизации.
  • Включайте аудио намерения, такие как ветер, шаги, толпа, реверберация или конкретные инструменты, чтобы управлять саундтреком.
  • Добавляйте строки для диалогов или пения прямо в запрос и указывайте тональность говорящего.
  • Закрепите noise_seed, когда сравниваете изменения запроса, изменяйте только семя, когда исследуете альтернативные дубля.
  • Используйте first_frame и last_frame, чтобы ограничить движение, когда вам нужна непрерывность между разрезами или точная финальная поза.

Благодарности#

Этот рабочий процесс реализует и основывается на следующих работах и ресурсах. Мы с благодарностью признаём Comfy-Org за шаблон рабочего процесса MiniMax H3 T2V и веса модели MiniMax-H3, Comfy.org за учебник MiniMax H3 и MiniMax за официальное объявление о MiniMax H3 за их вклад и обслуживание. Для получения авторитетной информации, пожалуйста, обратитесь к оригинальной документации и репозиториям, указанным ниже.

Ресурсы#

Примечание: использование упомянутых моделей, наборов данных и кода подлежит соответствующим лицензиям и условиям, предоставленным их авторами и сопровождающими.

Want More ComfyUI Workflows?

RunComfy
Авторское право 2026 RunComfy. Все права защищены.

RunComfy - ведущая ComfyUI платформа, предлагающая ComfyUI онлайн среду и услуги, а также рабочие процессы ComfyUI с потрясающей визуализацией. RunComfy также предоставляет AI Models, позволяя художникам использовать новейшие инструменты AI для создания невероятного искусства.