ComfyUI>Рабочие процессы>Музыкальное видео MiniMax | Полный конвейер музыкальных видео с MiniMax H3 и Music 3

Музыкальное видео MiniMax | Полный конвейер музыкальных видео с MiniMax H3 и Music 3

Workflow Name: RunComfy/MiniMax-music-video
Workflow ID: 0000...1502
Превратите всю вашу песню в связную AI визуальную последовательность. Используйте MiniMax H3 и MiniMax Music 3 для сопоставления сцен с ритмом, вокалом и настроением. Направляйте кадры с помощью подсказок, изображений, аудио или видео ссылок. Сохраняйте последовательность персонажей и стиля. Создавайте клипы с выступлениями или повествовательные клипы быстрее. Экспортируйте связный кинематографический результат.

ComfyUI MiniMax music video Workflow

MiniMax Music Video in ComfyUI | Build full pipeline with MiniMax H3 and Music 3
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

ComfyUI MiniMax music video Examples

Музыкальное видео MiniMax: генерация сцены из песни в ComfyUI#

Этот рабочий процесс превращает полную песню в последовательность видео кадров, чувствительных к ритму, с использованием MiniMax H3, с возможностью создания музыки, поддерживаемой MiniMax Music 3. Он объединяет текстовые подсказки, референсные изображения и основной аудиотрек для создания кинематографических клипов, которые отслеживают вокал, ритм и настроение. Результат — связное музыкальное видео MiniMax с последовательной идентичностью персонажей и естественными переходами между кадрами.

Созданный для художников, редакторов и создателей, рабочий процесс поддерживает нарезки выступлений, визуализации, основанные на текстах, и повествовательные вставки. Вы можете использовать свой собственный трек или сначала создать его, а затем собрать музыкальное видео MiniMax, которое сохраняет визуальную последовательность, развиваясь вместе со структурой песни.

Основные модели в рабочем процессе музыкального видео ComfyUI MiniMax#

  • Модель диффузии MiniMax H3. Основной генератор видео, который использует ссылки и условие подсказки для синтеза последовательностей кадров, выровненных по аудио. Активы модели публикуются под пространством имен Comfy‑Org на Hugging Face, включая видео VAE и текстовый энкодер. Comfy‑Org/MiniMax‑H3
  • Видео VAE MiniMax H3. Декодирует латентные кадры в изображения для предпросмотра и экспорта. minimax_h3_video_vae_fp16.safetensors
  • Аудио VAE MiniMax H3. Декодирует вспомогательный аудио латент модели по мере необходимости. minimax_h3_audio_vae_fp32.safetensors
  • Текстовый энкодер MiniMax H3 (вариант Qwen3VL 32B, упакованный для H3). Обеспечивает многомодальное понимание подсказок для генерации видео по ссылкам. qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
  • Модель диффузии MiniMax Music 3. Генератор текста в музыку, создающий полные песни из заголовка и плана текста; используется здесь, когда вы хотите создать трек внутри ComfyUI. Comfy‑Org/MiniMax‑Music‑3
  • Текстовый энкодер MiniMax Music 3. Кодирует заголовок и текст в условие для генерации музыки. minimax_music3_text_encoder_pruned_int8_convrot.safetensors
  • DAV VAE MiniMax Music 3. Декодирует аудио латенты в окончательную волну. minimax_music3_dav.safetensors

Как использовать рабочий процесс музыкального видео ComfyUI MiniMax#

Общий поток. Граф имеет две сотрудничающие части: 1) необязательное создание музыки, которое генерирует основной трек, и 2) синтез видео по ссылкам, который создает визуально последовательные кадры, синхронизированные с песней. Вы можете запускать их вместе или подключить своё собственное аудио и пропустить создание музыки. На заключительном этапе кадры и аудио собираются в отрендеренное музыкальное видео MiniMax.

1) Создание музыки (необязательно)#

Эта группа планирует и синтезирует трек с помощью MiniMax Music 3. Начните с M3SongPlanner (#6171), чтобы составить структурированный заголовок и текст; оба могут быть отредактированы в текстовых просмотрах на холсте перед кодированием. MiniMaxMusic3TextEncode (#6157) превращает этот план в условие и предоставляет целевую продолжительность. Создается латентный аудио контейнер, который образецируется KSampler (#6162) с MiniMax Music 3 UNet (UNETLoader (#6156)), затем декодируется через DAV VAE с использованием стандартного или плиточного декодирования в зависимости от VRAM. Сгенерированное аудио сохраняется и устанавливается как исходный трек рабочего процесса для видео.

2) Вводы пользователя#

Предоставьте или создайте основную песню. Загрузите внешний трек с помощью VHS_LoadAudioUpload (#6170) или используйте песню, созданную на шаге 1. Добавьте одно или несколько референсных изображений для внешнего вида и идентичности с помощью LoadImage (#6110) или загрузчика пути; изображения нормализуются ImageResizeKJv2 (#6090, #6091) для стабильного условия. Установите ваше творческое задание в (input:prompt) Text Prompt (#138) — эта подсказка поддерживает определения предмета, заметки о кадрах и временные подсказки. Выберите аспект и приблизительную продолжительность через Resolution Selector (Size) (#115) и (input:duration) Duration (#132).

3) Патчи#

PathchSageAttentionKJ (#142) активирует оптимизированную реализацию внимания, которая может улучшить производительность и поведение памяти на некоторых GPU. Этот патч работает на загруженной модели MiniMax H3 перед выборкой. Оставьте его включенным, если не столкнетесь с проблемами, специфичными для устройства.

4) Модели#

UNETLoader (#127) загружает основу MiniMax H3 для видео по ссылкам, и необязательный Turbo LoRA применяется с LoraLoaderModelOnly (#5959) для более быстрых, выразительных результатов. Видео и аудио VAEs (VAELoader (#119), VAELoader (#120)) подготавливаются для декодирования. Эти активы определяют качество и должны оставаться последовательными во всех кадрах, чтобы сохранить единый вид.

5) Условие#

MiniMaxH3ReferenceToVideo (#136) объединяет вашу текстовую подсказку, референсные изображения, целевой размер и длину в условие и начальный латент. Это мост между творческим заданием и тем, что будет рендерить образец. Вы можете использовать два референсных изображения в этом шаблоне, чтобы направлять гардероб, идентичность и палитру. Группа также рассчитывает длину кадра из запрашиваемой продолжительности, чтобы кадры совпадали с музыкой.

6) Выборка#

Стек выборки объединяет BasicScheduler (#124), BasicGuider (#126) и SamplerCustomAdvanced (#125) с RandomNoise (#129). MiniMaxH3SigmaShift (#5960) находится выше по потоку, чтобы сместить диапазоны сигмы для более четкого движения видео и стабильного выравнивания аудио. Вместе они итеративно преобразуют латент в изображения, которые следуют вашим ссылкам и ритму. Для воспроизводимости держите ваши семена фиксированными, пока итеративно работаете с подсказкой и ссылками.

7) Декодирование и создание видео#

VAEDecode (#122) превращает выборочные латенты в кадры, а Set_video_1 (#5651) подготавливает их для экспорта. Финальная сборка использует VHS_VideoCombine (#5645), который сшивает кадры с выбранным исходным аудио и применяет вашу целевую частоту кадров из сохраненного значения src_fps. Выход — готовый к распространению музыкальный видеоклип MiniMax, который остается синхронизированным с треком.

8) Видео по ссылкам#

Эта группа является творческим сердцем конвейера для создания последовательностей кадров в соответствии с основной песней. Она получает подготовленную модель H3, ваши ссылки и рассчитанную длину кадра, а затем выполняет один проход выборки на клип. Используйте её для итерации нескольких связанных нарезок вокруг одного и того же предмета, чтобы идентичность, гардероб и палитра оставались последовательными. Повторите для каждого раздела песни, чтобы покрыть вступления, куплеты, припевы и бриджи с соответствующими визуальными эффектами.

Основные узлы в рабочем процессе музыкального видео ComfyUI MiniMax#

MiniMaxH3ReferenceToVideo (#136)#

Создает условие, связывающее подсказку, ссылки и целевую геометрию с латентом для выборки. Используйте его, чтобы управлять идентичностью и художественным направлением с помощью небольшого набора качественных изображений и четких заметок о кадрах. Если кадру требуется более сильное соответствие лицу или наряду, держите ссылки стилистически похожими и избегайте экстремальных обрезок. Измените формулировку подсказки перед изменением настроек выборки, так как этот узел наиболее сильно влияет на то, кто и что появляется на экране.

MiniMaxH3SigmaShift (#5960)#

Смещает расписания сигмы в стеке MiniMax H3 для балансировки временных изменений и выравнивания аудио. Увеличьте сдвиг видео, если хотите больше движения и визуальной эволюции внутри кадра; увеличьте сдвиг аудио, чтобы отдать предпочтение плотному ритму и ощущению губ. Используйте умеренные изменения и тестируйте на коротком клипе перед тем, как завершать всю сцену.

SamplerCustomAdvanced (#125)#

Запускает цикл денойзинга с выбранным планировщиком и гидером. Здесь вы обмениваете время на качество и текстуру. Для быстрого создания идей уменьшите шаги и держите семена фиксированными; для финалов дайте больше шагов и слегка подкорректируйте гид, чтобы улучшить детали, не теряя идентичности. Когда результаты превышают ваше задание, сначала упростите подсказку или уменьшите противоречивые ссылки.

VHS_VideoCombine (#5645)#

Собирает декодированные кадры с выбранным аудио в один видеофайл. Держите частоту кадров постоянной во всех клипах, которые планируете редактировать вместе. Если визуальные эффекты отклоняются от ритма, убедитесь, что длина кадра и fps соответствуют исходному треку. Обрезайте в вашем NLE только после того, как рендеры совпадают с темпом и текстовыми подсказками внутри рабочего процесса.

MiniMaxMusic3TextEncode (#6157)#

Кодирует заголовок и тексты, которые определяют структуру, аранжировку и вокальный характер для MiniMax Music 3. Пишите заголовки в разделах, охватывающих глобальные метаданные, вокальные детали и аранжировку, чтобы модель понимала намерение. Используйте теги секций текста, такие как [Intro], [Verse] и [Chorus], чтобы отметить переходы, которые генератор может следовать. Для помощи с подсказками см. руководство и инструменты в официальном репозитории. MiniMax‑AI/MiniMax‑Music3

ComfyMathExpression (#131)#

Рассчитывает внутреннее количество кадров из вашей целевой продолжительности и привязывает его к ритму, который предпочитает временной стек H3 на выбранной частоте кадров. Это избегает тонких десинхронизаций и заиканий. Если вы изменяете fps или продолжительность, позвольте этому узлу пересчитать длину, чтобы выборка совпадала с ритмом.

Дополнительные возможности#

  • Пишите подсказки со стабильной структурой: определения предметов, одно предложение, затем 1–3 абзаца с заметками о кадрах и временными подсказками. Держите время и голос последовательными.
  • Используйте 1–2 чистых референсных изображения на предмет. Предпочитайте нейтральное освещение и средний кроп, который включает детали прически и одежды, чтобы улучшить сохранение идентичности.
  • Сначала сопоставьте сцены с песней. Рендерьте короткие клипы для каждого раздела (вступление, куплет, припев) и объединяйте их; это сохраняет музыкальное видео MiniMax последовательным, позволяя местные вариации.
  • Держите разрешение и частоту кадров постоянными во всех клипах, которые планируете редактировать вместе. Изменение любого из них в середине проекта усложняет поддержание последовательности.
  • На машинах с низким VRAM включите плиточное аудио декодирование для длинных песен; на машинах с высоким VRAM стандартное декодирование обычно немного чище.
  • Для надежных повторных рендеров заблокируйте семена как на видео семплере, так и на музыкальном семплере перед экспортом финалов.

Благодарности#

Этот рабочий процесс реализует и основывается на следующих работах и ресурсах. Мы искренне благодарим Innovate Futures @ Benji за MiniMax Music VideoWorkflow Source за их вклад и поддержку. Для авторитетных деталей, пожалуйста, обратитесь к оригинальной документации и репозиториям, указанным ниже.

Ресурсы#

Примечание: Использование упомянутых моделей, наборов данных и кода подчиняется соответствующим лицензиям и условиям, предоставленным их авторами и поддерживающими их организациями.

Want More ComfyUI Workflows?

RunComfy
Авторское право 2026 RunComfy. Все права защищены.

RunComfy - ведущая ComfyUI платформа, предлагающая ComfyUI онлайн среду и услуги, а также рабочие процессы ComfyUI с потрясающей визуализацией. RunComfy также предоставляет AI Models, позволяя художникам использовать новейшие инструменты AI для создания невероятного искусства.