Музыкальное видео MiniMax: генерация сцены из песни в ComfyUI#
Этот рабочий процесс превращает полную песню в последовательность видео кадров, чувствительных к ритму, с использованием MiniMax H3, с возможностью создания музыки, поддерживаемой MiniMax Music 3. Он объединяет текстовые подсказки, референсные изображения и основной аудиотрек для создания кинематографических клипов, которые отслеживают вокал, ритм и настроение. Результат — связное музыкальное видео MiniMax с последовательной идентичностью персонажей и естественными переходами между кадрами.
Созданный для художников, редакторов и создателей, рабочий процесс поддерживает нарезки выступлений, визуализации, основанные на текстах, и повествовательные вставки. Вы можете использовать свой собственный трек или сначала создать его, а затем собрать музыкальное видео MiniMax, которое сохраняет визуальную последовательность, развиваясь вместе со структурой песни.
Основные модели в рабочем процессе музыкального видео ComfyUI MiniMax#
- Модель диффузии MiniMax H3. Основной генератор видео, который использует ссылки и условие подсказки для синтеза последовательностей кадров, выровненных по аудио. Активы модели публикуются под пространством имен Comfy‑Org на Hugging Face, включая видео VAE и текстовый энкодер. Comfy‑Org/MiniMax‑H3
- Видео VAE MiniMax H3. Декодирует латентные кадры в изображения для предпросмотра и экспорта. minimax_h3_video_vae_fp16.safetensors
- Аудио VAE MiniMax H3. Декодирует вспомогательный аудио латент модели по мере необходимости. minimax_h3_audio_vae_fp32.safetensors
- Текстовый энкодер MiniMax H3 (вариант Qwen3VL 32B, упакованный для H3). Обеспечивает многомодальное понимание подсказок для генерации видео по ссылкам. qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
- Модель диффузии MiniMax Music 3. Генератор текста в музыку, создающий полные песни из заголовка и плана текста; используется здесь, когда вы хотите создать трек внутри ComfyUI. Comfy‑Org/MiniMax‑Music‑3
- Текстовый энкодер MiniMax Music 3. Кодирует заголовок и текст в условие для генерации музыки. minimax_music3_text_encoder_pruned_int8_convrot.safetensors
- DAV VAE MiniMax Music 3. Декодирует аудио латенты в окончательную волну. minimax_music3_dav.safetensors
Как использовать рабочий процесс музыкального видео ComfyUI MiniMax#
Общий поток. Граф имеет две сотрудничающие части: 1) необязательное создание музыки, которое генерирует основной трек, и 2) синтез видео по ссылкам, который создает визуально последовательные кадры, синхронизированные с песней. Вы можете запускать их вместе или подключить своё собственное аудио и пропустить создание музыки. На заключительном этапе кадры и аудио собираются в отрендеренное музыкальное видео MiniMax.
1) Создание музыки (необязательно)#
Эта группа планирует и синтезирует трек с помощью MiniMax Music 3. Начните с M3SongPlanner (#6171), чтобы составить структурированный заголовок и текст; оба могут быть отредактированы в текстовых просмотрах на холсте перед кодированием. MiniMaxMusic3TextEncode (#6157) превращает этот план в условие и предоставляет целевую продолжительность. Создается латентный аудио контейнер, который образецируется KSampler (#6162) с MiniMax Music 3 UNet (UNETLoader (#6156)), затем декодируется через DAV VAE с использованием стандартного или плиточного декодирования в зависимости от VRAM. Сгенерированное аудио сохраняется и устанавливается как исходный трек рабочего процесса для видео.
2) Вводы пользователя#
Предоставьте или создайте основную песню. Загрузите внешний трек с помощью VHS_LoadAudioUpload (#6170) или используйте песню, созданную на шаге 1. Добавьте одно или несколько референсных изображений для внешнего вида и идентичности с помощью LoadImage (#6110) или загрузчика пути; изображения нормализуются ImageResizeKJv2 (#6090, #6091) для стабильного условия. Установите ваше творческое задание в (input:prompt) Text Prompt (#138) — эта подсказка поддерживает определения предмета, заметки о кадрах и временные подсказки. Выберите аспект и приблизительную продолжительность через Resolution Selector (Size) (#115) и (input:duration) Duration (#132).
3) Патчи#
PathchSageAttentionKJ (#142) активирует оптимизированную реализацию внимания, которая может улучшить производительность и поведение памяти на некоторых GPU. Этот патч работает на загруженной модели MiniMax H3 перед выборкой. Оставьте его включенным, если не столкнетесь с проблемами, специфичными для устройства.
4) Модели#
UNETLoader (#127) загружает основу MiniMax H3 для видео по ссылкам, и необязательный Turbo LoRA применяется с LoraLoaderModelOnly (#5959) для более быстрых, выразительных результатов. Видео и аудио VAEs (VAELoader (#119), VAELoader (#120)) подготавливаются для декодирования. Эти активы определяют качество и должны оставаться последовательными во всех кадрах, чтобы сохранить единый вид.
5) Условие#
MiniMaxH3ReferenceToVideo (#136) объединяет вашу текстовую подсказку, референсные изображения, целевой размер и длину в условие и начальный латент. Это мост между творческим заданием и тем, что будет рендерить образец. Вы можете использовать два референсных изображения в этом шаблоне, чтобы направлять гардероб, идентичность и палитру. Группа также рассчитывает длину кадра из запрашиваемой продолжительности, чтобы кадры совпадали с музыкой.
6) Выборка#
Стек выборки объединяет BasicScheduler (#124), BasicGuider (#126) и SamplerCustomAdvanced (#125) с RandomNoise (#129). MiniMaxH3SigmaShift (#5960) находится выше по потоку, чтобы сместить диапазоны сигмы для более четкого движения видео и стабильного выравнивания аудио. Вместе они итеративно преобразуют латент в изображения, которые следуют вашим ссылкам и ритму. Для воспроизводимости держите ваши семена фиксированными, пока итеративно работаете с подсказкой и ссылками.
7) Декодирование и создание видео#
VAEDecode (#122) превращает выборочные латенты в кадры, а Set_video_1 (#5651) подготавливает их для экспорта. Финальная сборка использует VHS_VideoCombine (#5645), который сшивает кадры с выбранным исходным аудио и применяет вашу целевую частоту кадров из сохраненного значения src_fps. Выход — готовый к распространению музыкальный видеоклип MiniMax, который остается синхронизированным с треком.
8) Видео по ссылкам#
Эта группа является творческим сердцем конвейера для создания последовательностей кадров в соответствии с основной песней. Она получает подготовленную модель H3, ваши ссылки и рассчитанную длину кадра, а затем выполняет один проход выборки на клип. Используйте её для итерации нескольких связанных нарезок вокруг одного и того же предмета, чтобы идентичность, гардероб и палитра оставались последовательными. Повторите для каждого раздела песни, чтобы покрыть вступления, куплеты, припевы и бриджи с соответствующими визуальными эффектами.
Основные узлы в рабочем процессе музыкального видео ComfyUI MiniMax#
MiniMaxH3ReferenceToVideo (#136)#
Создает условие, связывающее подсказку, ссылки и целевую геометрию с латентом для выборки. Используйте его, чтобы управлять идентичностью и художественным направлением с помощью небольшого набора качественных изображений и четких заметок о кадрах. Если кадру требуется более сильное соответствие лицу или наряду, держите ссылки стилистически похожими и избегайте экстремальных обрезок. Измените формулировку подсказки перед изменением настроек выборки, так как этот узел наиболее сильно влияет на то, кто и что появляется на экране.
MiniMaxH3SigmaShift (#5960)#
Смещает расписания сигмы в стеке MiniMax H3 для балансировки временных изменений и выравнивания аудио. Увеличьте сдвиг видео, если хотите больше движения и визуальной эволюции внутри кадра; увеличьте сдвиг аудио, чтобы отдать предпочтение плотному ритму и ощущению губ. Используйте умеренные изменения и тестируйте на коротком клипе перед тем, как завершать всю сцену.
SamplerCustomAdvanced (#125)#
Запускает цикл денойзинга с выбранным планировщиком и гидером. Здесь вы обмениваете время на качество и текстуру. Для быстрого создания идей уменьшите шаги и держите семена фиксированными; для финалов дайте больше шагов и слегка подкорректируйте гид, чтобы улучшить детали, не теряя идентичности. Когда результаты превышают ваше задание, сначала упростите подсказку или уменьшите противоречивые ссылки.
VHS_VideoCombine (#5645)#
Собирает декодированные кадры с выбранным аудио в один видеофайл. Держите частоту кадров постоянной во всех клипах, которые планируете редактировать вместе. Если визуальные эффекты отклоняются от ритма, убедитесь, что длина кадра и fps соответствуют исходному треку. Обрезайте в вашем NLE только после того, как рендеры совпадают с темпом и текстовыми подсказками внутри рабочего процесса.
MiniMaxMusic3TextEncode (#6157)#
Кодирует заголовок и тексты, которые определяют структуру, аранжировку и вокальный характер для MiniMax Music 3. Пишите заголовки в разделах, охватывающих глобальные метаданные, вокальные детали и аранжировку, чтобы модель понимала намерение. Используйте теги секций текста, такие как [Intro], [Verse] и [Chorus], чтобы отметить переходы, которые генератор может следовать. Для помощи с подсказками см. руководство и инструменты в официальном репозитории. MiniMax‑AI/MiniMax‑Music3
ComfyMathExpression (#131)#
Рассчитывает внутреннее количество кадров из вашей целевой продолжительности и привязывает его к ритму, который предпочитает временной стек H3 на выбранной частоте кадров. Это избегает тонких десинхронизаций и заиканий. Если вы изменяете fps или продолжительность, позвольте этому узлу пересчитать длину, чтобы выборка совпадала с ритмом.
Дополнительные возможности#
- Пишите подсказки со стабильной структурой: определения предметов, одно предложение, затем 1–3 абзаца с заметками о кадрах и временными подсказками. Держите время и голос последовательными.
- Используйте 1–2 чистых референсных изображения на предмет. Предпочитайте нейтральное освещение и средний кроп, который включает детали прически и одежды, чтобы улучшить сохранение идентичности.
- Сначала сопоставьте сцены с песней. Рендерьте короткие клипы для каждого раздела (вступление, куплет, припев) и объединяйте их; это сохраняет музыкальное видео MiniMax последовательным, позволяя местные вариации.
- Держите разрешение и частоту кадров постоянными во всех клипах, которые планируете редактировать вместе. Изменение любого из них в середине проекта усложняет поддержание последовательности.
- На машинах с низким VRAM включите плиточное аудио декодирование для длинных песен; на машинах с высоким VRAM стандартное декодирование обычно немного чище.
- Для надежных повторных рендеров заблокируйте семена как на видео семплере, так и на музыкальном семплере перед экспортом финалов.
Благодарности#
Этот рабочий процесс реализует и основывается на следующих работах и ресурсах. Мы искренне благодарим Innovate Futures @ Benji за MiniMax Music VideoWorkflow Source за их вклад и поддержку. Для авторитетных деталей, пожалуйста, обратитесь к оригинальной документации и репозиториям, указанным ниже.
Ресурсы#
- Innovate Futures @ Benji/MiniMax Music VideoWorkflow Source
- Документы / Примечания к выпуску: MiniMax Music VideoWorkflow Source
Примечание: Использование упомянутых моделей, наборов данных и кода подчиняется соответствующим лицензиям и условиям, предоставленным их авторами и поддерживающими их организациями.

