Рабочий процесс MiniMax Music 3 ComfyUI для текста в музыку для структурированных песен#
MiniMax Music 3 ComfyUI превращает детализированные подписи и тексты песен с тегами разделов в полную песню внутри ComfyUI на RunComfy. График предустановлен для генерации 60-секундного трека по умолчанию, а основная модель поддерживает песни до пяти минут. Вы управляете жанром, настроением, вокалом, инструментарием, темпом, тональностью и структурой через текст, при этом модель рассматривает их как творческие направления, а не строгие гарантии.
Этот рабочий процесс MiniMax Music 3 ComfyUI идеально подходит для продюсеров, звуковых дизайнеров и создателей, которые хотят набросать оригинальные вокальные треки или концепции структурированных песен из текста. Он фокусируется на чистой генерации текста в музыку и не включает режимы референс-аудио, кавер, продолжение или аудио-редактирование.
Основные модели в рабочем процессе MiniMax Music 3 ComfyUI#
- MiniMax Music 3 Diffusion Transformer (DiT). Основной генератор, который синтезирует песню в латентном аудиопространстве из текстового кондиционирования. Используйте веса FP16 для лучшего качества или вариант INT8 ConvRot для низкого VRAM. FP16 weights и INT8 weights.
- MiniMax Music 3 Text Encoder. Преобразует ваши подписи и тексты песен в кондиционирование, которое понимает генератор, включая временные сигналы, полученные из вашей целевой длительности. Text encoder.
- MiniMax Music 3 DAV (Decoding Audio VAE). Декодирует латентное аудио обратно в полноволновую форму в конце выборки. VAE.
- Ресурсы проекта и примеры подсказок поддерживаются авторами здесь: MiniMax‑Music3 на GitHub.
Как использовать рабочий процесс MiniMax Music 3 ComfyUI#
На высоком уровне рабочий процесс кодирует ваши подписи и тексты песен, создает латентную аудиохронологию для запрашиваемой длительности, выбирает песню, декодирует её в форму волны, а затем сохраняет результат. Основные элементы управления находятся в узле Text to Music (MiniMax Music 3) (#37).
Авторство подписей и текстов песен#
Напишите подпись в трех коротких разделах: Глобальные метаданные, Детали вокала и Аранжировка. Опишите жанр, настроение, темп, тональность, инструменты, характер микса и стиль вокала на простом языке. В текстах песен используйте теги разделов, такие как [Intro], [Verse], [Chorus], [Bridge], [Outro], чтобы определить структуру; теги определяют форму, в то время как слова в основном информируют о настроении и фонетике. Держите подпись краткой и конкретной, чтобы направлять стиль, не ограничивая творческую свободу. Для инструментальных треков укажите, что вокал не требуется в подписи.
MiniMaxMusic3TextEncode (#13)#
Этот узел принимает подписи и тексты с тегами, создавая кондиционирование, которое захватывает стиль, намерение аранжировки и присутствие вокала. Он также выдает временное значение, которое график использует для определения размера латентной аудиохронологии, поэтому ваша настройка max_duration напрямую формирует длину песни. Установите seed, если хотите воспроизводимые результаты; держите его фиксированным, пока вы совершенствуете текст, чтобы итеративно работать над той же аранжировкой. Кодировщик сочетается с текстовой моделью MiniMax CLIP, загруженной в другом месте графика, поэтому переключение кодировщиков редко необходимо.
EmptyMiniMaxMusic3LatentAudio (#15)#
Создает пустой латентный аудиоканвас, длина которого соответствует сигналу длительности кодировщика. Представьте его как пустую многодорожечную хронологию, которую генератор заполнит барабанами, басом, гармонией, мелодией и вокалом в соответствии с вашим текстом. Более длительные временные промежутки увеличивают потребности в VRAM и время рендеринга. Используйте это, чтобы перемещаться между короткими идеями и полными песнями без изменения любой другой части конвейера.
UNETLoader (#6) и KSampler (#9)#
UNETLoader выбирает веса MiniMax Music 3 DiT. KSampler применяет процесс диффузии, используя положительное кондиционирование из вашего текста и пустое отрицательное кондиционирование, предоставленное ConditioningZeroOut (#10). Шаги и выбор сэмплера влияют на детали и ритмическое ощущение, в то время как шкала руководства балансирует между соответствием тексту и творческой свободой. Держите seed постоянным, чтобы честно сравнивать подписи, и измените его, чтобы исследовать новые мелодические и структурные альтернативы.
Декодирование и контроль VRAM: VAEDecodeAudio (#12), VAEDecodeAudioTiled (#42), ComfySwitchNode (#43)#
После выборки латентное аудио декодируется в форму волны DAV. Для длинных песен или сценариев с низким VRAM включите переключатель tiled_decode на основном узле, чтобы направить через VAEDecodeAudioTiled, который обрабатывает перекрывающиеся плитки для снижения использования памяти. Плиточное декодирование немного медленнее и может в редких случаях вводить тонкие артефакты на границах, поэтому предпочтительно стандартное декодирование, когда позволяют ресурсы. ComfySwitchNode автоматически выбирает подходящий путь в зависимости от вашего переключателя.
Вывод: SaveAudioAdvanced (#35)#
Итоговое аудио сохраняется на диск в выбранном вами формате, таком как MP3 или WAV. Используйте этот узел, чтобы установить соглашения о наименовании файлов и настройки качества, подходящие для черновиков или обмена. Для производственного использования рассмотрите возможность экспорта файла без потерь для последующего сведения и мастеринга.
Основные узлы в рабочем процессе MiniMax Music 3 ComfyUI#
MiniMaxMusic3TextEncode (#13)#
Центральный для стиля и структуры. Настройте max_duration, чтобы установить целевую длительность, и seed для воспроизводимости. Если результаты кажутся несоответствующими, сначала уточните глобальные метаданные подписи, затем измените детали вокала и аранжировку, чтобы сбалансировать инструментариум и характер микса.
KSampler (#9)#
Управляет деталями, временным ощущением и тем, насколько сильно песня следует тексту. Увеличьте шаги для более богатых текстур за счет скорости, попробуйте альтернативные сэмплеры для различной ритмики и переходов, и настройте шкалу руководства, чтобы обменять точность на креативность. Держите тот же seed при A/B тестировании подписей, чтобы изолировать изменения подсказок.
VAEDecodeAudioTiled (#42)#
Используйте при генерации более длинных треков или работе на ограниченных GPU. Он снижает пиковую память, декодируя форму волны в перекрывающихся плитках. Включайте его только при необходимости, чтобы избежать небольших рисков швов и дополнительного времени рендеринга.
UNETLoader (#6)#
Переключайтесь между весами FP16 и INT8 DiT в зависимости от VRAM. FP16 рекомендуется для наивысшей точности, в то время как вариант INT8 ConvRot помогает вместить более длинные песни на меньших картах.
SaveAudioAdvanced (#35)#
Контролирует формат и качество экспорта. Выберите MP3 для быстрого обмена или WAV для без потерь стемов и постобработки. Установите четкие префиксы имен файлов, чтобы организовать несколько дублей.
Дополнительные возможности#
- Используйте краткие, конкретные подписи. Сильный абзац глобальных метаданных с жанром, ощущением BPM, тональностью, прилагательными микса и эпохой производства часто важнее длинного текста.
- Теги разделов в текстах песен управляют структурой. Держите теги простыми, избегайте вложенности и дайте инструментальным секциям дышать, опуская слова между тегами.
- Чтобы продвинуть вокал вперед, подчеркните тембр и расположение вокала в подписи. Для инструментальных выходов явно укажите отсутствие вокала.
- Для большего разнообразия измените seed. Для целенаправленного уточнения держите seed фиксированным и итеративно работайте с текстом.
- Модель рассматривает темп, тональность и инструментариум как руководство. Ожидайте творческих отклонений и итераций к цели.
- Этот рабочий процесс MiniMax Music 3 ComfyUI не включает режимы референс-аудио, кавер, продолжение или аудио-редактирование. Для расширенных техник подсказок и примеров смотрите официальные ресурсы проекта: MiniMax‑Music3 на GitHub и файлы модели на Hugging Face.
Благодарности#
Этот рабочий процесс реализует и основывается на следующих работах и ресурсах. Мы искренне благодарим ComfyUI за шаблон рабочего процесса MiniMax Music 3: Text to Music, MiniMax-AI за официальный проект MiniMax Music 3 и Comfy-Org за веса модели MiniMax Music 3 за их вклад и поддержку. За авторитетными деталями обращайтесь к оригинальной документации и репозиториям, приведенным ниже.
Ресурсы#
- Шаблон рабочего процесса Comfy.org/Source
- Документы / Примечания к выпуску: MiniMax Music 3: Text to Music — ComfyUI Workflow
- Официальный проект MiniMax-AI/MiniMax Music 3
- GitHub: MiniMax-AI/MiniMax-Music3
- Hugging Face: MiniMaxAI/MiniMax-Music3
- Веса модели Comfy-Org/MiniMax Music 3
- Hugging Face: Comfy-Org/MiniMax-Music-3
Примечание: Использование упомянутых моделей, наборов данных и кода подчиняется соответствующим лицензиям и условиям, предоставленным их авторами и поддерживающими организациями.

