ComfyUI>Fluxos de Trabalho>MiniMax Music 3 ComfyUI | AI Completa de Texto para Música

MiniMax Music 3 ComfyUI | AI Completa de Texto para Música

Workflow Name: RunComfy/MiniMax-Music-3
Workflow ID: 0000...1498
Use o gráfico de texto para música do MiniMax Music 3 para transformar ideias em músicas completas. Você guia o gênero, humor, vocais, tempo, tonalidade e instrumentos. Adicione letras com tags para moldar as seções. O preset renderiza 60 segundos. Você pode esboçar faixas vocais originais rapidamente no RunComfy.

MiniMax Music 3 ComfyUI Workflow

MiniMax Music 3 ComfyUI | Captions and Lyrics to Full Songs
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

MiniMax Music 3 ComfyUI Examples

Fluxo de trabalho de texto para música do MiniMax Music 3 ComfyUI para músicas estruturadas#

O MiniMax Music 3 ComfyUI transforma uma Legenda detalhada e Letras com tags de seção em uma música completa dentro do ComfyUI no RunComfy. O gráfico está predefinido para gerar uma faixa de 60 segundos por padrão, e o modelo subjacente suporta músicas de até cerca de cinco minutos. Você guia o gênero, humor, vocais, instrumentação, tempo, tonalidade e estrutura através do texto, com o modelo tratando-os como direções criativas em vez de garantias estritas.

Este fluxo de trabalho do MiniMax Music 3 ComfyUI é ideal para produtores, designers de som e criadores que desejam esboçar faixas vocais originais ou conceitos de músicas estruturadas a partir de texto. Ele se concentra na geração limpa de texto para música e não inclui modos de áudio de referência, cover, continuação ou edição de áudio.

Modelos chave no fluxo de trabalho do MiniMax Music 3 ComfyUI#

  • MiniMax Music 3 Diffusion Transformer (DiT). O gerador principal que sintetiza a música no espaço de áudio latente a partir do condicionamento de texto. Use os pesos FP16 para melhor qualidade ou a variante INT8 ConvRot para baixo VRAM. FP16 weights e INT8 weights.
  • MiniMax Music 3 Text Encoder. Converte sua Legenda e Letras em condicionamento que o gerador entende, incluindo sinais de tempo derivados da sua duração alvo. Text encoder.
  • MiniMax Music 3 DAV (Decoding Audio VAE). Decodifica o áudio latente de volta para uma forma de onda de banda completa no final da amostragem. VAE.
  • Recursos do projeto e exemplos de prompts são mantidos pelos autores aqui: MiniMax‑Music3 on GitHub.

Como usar o fluxo de trabalho do MiniMax Music 3 ComfyUI#

Em um nível alto, o fluxo de trabalho codifica sua Legenda e Letras, cria uma linha do tempo de áudio latente para a duração solicitada, amostra a música, decodifica para forma de onda e então salva o resultado. Os principais controles estão no nó Text to Music (MiniMax Music 3) (#37).

Autoria de Legenda e Letras#

Escreva a Legenda em três seções curtas: Metadados Globais, Detalhes Vocais e Arranjo. Descreva gênero, humor, tempo, tonalidade, instrumentos, caráter da mixagem e estilo vocal em linguagem simples. Nas Letras, use tags de seção como [Intro], [Verse], [Chorus], [Bridge], [Outro] para definir a estrutura; as tags são o que dirigem a forma, enquanto as palavras principalmente informam o clima e a fonética. Mantenha a Legenda concisa e concreta para orientar o estilo sem restringir excessivamente a criatividade. Para faixas instrumentais, declare que não são desejados vocais na Legenda.

MiniMaxMusic3TextEncode (#13)#

Este nó ingere a Legenda e as Letras com tags, produzindo um condicionamento que captura o estilo, intenção de arranjo e presença vocal. Também emite um valor de tempo que o gráfico usa para dimensionar a linha do tempo de áudio latente, então sua configuração de max_duration molda diretamente o comprimento da música. Defina uma seed se desejar takes reproduzíveis; mantenha-a fixa enquanto refina o texto para iterar no mesmo arranjo. O codificador é emparelhado com um modelo de texto MiniMax CLIP carregado em outro lugar no gráfico, então trocar codificadores raramente é necessário.

EmptyMiniMaxMusic3LatentAudio (#15)#

Cria uma tela de áudio latente vazia cujo comprimento corresponde ao sinal de duração do codificador. Pense nisso como a linha do tempo multitrack em branco que o gerador preencherá com bateria, baixo, harmonia, melodia e vocais de acordo com seu texto. Durações mais longas aumentam as necessidades de VRAM e o tempo de renderização. Use isso para mover entre ideias curtas e músicas completas sem mudar qualquer outra parte do pipeline.

UNETLoader (#6) e KSampler (#9)#

UNETLoader seleciona os pesos MiniMax Music 3 DiT. KSampler aplica o processo de difusão usando o condicionamento positivo do seu texto e um condicionamento negativo em branco fornecido por ConditioningZeroOut (#10). Passos e escolha do sampler afetam o detalhe e a sensação de ritmo, enquanto a escala de orientação equilibra a aderência ao texto contra a liberdade generativa. Mantenha a seed constante para comparar legendas de forma justa, e mude-a para explorar novas alternativas melódicas e estruturais.

Decodificação e controle de VRAM: VAEDecodeAudio (#12), VAEDecodeAudioTiled (#42), ComfySwitchNode (#43)#

Após a amostragem, o áudio latente é decodificado para forma de onda pelo DAV. Para músicas longas ou cenários de baixo VRAM, ative o switch tiled_decode no nó principal para roteá-lo através de VAEDecodeAudioTiled, que processa blocos sobrepostos para reduzir o uso de memória. A decodificação em blocos é ligeiramente mais lenta e pode introduzir artefatos sutis nos limites em casos extremos, então prefira a decodificação padrão quando os recursos permitirem. O ComfySwitchNode escolhe o caminho apropriado automaticamente com base no seu toggle.

Saída: SaveAudioAdvanced (#35)#

O áudio final é salvo em disco no formato escolhido, como MP3 ou WAV. Use este nó para definir convenções de nome de arquivo e configurações de qualidade apropriadas para rascunhos ou compartilhamento. Para uso em produção, considere exportar um arquivo sem perdas para mixagem e masterização posterior.

Nós chave no fluxo de trabalho do MiniMax Music 3 ComfyUI#

MiniMaxMusic3TextEncode (#13)#

Central para estilo e estrutura. Ajuste max_duration para definir o comprimento alvo e seed para reprodutibilidade. Se os resultados parecerem fora do prompt, refine primeiro os Metadados Globais da Legenda, depois ajuste Detalhes Vocais e Arranjo para reequilibrar instrumentação e caráter da mixagem.

KSampler (#9)#

Governa detalhe, sensação de tempo e quão fortemente a música segue o texto. Aumente os passos para texturas mais ricas à custa da velocidade, experimente samplers alternativos para diferentes grooves e transientes, e ajuste a escala de orientação para trocar precisão por criatividade. Mantenha a mesma seed ao testar legendas A/B para isolar mudanças no prompt.

VAEDecodeAudioTiled (#42)#

Use ao gerar faixas mais longas ou ao trabalhar em GPUs limitadas. Reduz o pico de memória ao decodificar a forma de onda em blocos sobrepostos. Ative apenas conforme necessário para evitar pequenos riscos de emenda e tempo extra de renderização.

UNETLoader (#6)#

Alterne entre os pesos DiT FP16 e INT8 dependendo do VRAM. FP16 é recomendado para a maior fidelidade, enquanto a variante INT8 ConvRot ajuda a acomodar músicas mais longas em placas menores.

SaveAudioAdvanced (#35)#

Controla o formato e a qualidade de exportação. Escolha MP3 para compartilhamento rápido ou WAV para stems sem perdas e pós-processamento. Defina prefixos claros de nome de arquivo para manter múltiplos takes organizados.

Extras opcionais#

  • Use legendas concisas e concretas. Um parágrafo forte de Metadados Globais com gênero, sensação de BPM, tonalidade, adjetivos de mixagem e era de produção muitas vezes importa mais do que longos textos.
  • As tags de seção nas Letras direcionam a estrutura. Mantenha as tags simples, evite aninhamento e deixe as seções instrumentais respirarem omitindo palavras entre as tags.
  • Para destacar os vocais, enfatize o timbre e a colocação vocal na Legenda. Para saídas instrumentais, diga explicitamente que não há vocais.
  • Para mais variação, mude a seed. Para refinamento focado, mantenha a seed fixa e itere no texto.
  • O modelo trata tempo, tonalidade e instrumentação como orientações. Espere desvios criativos e itere em direção ao alvo.
  • Este fluxo de trabalho do MiniMax Music 3 ComfyUI não inclui modos de áudio de referência, cover, continuação ou edição de áudio. Para técnicas avançadas de prompt e exemplos, veja os recursos oficiais do projeto: MiniMax‑Music3 on GitHub e os arquivos do modelo no Hugging Face.

Agradecimentos#

Este fluxo de trabalho implementa e constrói sobre os seguintes trabalhos e recursos. Agradecemos ComfyUI pelo modelo de fluxo de trabalho MiniMax Music 3: Texto para Música, MiniMax-AI pelo projeto oficial MiniMax Music 3, e Comfy-Org pelos pesos do modelo MiniMax Music 3 por suas contribuições e manutenção. Para detalhes autorizados, consulte a documentação original e os repositórios vinculados abaixo.

Recursos#

Nota: O uso dos modelos, conjuntos de dados e código referenciados está sujeito às respectivas licenças e termos fornecidos por seus autores e mantenedores.

RunComfy
Copyright 2026 RunComfy. Todos os Direitos Reservados.

RunComfy é a principal ComfyUI plataforma, oferecendo ComfyUI online ambiente e serviços, juntamente com fluxos de trabalho do ComfyUI apresentando visuais impressionantes. RunComfy também oferece AI Models, permitindo que artistas utilizem as mais recentes ferramentas de AI para criar arte incrível.