Fluxo de trabalho de texto para música do MiniMax Music 3 ComfyUI para músicas estruturadas#
O MiniMax Music 3 ComfyUI transforma uma Legenda detalhada e Letras com tags de seção em uma música completa dentro do ComfyUI no RunComfy. O gráfico está predefinido para gerar uma faixa de 60 segundos por padrão, e o modelo subjacente suporta músicas de até cerca de cinco minutos. Você guia o gênero, humor, vocais, instrumentação, tempo, tonalidade e estrutura através do texto, com o modelo tratando-os como direções criativas em vez de garantias estritas.
Este fluxo de trabalho do MiniMax Music 3 ComfyUI é ideal para produtores, designers de som e criadores que desejam esboçar faixas vocais originais ou conceitos de músicas estruturadas a partir de texto. Ele se concentra na geração limpa de texto para música e não inclui modos de áudio de referência, cover, continuação ou edição de áudio.
Modelos chave no fluxo de trabalho do MiniMax Music 3 ComfyUI#
- MiniMax Music 3 Diffusion Transformer (DiT). O gerador principal que sintetiza a música no espaço de áudio latente a partir do condicionamento de texto. Use os pesos FP16 para melhor qualidade ou a variante INT8 ConvRot para baixo VRAM. FP16 weights e INT8 weights.
- MiniMax Music 3 Text Encoder. Converte sua Legenda e Letras em condicionamento que o gerador entende, incluindo sinais de tempo derivados da sua duração alvo. Text encoder.
- MiniMax Music 3 DAV (Decoding Audio VAE). Decodifica o áudio latente de volta para uma forma de onda de banda completa no final da amostragem. VAE.
- Recursos do projeto e exemplos de prompts são mantidos pelos autores aqui: MiniMax‑Music3 on GitHub.
Como usar o fluxo de trabalho do MiniMax Music 3 ComfyUI#
Em um nível alto, o fluxo de trabalho codifica sua Legenda e Letras, cria uma linha do tempo de áudio latente para a duração solicitada, amostra a música, decodifica para forma de onda e então salva o resultado. Os principais controles estão no nó Text to Music (MiniMax Music 3) (#37).
Autoria de Legenda e Letras#
Escreva a Legenda em três seções curtas: Metadados Globais, Detalhes Vocais e Arranjo. Descreva gênero, humor, tempo, tonalidade, instrumentos, caráter da mixagem e estilo vocal em linguagem simples. Nas Letras, use tags de seção como [Intro], [Verse], [Chorus], [Bridge], [Outro] para definir a estrutura; as tags são o que dirigem a forma, enquanto as palavras principalmente informam o clima e a fonética. Mantenha a Legenda concisa e concreta para orientar o estilo sem restringir excessivamente a criatividade. Para faixas instrumentais, declare que não são desejados vocais na Legenda.
MiniMaxMusic3TextEncode (#13)#
Este nó ingere a Legenda e as Letras com tags, produzindo um condicionamento que captura o estilo, intenção de arranjo e presença vocal. Também emite um valor de tempo que o gráfico usa para dimensionar a linha do tempo de áudio latente, então sua configuração de max_duration molda diretamente o comprimento da música. Defina uma seed se desejar takes reproduzíveis; mantenha-a fixa enquanto refina o texto para iterar no mesmo arranjo. O codificador é emparelhado com um modelo de texto MiniMax CLIP carregado em outro lugar no gráfico, então trocar codificadores raramente é necessário.
EmptyMiniMaxMusic3LatentAudio (#15)#
Cria uma tela de áudio latente vazia cujo comprimento corresponde ao sinal de duração do codificador. Pense nisso como a linha do tempo multitrack em branco que o gerador preencherá com bateria, baixo, harmonia, melodia e vocais de acordo com seu texto. Durações mais longas aumentam as necessidades de VRAM e o tempo de renderização. Use isso para mover entre ideias curtas e músicas completas sem mudar qualquer outra parte do pipeline.
UNETLoader (#6) e KSampler (#9)#
UNETLoader seleciona os pesos MiniMax Music 3 DiT. KSampler aplica o processo de difusão usando o condicionamento positivo do seu texto e um condicionamento negativo em branco fornecido por ConditioningZeroOut (#10). Passos e escolha do sampler afetam o detalhe e a sensação de ritmo, enquanto a escala de orientação equilibra a aderência ao texto contra a liberdade generativa. Mantenha a seed constante para comparar legendas de forma justa, e mude-a para explorar novas alternativas melódicas e estruturais.
Decodificação e controle de VRAM: VAEDecodeAudio (#12), VAEDecodeAudioTiled (#42), ComfySwitchNode (#43)#
Após a amostragem, o áudio latente é decodificado para forma de onda pelo DAV. Para músicas longas ou cenários de baixo VRAM, ative o switch tiled_decode no nó principal para roteá-lo através de VAEDecodeAudioTiled, que processa blocos sobrepostos para reduzir o uso de memória. A decodificação em blocos é ligeiramente mais lenta e pode introduzir artefatos sutis nos limites em casos extremos, então prefira a decodificação padrão quando os recursos permitirem. O ComfySwitchNode escolhe o caminho apropriado automaticamente com base no seu toggle.
Saída: SaveAudioAdvanced (#35)#
O áudio final é salvo em disco no formato escolhido, como MP3 ou WAV. Use este nó para definir convenções de nome de arquivo e configurações de qualidade apropriadas para rascunhos ou compartilhamento. Para uso em produção, considere exportar um arquivo sem perdas para mixagem e masterização posterior.
Nós chave no fluxo de trabalho do MiniMax Music 3 ComfyUI#
MiniMaxMusic3TextEncode (#13)#
Central para estilo e estrutura. Ajuste max_duration para definir o comprimento alvo e seed para reprodutibilidade. Se os resultados parecerem fora do prompt, refine primeiro os Metadados Globais da Legenda, depois ajuste Detalhes Vocais e Arranjo para reequilibrar instrumentação e caráter da mixagem.
KSampler (#9)#
Governa detalhe, sensação de tempo e quão fortemente a música segue o texto. Aumente os passos para texturas mais ricas à custa da velocidade, experimente samplers alternativos para diferentes grooves e transientes, e ajuste a escala de orientação para trocar precisão por criatividade. Mantenha a mesma seed ao testar legendas A/B para isolar mudanças no prompt.
VAEDecodeAudioTiled (#42)#
Use ao gerar faixas mais longas ou ao trabalhar em GPUs limitadas. Reduz o pico de memória ao decodificar a forma de onda em blocos sobrepostos. Ative apenas conforme necessário para evitar pequenos riscos de emenda e tempo extra de renderização.
UNETLoader (#6)#
Alterne entre os pesos DiT FP16 e INT8 dependendo do VRAM. FP16 é recomendado para a maior fidelidade, enquanto a variante INT8 ConvRot ajuda a acomodar músicas mais longas em placas menores.
SaveAudioAdvanced (#35)#
Controla o formato e a qualidade de exportação. Escolha MP3 para compartilhamento rápido ou WAV para stems sem perdas e pós-processamento. Defina prefixos claros de nome de arquivo para manter múltiplos takes organizados.
Extras opcionais#
- Use legendas concisas e concretas. Um parágrafo forte de Metadados Globais com gênero, sensação de BPM, tonalidade, adjetivos de mixagem e era de produção muitas vezes importa mais do que longos textos.
- As tags de seção nas Letras direcionam a estrutura. Mantenha as tags simples, evite aninhamento e deixe as seções instrumentais respirarem omitindo palavras entre as tags.
- Para destacar os vocais, enfatize o timbre e a colocação vocal na Legenda. Para saídas instrumentais, diga explicitamente que não há vocais.
- Para mais variação, mude a seed. Para refinamento focado, mantenha a seed fixa e itere no texto.
- O modelo trata tempo, tonalidade e instrumentação como orientações. Espere desvios criativos e itere em direção ao alvo.
- Este fluxo de trabalho do MiniMax Music 3 ComfyUI não inclui modos de áudio de referência, cover, continuação ou edição de áudio. Para técnicas avançadas de prompt e exemplos, veja os recursos oficiais do projeto: MiniMax‑Music3 on GitHub e os arquivos do modelo no Hugging Face.
Agradecimentos#
Este fluxo de trabalho implementa e constrói sobre os seguintes trabalhos e recursos. Agradecemos ComfyUI pelo modelo de fluxo de trabalho MiniMax Music 3: Texto para Música, MiniMax-AI pelo projeto oficial MiniMax Music 3, e Comfy-Org pelos pesos do modelo MiniMax Music 3 por suas contribuições e manutenção. Para detalhes autorizados, consulte a documentação original e os repositórios vinculados abaixo.
Recursos#
- Comfy.org/Source workflow template
- Docs / Release Notes: MiniMax Music 3: Text to Music — ComfyUI Workflow
- MiniMax-AI/MiniMax Music 3 official project
- GitHub: MiniMax-AI/MiniMax-Music3
- Hugging Face: MiniMaxAI/MiniMax-Music3
- Comfy-Org/MiniMax Music 3 model weights
- Hugging Face: Comfy-Org/MiniMax-Music-3
Nota: O uso dos modelos, conjuntos de dados e código referenciados está sujeito às respectivas licenças e termos fornecidos por seus autores e mantenedores.

