Flusso di lavoro testo‑a‑musica MiniMax Music 3 ComfyUI per canzoni strutturate#
MiniMax Music 3 ComfyUI trasforma una Didascalia dettagliata e Testi con tag di sezione in una canzone completa all'interno di ComfyUI su RunComfy. Il grafico è preimpostato per generare una traccia di 60 secondi per impostazione predefinita, e il modello sottostante supporta canzoni fino a circa cinque minuti. Guidi genere, umore, voci, strumentazione, tempo, tonalità e struttura tramite testo, con il modello che li tratta come direzioni creative piuttosto che garanzie rigide.
Questo flusso di lavoro MiniMax Music 3 ComfyUI è ideale per produttori, sound designer e creatori che vogliono abbozzare tracce vocali originali o concetti di canzoni strutturate a partire dal testo. Si concentra su una generazione testo‑a‑musica pulita e non include modalità di riferimento audio, cover, continuazione o editing audio.
Modelli chiave nel flusso di lavoro MiniMax Music 3 ComfyUI#
- MiniMax Music 3 Diffusion Transformer (DiT). Il generatore principale che sintetizza la canzone nello spazio audio latente dal testo condizionato. Usa i pesi FP16 per la migliore qualità o la variante INT8 ConvRot per VRAM bassa. Pesi FP16 e Pesi INT8.
- MiniMax Music 3 Text Encoder. Converte la tua Didascalia e i Testi in condizionamenti che il generatore comprende, inclusi segnali temporali derivati dalla tua durata target. Text encoder.
- MiniMax Music 3 DAV (Decoding Audio VAE). Decodifica l'audio latente in un'onda completa alla fine del campionamento. VAE.
- Risorse del progetto ed esempi di prompt sono mantenuti dagli autori qui: MiniMax‑Music3 su GitHub.
Come usare il flusso di lavoro MiniMax Music 3 ComfyUI#
A un livello alto, il flusso di lavoro codifica la tua Didascalia e i Testi, crea una timeline audio latente per la durata richiesta, campiona la canzone, la decodifica in un'onda, poi salva il risultato. I controlli principali si trovano sul nodo Text to Music (MiniMax Music 3) (#37).
Scrittura di Didascalie e Testi#
Scrivi la Didascalia in tre brevi sezioni: Metadati Globali, Dettagli Vocali e Arrangiamento. Descrivi genere, umore, tempo, tonalità, strumenti, carattere del mix e stile vocale in linguaggio semplice. Nei Testi, usa tag di sezione come [Intro], [Verse], [Chorus], [Bridge], [Outro] per definire la struttura; i tag sono ciò che guida la forma, mentre le parole informano principalmente l'atmosfera e la fonetica. Mantieni la Didascalia concisa e concreta per indirizzare lo stile senza limitare eccessivamente la creatività. Per tracce strumentali, dichiara che non sono desiderate voci nella Didascalia.
MiniMaxMusic3TextEncode (#13)#
Questo nodo ingloba la Didascalia e i Testi con tag, producendo condizionamenti che catturano stile, intenzione di arrangiamento e presenza vocale. Emette anche un valore temporale che il grafico usa per dimensionare la timeline audio latente, quindi la tua impostazione max_duration modella direttamente la lunghezza della canzone. Imposta un seme se vuoi ripetere gli stessi tentativi; mantienilo fisso mentre affini il testo per iterare sullo stesso arrangiamento. L'encoder è associato a un modello di testo MiniMax CLIP caricato altrove nel grafico, quindi cambiare encoder è raramente necessario.
EmptyMiniMaxMusic3LatentAudio (#15)#
Crea una tela audio latente vuota la cui lunghezza corrisponde al segnale di durata dell'encoder. Pensalo come la timeline multitraccia vuota che il generatore riempirà con batteria, basso, armonia, melodia e voci secondo il tuo testo. Durate più lunghe aumentano i bisogni di VRAM e il tempo di rendering. Usa questo per passare da idee brevi a canzoni complete senza cambiare nessun'altra parte del pipeline.
UNETLoader (#6) e KSampler (#9)#
UNETLoader seleziona i pesi MiniMax Music 3 DiT. KSampler applica il processo di diffusione utilizzando il condizionamento positivo dal tuo testo e un condizionamento negativo vuoto fornito da ConditioningZeroOut (#10). Passi e scelta del campionatore influenzano il dettaglio e la sensazione del ritmo, mentre la scala di guida bilancia l'aderenza al testo contro la libertà generativa. Mantieni costante il seme per confrontare le didascalie in modo equo e cambialo per esplorare nuove alternative melodiche e strutturali.
Decodifica e controllo VRAM: VAEDecodeAudio (#12), VAEDecodeAudioTiled (#42), ComfySwitchNode (#43)#
Dopo il campionamento, l'audio latente viene decodificato in un'onda dal DAV. Per canzoni lunghe o scenari di bassa VRAM, abilita l'interruttore tiled_decode sul nodo principale per instradare attraverso VAEDecodeAudioTiled, che elabora piastrelle sovrapposte per ridurre l'uso della memoria. La decodifica a piastrelle è leggermente più lenta e può introdurre sottili artefatti di confine in casi limite, quindi preferisci la decodifica standard quando le risorse lo consentono. Il ComfySwitchNode sceglie automaticamente il percorso appropriato in base al tuo toggle.
Output: SaveAudioAdvanced (#35)#
L'audio finale viene salvato su disco nel formato scelto, come MP3 o WAV. Usa questo nodo per impostare convenzioni di denominazione dei file e impostazioni di qualità appropriate per bozze o condivisione. Per l'uso in produzione, considera l'esportazione di un file lossless per il mixing e il mastering a valle.
Nodi chiave nel flusso di lavoro MiniMax Music 3 ComfyUI#
MiniMaxMusic3TextEncode (#13)#
Centrale per stile e struttura. Regola max_duration per impostare la lunghezza target e seed per la riproducibilità. Se i risultati sembrano fuori tema, affina prima i Metadati Globali della Didascalia, poi modifica i Dettagli Vocali e l'Arrangiamento per riequilibrare la strumentazione e il carattere del mix.
KSampler (#9)#
Governa il dettaglio, la sensazione di temporizzazione e quanto fortemente la canzone segue il testo. Aumenta i passi per trame più ricche a scapito della velocità, prova campionatori alternativi per groove e transienti diversi, e regola la scala di guida per scambiare precisione per creatività. Mantieni lo stesso seme quando testando A/B le didascalie per isolare i cambiamenti del prompt.
VAEDecodeAudioTiled (#42)#
Usa quando generi tracce più lunghe o lavori su GPU limitate. Riduce il picco di memoria decodificando l'onda in piastrelle sovrapposte. Abilitalo solo quando necessario per evitare piccoli rischi di giunzioni e tempi di rendering extra.
UNETLoader (#6)#
Passa tra i pesi FP16 e INT8 DiT a seconda del VRAM. FP16 è raccomandato per la massima fedeltà, mentre la variante INT8 ConvRot aiuta a adattare canzoni più lunghe su schede più piccole.
SaveAudioAdvanced (#35)#
Controlla il formato di esportazione e la qualità. Scegli MP3 per una condivisione rapida o WAV per stem lossless e post‑produzione. Imposta prefissi di nome file chiari per tenere organizzati più tentativi.
Extra opzionali#
- Usa Didascalie concise e concrete. Un paragrafo di Metadati Globali forte con genere, sensazione BPM, tonalità, aggettivi di mix e era di produzione spesso conta più di una lunga prosa.
- I tag di sezione nei Testi guidano la struttura. Mantieni i tag semplici, evita il nesting e lascia che le sezioni strumentali respirino omettendo parole tra i tag.
- Per spingere le voci in avanti, enfatizza il timbro vocale e il posizionamento nella Didascalia. Per uscite strumentali, dichiara esplicitamente nessuna voce.
- Per più variazione, cambia il seme. Per un raffinamento mirato, mantieni il seme fisso e itera sul testo.
- Il modello tratta tempo, tonalità e strumentazione come guida. Aspettati deviazioni creative e itera verso il target.
- Questo flusso di lavoro MiniMax Music 3 ComfyUI non include modalità di riferimento audio, cover, continuazione o editing audio. Per tecniche di prompt avanzate ed esempi, vedi le risorse ufficiali del progetto: MiniMax‑Music3 su GitHub e i file del modello su Hugging Face.
Riconoscimenti#
Questo flusso di lavoro implementa e si basa sui seguenti lavori e risorse. Ringraziamo ComfyUI per il modello di flusso di lavoro MiniMax Music 3: Testo a Musica, MiniMax-AI per il progetto ufficiale MiniMax Music 3, e Comfy-Org per i pesi del modello MiniMax Music 3 per i loro contributi e manutenzione. Per dettagli autorevoli, si prega di fare riferimento alla documentazione originale e ai repository collegati di seguito.
Risorse#
- Comfy.org/Source modello di flusso di lavoro
- Documenti / Note di rilascio: MiniMax Music 3: Testo a Musica — Flusso di lavoro ComfyUI
- MiniMax-AI/MiniMax Music 3 progetto ufficiale
- GitHub: MiniMax-AI/MiniMax-Music3
- Hugging Face: MiniMaxAI/MiniMax-Music3
- Comfy-Org/MiniMax Music 3 pesi del modello
- Hugging Face: Comfy-Org/MiniMax-Music-3
Nota: L'uso dei modelli, dataset e codice di riferimento è soggetto alle rispettive licenze e termini forniti dai loro autori e manutentori.

