ComfyUI>Workflow>Video musicale MiniMax | Pipeline completa per video musicale con MiniMax H3 e Music 3

Video musicale MiniMax | Pipeline completa per video musicale con MiniMax H3 e Music 3

Workflow Name: RunComfy/MiniMax-music-video
Workflow ID: 0000...1502
Trasforma la tua canzone completa in una sequenza visiva AI connessa. Usa MiniMax H3 e MiniMax Music 3 per abbinare le scene al ritmo, ai vocali e all'umore. Guida le riprese con prompt, immagini, audio o riferimenti video. Mantieni coerenza nei personaggi e nello stile. Crea clip di performance o narrativi più velocemente. Esporta un risultato cinematografico coeso.

ComfyUI MiniMax music video Workflow

MiniMax Music Video in ComfyUI | Build full pipeline with MiniMax H3 and Music 3
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

ComfyUI MiniMax music video Examples

Video musicale MiniMax: generazione da canzone a scena in ComfyUI#

Questo flusso di lavoro trasforma una canzone completa in una sequenza di riprese video consapevoli del ritmo utilizzando MiniMax H3, con creazione musicale opzionale alimentata da MiniMax Music 3. Combina prompt di testo, immagini di riferimento e una traccia audio principale per produrre clip cinematografiche che seguono i vocali, il ritmo e l'umore. Il risultato è un video musicale MiniMax coeso con identità di personaggio coerente e transizioni di ripresa naturali.

Progettato per artisti, editori e creatori, il flusso di lavoro supporta tagli di performance, visuali guidate dai testi e inserti narrativi. Puoi portare la tua traccia o generarne una prima, quindi assemblare un video musicale MiniMax che mantenga la continuità visiva mentre evolve con la struttura della canzone.

Modelli chiave nel flusso di lavoro video musicale MiniMax in Comfyui#

Come utilizzare il flusso di lavoro video musicale MiniMax in Comfyui#

Flusso generale. Il grafico ha due parti collaboranti: 1) creazione musicale opzionale che genera una traccia principale, e 2) sintesi da riferimento a video che costruisce riprese visivamente coerenti sincronizzate con la canzone. Puoi eseguirli insieme o inserire il tuo audio e saltare la creazione musicale. L'ultimo passaggio assembla frame e audio in un video musicale MiniMax renderizzato.

1) Creazione musicale (opzionale)#

Questo gruppo pianifica e sintetizza una traccia con MiniMax Music 3. Inizia con M3SongPlanner (#6171) per redigere una didascalia strutturata e testi; entrambi sono modificabili nei visualizzatori di testo su tela prima della codifica. MiniMaxMusic3TextEncode (#6157) trasforma quel piano in condizionamento e fornisce la durata target. Viene creato un contenitore audio latente, campionato da KSampler (#6162) con il MiniMax Music 3 UNet (UNETLoader (#6156)), quindi decodificato attraverso il DAV VAE utilizzando la decodifica standard o a piastrelle a seconda del VRAM. L'audio generato viene salvato e impostato come traccia sorgente del flusso di lavoro per il video.

2) Input utente#

Fornisci o genera una canzone principale. Carica una traccia esterna con VHS_LoadAudioUpload (#6170), o usa la canzone prodotta nel passaggio 1. Aggiungi una o più immagini di riferimento per aspetto e identità utilizzando LoadImage (#6110) o un caricatore di percorso; le immagini vengono normalizzate da ImageResizeKJv2 (#6090, #6091) per un condizionamento stabile. Imposta il tuo brief creativo in (input:prompt) Text Prompt (#138) — questo prompt supporta definizioni di soggetto, note di ripresa e suggerimenti temporali. Scegli l'aspetto e la durata approssimativa tramite Resolution Selector (Size) (#115) e (input:duration) Duration (#132).

3) Patch#

PathchSageAttentionKJ (#142) attiva un'implementazione di attenzione ottimizzata che può migliorare il throughput e il comportamento della memoria su alcune GPU. Questo patch opera sul modello MiniMax H3 caricato prima del campionamento. Mantienilo abilitato a meno che non si verifichino problemi specifici del dispositivo.

4) Modelli#

UNETLoader (#127) carica la base MiniMax H3 per il riferimento al video, e un Turbo LoRA opzionale viene applicato con LoraLoaderModelOnly (#5959) per risultati più veloci e incisivi. I VAE video e audio (VAELoader (#119), VAELoader (#120)) sono preparati per la decodifica. Questi asset definiscono l'involucro di qualità e dovrebbero rimanere coerenti tra le riprese per mantenere un aspetto uniforme.

5) Condizionamento#

MiniMaxH3ReferenceToVideo (#136) fonde il tuo prompt di testo, le immagini di riferimento, la dimensione e la lunghezza target in un condizionamento e un latente iniziale. È il ponte tra il brief creativo e ciò che il campionatore renderà. Puoi inserire due immagini di riferimento in questo template per guidare guardaroba, identità e palette. Il gruppo calcola anche una lunghezza di ripresa dalla durata richiesta in modo che i frame si allineino musicalmente.

6) Campionamento#

Lo stack di campionamento combina BasicScheduler (#124), BasicGuider (#126), e SamplerCustomAdvanced (#125) con RandomNoise (#129). MiniMaxH3SigmaShift (#5960) si posiziona a monte per influenzare le gamme sigma per un movimento video più nitido e un allineamento audio stabile. Insieme iterano il latente verso immagini che seguono i tuoi riferimenti e il ritmo. Per la riproducibilità, mantieni i tuoi semi fissi mentre iteri su prompt e riferimenti.

7) Decodifica e creazione video#

VAEDecode (#122) trasforma i latenti campionati in frame e Set_video_1 (#5651) li prepara per l'esportazione. L'assemblaggio finale utilizza VHS_VideoCombine (#5645), che unisce i frame all'audio sorgente scelto e applica il tuo frame rate target dal valore src_fps memorizzato. L'output è un clip video musicale MiniMax pronto da condividere che rimane sincronizzato con la traccia.

8) Riferimento a Video#

Questo gruppo è il cuore creativo della pipeline per costruire sequenze di riprese sulla canzone principale. Riceve il modello H3 preparato, i tuoi riferimenti, e la lunghezza della ripresa calcolata, quindi esegue un passaggio di campionamento per clip. Usalo per iterare più tagli collegati attorno allo stesso soggetto in modo che identità, guardaroba e palette rimangano coerenti. Ripeti per sezione della canzone per coprire intro, versi, cori e ponti con visuali abbinate.

Nodi chiave nel flusso di lavoro video musicale MiniMax in Comfyui#

MiniMaxH3ReferenceToVideo (#136)#

Crea il condizionamento che lega prompt, riferimenti, e geometria target a un latente per il campionamento. Usalo per guidare identità e direzione artistica con un piccolo set di immagini di alta qualità e note di ripresa chiare. Se una ripresa necessita di una maggiore aderenza a un viso o un outfit, mantieni i riferimenti stilisticamente simili ed evita tagli estremi. Regola la formulazione del prompt prima di cambiare le impostazioni di campionamento, poiché questo nodo influenza fortemente chi e cosa appare sullo schermo.

MiniMaxH3SigmaShift (#5960)#

Compensa i programmi sigma nello stack MiniMax H3 per bilanciare il cambiamento temporale e l'allineamento audio. Aumenta lo spostamento video quando desideri più movimento ed evoluzione visiva all'interno di una ripresa; aumenta lo spostamento audio per favorire ritmo serrato e sensazione labiale. Usa cambiamenti modesti e prova su un clip breve prima di impegnare un'intera scena.

SamplerCustomAdvanced (#125)#

Esegue il ciclo di denoising con il scheduler e il guider selezionati. Qui si scambia tempo per qualità e texture. Per ideazione rapida, riduci i passaggi e mantieni i semi fissi; per finali, concedi più passaggi e guida delicatamente per affinare i dettagli senza perdere identità. Quando i risultati superano il tuo brief, semplifica prima il prompt o riduci i riferimenti in conflitto.

VHS_VideoCombine (#5645)#

Assembla i frame decodificati con l'audio scelto in un unico file video. Mantieni costante il frame rate su tutti i clip destinati a essere montati insieme. Se i visuali si discostano dal ritmo, conferma che la lunghezza della ripresa e gli fps siano coerenti con la traccia sorgente. Taglia nel tuo NLE solo dopo che i rendering corrispondono a tempo e indizi lirici all'interno del flusso di lavoro.

MiniMaxMusic3TextEncode (#6157)#

Codifica la didascalia e i testi che definiscono struttura, arrangiamento, e carattere vocale per MiniMax Music 3. Scrivi didascalie in sezioni che coprono metadati globali, dettagli vocali, e arrangiamento in modo che il modello comprenda l'intento. Usa tag di sezione dei testi come [Intro], [Verse], e [Chorus] per segnare transizioni che il generatore può seguire. Per aiuto nei prompt, vedi la guida e gli strumenti del repository ufficiale. MiniMax‑AI/MiniMax‑Music3

ComfyMathExpression (#131)#

Calcola un conteggio interno dei frame dalla durata target e lo aggancia a una cadenza che lo stack temporale H3 preferisce agli fps selezionati. Questo evita desincronizzazioni sottili e balbettii. Se cambi fps o durata, lascia che questo nodo ricalcoli la lunghezza in modo che il campionamento atterri sul ritmo.

Extra opzionali#

  • Scrivi prompt con una struttura stabile: definizioni del soggetto, un riassunto di una frase, quindi 1-3 paragrafi di ripresa con indizi temporali. Mantieni tempo e voce coerenti.
  • Usa 1-2 immagini di riferimento pulite per soggetto. Preferisci illuminazione neutra e un taglio medio che includa dettagli di capelli e outfit per migliorare la ritenzione dell'identità.
  • Mappa le scene prima sulla canzone. Rendi brevi clip per sezione (intro, verso, coro) e concatenali; questo mantiene il video musicale MiniMax coerente consentendo variazioni locali.
  • Mantieni risoluzione e frame rate coerenti su tutti i clip che intendi montare insieme. Cambiare uno dei due a metà progetto rende la continuità più difficile.
  • Su macchine a basso VRAM, abilita la decodifica audio a piastrelle per canzoni lunghe; su VRAM alto, la decodifica standard è di solito un po' più pulita.
  • Per ri-rendering affidabili, blocca i semi sia sul campionatore video che su quello musicale prima di esportare i finali.

Riconoscimenti#

Questo flusso di lavoro implementa e si basa sui seguenti lavori e risorse. Ringraziamo calorosamente Innovate Futures @ Benji per MiniMax Music VideoWorkflow Source per i loro contributi e manutenzione. Per dettagli autorevoli, si prega di fare riferimento alla documentazione originale e ai repository collegati di seguito.

Risorse#

Nota: L'uso dei modelli, dei dataset e del codice di riferimento è soggetto alle rispettive licenze e termini forniti dai loro autori e manutentori.

RunComfy
Copyright 2026 RunComfy. Tutti i Diritti Riservati.

RunComfy è la piattaforma principale ComfyUI che offre ComfyUI online ambiente e servizi, insieme a workflow di ComfyUI con visuali mozzafiato. RunComfy offre anche AI Models, consentire agli artisti di sfruttare gli ultimi strumenti di AI per creare arte incredibile.