Video musicale MiniMax: generazione da canzone a scena in ComfyUI#
Questo flusso di lavoro trasforma una canzone completa in una sequenza di riprese video consapevoli del ritmo utilizzando MiniMax H3, con creazione musicale opzionale alimentata da MiniMax Music 3. Combina prompt di testo, immagini di riferimento e una traccia audio principale per produrre clip cinematografiche che seguono i vocali, il ritmo e l'umore. Il risultato è un video musicale MiniMax coeso con identità di personaggio coerente e transizioni di ripresa naturali.
Progettato per artisti, editori e creatori, il flusso di lavoro supporta tagli di performance, visuali guidate dai testi e inserti narrativi. Puoi portare la tua traccia o generarne una prima, quindi assemblare un video musicale MiniMax che mantenga la continuità visiva mentre evolve con la struttura della canzone.
Modelli chiave nel flusso di lavoro video musicale MiniMax in Comfyui#
- Modello di diffusione MiniMax H3. Generatore video principale che utilizza riferimenti e condizionamento del prompt per sintetizzare sequenze di riprese allineate all'audio. Gli asset del modello sono pubblicati sotto il namespace Comfy‑Org su Hugging Face, inclusi il video VAE e il text encoder. Comfy‑Org/MiniMax‑H3
- MiniMax H3 Video VAE. Decodifica i frame latenti in immagini per anteprima ed esportazione. minimax_h3_video_vae_fp16.safetensors
- MiniMax H3 Audio VAE. Decodifica il latente audio ausiliario del modello quando necessario. minimax_h3_audio_vae_fp32.safetensors
- MiniMax H3 text encoder (variante Qwen3VL 32B confezionato per H3). Fornisce comprensione multimodale del prompt per la generazione da riferimento a video. qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
- Modello di diffusione MiniMax Music 3. Generatore da testo a musica che crea canzoni complete da una didascalia e un piano di testi; usato qui quando si desidera creare la traccia all'interno di ComfyUI. Comfy‑Org/MiniMax‑Music‑3
- MiniMax Music 3 text encoder. Codifica didascalia e testi in condizionamento per la generazione musicale. minimax_music3_text_encoder_pruned_int8_convrot.safetensors
- MiniMax Music 3 DAV VAE. Decodifica latenti audio nel waveform finale. minimax_music3_dav.safetensors
Come utilizzare il flusso di lavoro video musicale MiniMax in Comfyui#
Flusso generale. Il grafico ha due parti collaboranti: 1) creazione musicale opzionale che genera una traccia principale, e 2) sintesi da riferimento a video che costruisce riprese visivamente coerenti sincronizzate con la canzone. Puoi eseguirli insieme o inserire il tuo audio e saltare la creazione musicale. L'ultimo passaggio assembla frame e audio in un video musicale MiniMax renderizzato.
1) Creazione musicale (opzionale)#
Questo gruppo pianifica e sintetizza una traccia con MiniMax Music 3. Inizia con M3SongPlanner (#6171) per redigere una didascalia strutturata e testi; entrambi sono modificabili nei visualizzatori di testo su tela prima della codifica. MiniMaxMusic3TextEncode (#6157) trasforma quel piano in condizionamento e fornisce la durata target. Viene creato un contenitore audio latente, campionato da KSampler (#6162) con il MiniMax Music 3 UNet (UNETLoader (#6156)), quindi decodificato attraverso il DAV VAE utilizzando la decodifica standard o a piastrelle a seconda del VRAM. L'audio generato viene salvato e impostato come traccia sorgente del flusso di lavoro per il video.
2) Input utente#
Fornisci o genera una canzone principale. Carica una traccia esterna con VHS_LoadAudioUpload (#6170), o usa la canzone prodotta nel passaggio 1. Aggiungi una o più immagini di riferimento per aspetto e identità utilizzando LoadImage (#6110) o un caricatore di percorso; le immagini vengono normalizzate da ImageResizeKJv2 (#6090, #6091) per un condizionamento stabile. Imposta il tuo brief creativo in (input:prompt) Text Prompt (#138) — questo prompt supporta definizioni di soggetto, note di ripresa e suggerimenti temporali. Scegli l'aspetto e la durata approssimativa tramite Resolution Selector (Size) (#115) e (input:duration) Duration (#132).
3) Patch#
PathchSageAttentionKJ (#142) attiva un'implementazione di attenzione ottimizzata che può migliorare il throughput e il comportamento della memoria su alcune GPU. Questo patch opera sul modello MiniMax H3 caricato prima del campionamento. Mantienilo abilitato a meno che non si verifichino problemi specifici del dispositivo.
4) Modelli#
UNETLoader (#127) carica la base MiniMax H3 per il riferimento al video, e un Turbo LoRA opzionale viene applicato con LoraLoaderModelOnly (#5959) per risultati più veloci e incisivi. I VAE video e audio (VAELoader (#119), VAELoader (#120)) sono preparati per la decodifica. Questi asset definiscono l'involucro di qualità e dovrebbero rimanere coerenti tra le riprese per mantenere un aspetto uniforme.
5) Condizionamento#
MiniMaxH3ReferenceToVideo (#136) fonde il tuo prompt di testo, le immagini di riferimento, la dimensione e la lunghezza target in un condizionamento e un latente iniziale. È il ponte tra il brief creativo e ciò che il campionatore renderà. Puoi inserire due immagini di riferimento in questo template per guidare guardaroba, identità e palette. Il gruppo calcola anche una lunghezza di ripresa dalla durata richiesta in modo che i frame si allineino musicalmente.
6) Campionamento#
Lo stack di campionamento combina BasicScheduler (#124), BasicGuider (#126), e SamplerCustomAdvanced (#125) con RandomNoise (#129). MiniMaxH3SigmaShift (#5960) si posiziona a monte per influenzare le gamme sigma per un movimento video più nitido e un allineamento audio stabile. Insieme iterano il latente verso immagini che seguono i tuoi riferimenti e il ritmo. Per la riproducibilità, mantieni i tuoi semi fissi mentre iteri su prompt e riferimenti.
7) Decodifica e creazione video#
VAEDecode (#122) trasforma i latenti campionati in frame e Set_video_1 (#5651) li prepara per l'esportazione. L'assemblaggio finale utilizza VHS_VideoCombine (#5645), che unisce i frame all'audio sorgente scelto e applica il tuo frame rate target dal valore src_fps memorizzato. L'output è un clip video musicale MiniMax pronto da condividere che rimane sincronizzato con la traccia.
8) Riferimento a Video#
Questo gruppo è il cuore creativo della pipeline per costruire sequenze di riprese sulla canzone principale. Riceve il modello H3 preparato, i tuoi riferimenti, e la lunghezza della ripresa calcolata, quindi esegue un passaggio di campionamento per clip. Usalo per iterare più tagli collegati attorno allo stesso soggetto in modo che identità, guardaroba e palette rimangano coerenti. Ripeti per sezione della canzone per coprire intro, versi, cori e ponti con visuali abbinate.
Nodi chiave nel flusso di lavoro video musicale MiniMax in Comfyui#
MiniMaxH3ReferenceToVideo (#136)#
Crea il condizionamento che lega prompt, riferimenti, e geometria target a un latente per il campionamento. Usalo per guidare identità e direzione artistica con un piccolo set di immagini di alta qualità e note di ripresa chiare. Se una ripresa necessita di una maggiore aderenza a un viso o un outfit, mantieni i riferimenti stilisticamente simili ed evita tagli estremi. Regola la formulazione del prompt prima di cambiare le impostazioni di campionamento, poiché questo nodo influenza fortemente chi e cosa appare sullo schermo.
MiniMaxH3SigmaShift (#5960)#
Compensa i programmi sigma nello stack MiniMax H3 per bilanciare il cambiamento temporale e l'allineamento audio. Aumenta lo spostamento video quando desideri più movimento ed evoluzione visiva all'interno di una ripresa; aumenta lo spostamento audio per favorire ritmo serrato e sensazione labiale. Usa cambiamenti modesti e prova su un clip breve prima di impegnare un'intera scena.
SamplerCustomAdvanced (#125)#
Esegue il ciclo di denoising con il scheduler e il guider selezionati. Qui si scambia tempo per qualità e texture. Per ideazione rapida, riduci i passaggi e mantieni i semi fissi; per finali, concedi più passaggi e guida delicatamente per affinare i dettagli senza perdere identità. Quando i risultati superano il tuo brief, semplifica prima il prompt o riduci i riferimenti in conflitto.
VHS_VideoCombine (#5645)#
Assembla i frame decodificati con l'audio scelto in un unico file video. Mantieni costante il frame rate su tutti i clip destinati a essere montati insieme. Se i visuali si discostano dal ritmo, conferma che la lunghezza della ripresa e gli fps siano coerenti con la traccia sorgente. Taglia nel tuo NLE solo dopo che i rendering corrispondono a tempo e indizi lirici all'interno del flusso di lavoro.
MiniMaxMusic3TextEncode (#6157)#
Codifica la didascalia e i testi che definiscono struttura, arrangiamento, e carattere vocale per MiniMax Music 3. Scrivi didascalie in sezioni che coprono metadati globali, dettagli vocali, e arrangiamento in modo che il modello comprenda l'intento. Usa tag di sezione dei testi come [Intro], [Verse], e [Chorus] per segnare transizioni che il generatore può seguire. Per aiuto nei prompt, vedi la guida e gli strumenti del repository ufficiale. MiniMax‑AI/MiniMax‑Music3
ComfyMathExpression (#131)#
Calcola un conteggio interno dei frame dalla durata target e lo aggancia a una cadenza che lo stack temporale H3 preferisce agli fps selezionati. Questo evita desincronizzazioni sottili e balbettii. Se cambi fps o durata, lascia che questo nodo ricalcoli la lunghezza in modo che il campionamento atterri sul ritmo.
Extra opzionali#
- Scrivi prompt con una struttura stabile: definizioni del soggetto, un riassunto di una frase, quindi 1-3 paragrafi di ripresa con indizi temporali. Mantieni tempo e voce coerenti.
- Usa 1-2 immagini di riferimento pulite per soggetto. Preferisci illuminazione neutra e un taglio medio che includa dettagli di capelli e outfit per migliorare la ritenzione dell'identità.
- Mappa le scene prima sulla canzone. Rendi brevi clip per sezione (intro, verso, coro) e concatenali; questo mantiene il video musicale MiniMax coerente consentendo variazioni locali.
- Mantieni risoluzione e frame rate coerenti su tutti i clip che intendi montare insieme. Cambiare uno dei due a metà progetto rende la continuità più difficile.
- Su macchine a basso VRAM, abilita la decodifica audio a piastrelle per canzoni lunghe; su VRAM alto, la decodifica standard è di solito un po' più pulita.
- Per ri-rendering affidabili, blocca i semi sia sul campionatore video che su quello musicale prima di esportare i finali.
Riconoscimenti#
Questo flusso di lavoro implementa e si basa sui seguenti lavori e risorse. Ringraziamo calorosamente Innovate Futures @ Benji per MiniMax Music VideoWorkflow Source per i loro contributi e manutenzione. Per dettagli autorevoli, si prega di fare riferimento alla documentazione originale e ai repository collegati di seguito.
Risorse#
- Innovate Futures @ Benji/MiniMax Music VideoWorkflow Source
- Documenti / Note di rilascio: MiniMax Music VideoWorkflow Source
Nota: L'uso dei modelli, dei dataset e del codice di riferimento è soggetto alle rispettive licenze e termini forniti dai loro autori e manutentori.

