ComfyUI>Workflow>MiniMax H3 All-in-One | Video Multi-Riferimento Veloce

MiniMax H3 All-in-One | Video Multi-Riferimento Veloce

Workflow Name: RunComfy/MiniMax-H3-ComfyUI
Workflow ID: 0000...1480
Usa MiniMax H3 Ref2VA per trasformare nove immagini in una ripresa cinematografica. Aggiungi opzionalmente video o audio per la guida. Mantieni personaggi e dettagli coerenti. Il suono stereo nativo arriva con la clip. SageAttention accelera il campionamento su GPU supportate. I tag delle immagini semplificano il controllo. Nota: Per macchine 2XL o più grandi, si prega di impostare sage_attention su disabilitato; altrimenti, il video generato potrebbe apparire sfocato.

All-in-One MiniMax H3 ComfyUI Multi References Accelerated Workflow

MiniMax H3 ComfyUI Workflow | Fast Multi-Reference Video
Vuoi eseguire questo workflow?
  • Workflow completamente operativi
  • Nessun nodo o modello mancante
  • Nessuna configurazione manuale richiesta
  • Presenta visuali mozzafiato

All-in-One MiniMax H3 ComfyUI Multi References Accelerated Examples

MiniMax H3 ComfyUI Multi-Riferimenti Accelerato All-in-One: video multi-riferimento Ref2VA con audio stereo sincronizzato#

Questo workflow accelerato MiniMax H3 ComfyUI Multi-Riferimenti All-in-One trasforma fino a nove riferimenti visivi più video opzionali e segnali audio in una breve clip cinematografica con una colonna sonora stereo nativa. È progettato per i creatori che desiderano riprese coerenti con il personaggio che fondono più identità, oggetti di scena o location mantenendo i tag di prompt come <Picture 1> allineati al riferimento corretto.

Costruito attorno allo stack open Comfy-Org MiniMax-H3 Ref2VA, il grafico consente l'accelerazione SageAttention per un campionamento più rapido su GPU supportate e utilizza un modello int8-potato per mantenere il VRAM sotto controllo senza sacrificare la coerenza. Il risultato è una tela pronta per RunComfy per MiniMax H3 dove guida multi-riferimento, tempistica, risoluzione ed esportazione sono connessi da capo a fine.

Modelli chiave nel workflow Comfyui All-in-One MiniMax H3 ComfyUI Multi-Riferimenti Accelerato#

  • Modello di diffusione MiniMax-H3 Ref2VA (potato int8 convrot). Generatore principale che fonde i tuoi riferimenti e il prompt in latenti video e audio congiunti. Pesi: Comfy-Org/MiniMax-H3.
  • Codificatore testo-immagine-linguaggio Qwen3-VL 32B (AWQ, confezionato con il rilascio MiniMax-H3). Interpreta il tuo prompt, inclusi tag come <Picture 1>, e condiziona il generatore. I pesi sono inclusi in Comfy-Org/MiniMax-H3.
  • MiniMax H3 Video VAE (FP16). Decodifica i latenti video in fotogrammi ad alta fedeltà. Pesi: Comfy-Org/MiniMax-H3.
  • MiniMax H3 Audio VAE (FP32). Decodifica i latenti audio in una forma d'onda stereo pulita pronta per il muxing. Pesi: Comfy-Org/MiniMax-H3.

Come usare il workflow Comfyui All-in-One MiniMax H3 ComfyUI Multi-Riferimenti Accelerato#

A un alto livello, carichi modelli, fornisci riferimenti e un prompt, il workflow costruisce il condizionamento MiniMax-H3, esegue un campionatore accelerato, poi decodifica e combina i fotogrammi video con l'audio stereo generato. I gruppi lavorano in sequenza: gli input dell'utente alimentano il condizionamento, che guida il campionamento; i risultati decodificati vanno all'esportazione.

Input dell'Utente#

Usa i nodi LoadImage per collegare fino a nove riferimenti. Mantieni un ordine coerente in modo che i tag di prompt come <Picture 1>, <Picture 2>, e così via corrispondano alle immagini previste. Scrivi la tua scena e dialogo nel campo Input Text (Prompt), mappando esplicitamente identità o risorse ai tag numerati in cima al prompt. Scegli aspetto e dimensione in Resolution Selector (Size); emette larghezza e altezza bloccate a un multiplo di 32 pixel per stabilità. Imposta la durata della clip in secondi; un'espressione interna la converte in un conteggio di fotogrammi vicino a 24 fps e la allinea a un multiplo adatto al modello per un campionamento fluido.

Modelli#

Questo gruppo carica il MiniMax-H3 UNet, il codificatore di testo Qwen3-VL 32B e entrambi i VAE. Il modello Ref2VA potato int8 riduce la memoria mantenendo la qualità del movimento e della sincronizzazione labiale. Il codificatore di testo è inizializzato per MiniMax-H3 in modo che i tag visivi nel tuo prompt si leghino ai riferimenti corretti. VAE separati per video e audio mantengono la decodifica accurata ed efficiente. I modelli sono la stessa famiglia usata dal modello ufficiale Ref2VA, adattato qui per il controllo multi-riferimento e l'audio congiunto. Riferimento: Modello MiniMax-H3 R2V.

Condizionamento#

MiniMaxH3ReferenceToVideo costruisce il condizionamento H3 effettivo e una clip latente iniziale. Ingerisce il tuo CLIP, VAE, tutte le immagini di riferimento collegate, il prompt e la larghezza, altezza e lunghezza scelte. Il nodo rispetta i tag segnaposto in modo che identità, location e oggetti di scena rimangano attaccati ai riferimenti corretti. Usa la modalità dimensione di riferimento per mantenere la composizione in scala rispetto al tuo output. Il nodo emette un flusso di condizionamento positivo e una clip latente che insieme guidano il campionatore.

Campionamento#

Prima del campionamento, il grafico avvolge il modello con PathchSageAttentionKJ per abilitare l'accelerazione SageAttention, poi instrada attraverso un gestore di VRAM in modo che le clip grandi possano adattarsi più comodamente. BasicGuider, BasicScheduler, e KSamplerSelect definiscono la strategia di guida, il programma dei passaggi e l'algoritmo del campionatore. RandomNoise semina il processo e SamplerCustomAdvanced esegue i passaggi di denoising contro il modello e il condizionamento, producendo latenti video e audio raffinati. Il layout bilancia velocità e qualità per MiniMax-H3 mantenendo le impostazioni accessibili.

Esportazione#

VAEDecode e VAEDecodeAudio convertono i latenti finali in fotogrammi e una forma d'onda stereo. VHS_VideoCombine poi muxa fotogrammi e audio in un singolo MP4 alla frequenza dei fotogrammi scelta, con un controllo di qualità tramite CRF e un semplice prefisso di nome file per l'organizzazione. Puoi visualizzare immediatamente il risultato e salvarlo nella tua cartella di output. Se in seguito fornisci un audio di riferimento esterno, l'esportatore può tagliare a quella lunghezza di traccia per un allineamento perfetto. L'esportatore proviene dalla Suite Video Helper ampiamente utilizzata per ComfyUI: ComfyUI-VideoHelperSuite.

Nodi chiave nel workflow Comfyui All-in-One MiniMax H3 ComfyUI Multi-Riferimenti Accelerato#

MiniMaxH3ReferenceToVideo (#136) Questo è il cuore del workflow dove riferimenti, prompt, dimensione e lunghezza sono fusi in condizionamento MiniMax-H3 e una clip latente. Regola il testo del prompt con mappature di tag esplicite come <Picture 1> = character A per bloccare le identità. Sintonizza larghezza, altezza e lunghezza per impostare composizione e runtime; il selettore a monte e il controllo della durata si occupano di multipli sicuri. Usa la modalità dimensione di riferimento per bilanciare la scala del soggetto rispetto al fotogramma di output. Il nodo sostiene il percorso ufficiale Ref2VA ed è adattato qui per il controllo multi-riferimento.

PathchSageAttentionKJ (#144) Avvolge il modello con SageAttention per velocizzare i livelli di attenzione e ridurre la pressione sulla memoria su GPU supportate. Lascia la modalità di accelerazione su auto per la maggior parte delle schede; abilita la compilazione del modello solo se il tuo ambiente ne beneficia. Se osservi instabilità, disattiva la modalità per confrontare le prestazioni. Fonte: ComfyUI-KJNodes.

BasicScheduler (#124) Definisce il programma sigma e i passaggi totali usati durante il denoising. Aumentare i passaggi può aggiungere dettagli ma aumenta il tempo di rendering; abbina qualsiasi cambiamento qui con un tipo di campionatore compatibile. Mantieni denoise vicino al massimo per generazione pura e considera di abbassarlo solo quando si fa un raffinamento limitato in forza.

SamplerCustomAdvanced (#125) Esegue il ciclo di diffusione con il campionatore scelto, il programma e la guida. Il campionatore predefinito bilancia stabilità temporale e fluidità di movimento per MiniMax-H3. Se cambi la famiglia del programma, scegli un campionatore progettato per esso per evitare artefatti.

Resolution Selector (Size) (#115) Emette larghezza e altezza bloccate a un multiplo di 32 pixel per forme amichevoli per GPU. Imposta megapixels per un rapido compromesso qualità vs. velocità, e scegli un aspetto come 16:9 per scatti widescreen. Usa dimensioni modeste per anteprime di bozza, poi scala una volta che tempistica e inquadratura sono bloccate.

ComfyMathExpression (#131) Trasforma i secondi richiesti in un conteggio di fotogrammi vicino a 24 fps e lo allinea a un multiplo che coopera con il campionatore e il modello. Questo aiuta a evitare tremolio temporale e problemi di tempistica di uno. Raramente hai bisogno di toccarlo; controlla il timing dall'input dei secondi.

VHS_VideoCombine (#143) Muxa fotogrammi e l'audio stereo generato in un prodotto finale. Imposta frame_rate per adattare la tua timeline di destinazione e regola crf per la qualità. Usa trim_to_audio quando fornisci una traccia esterna e vuoi un taglio perfetto a lunghezza.

Extra opzionali#

  • Dimensioni rapide 16:9 che rendono veloce e sembrano pulite: 1056×608 (0.6 MP), 1216×672 (0.8 MP), 1344×768 (0.98 MP), 1664×928 (1.5 MP), 1920×1088 (2.0 MP).
  • Mantieni i prompt espliciti: inizia con un blocco di mappatura che lega <Picture 1..9> a identità, outfit, oggetti di scena o location prima di descrivere la scena.
  • Per volti coerenti, usa immagini nitide, frontali e varia solo leggermente l'illuminazione o l'angolo attraverso i riferimenti.
  • Il dialogo e il foley funzionano bene quando scritti come frasi brevi e naturali; il VAE audio sintetizzerà una traccia stereo pulita dal latente Ref2VA.
  • Se il VRAM è stretto, rendi prima una clip più breve o abbassa i megapixel, poi ingrandisci o estendi una volta soddisfatto del movimento e dell'inquadratura.
  • Questo layout segue la discendenza del modello ufficiale Ref2VA, adattato per il controllo multi-riferimento e l'accelerazione. Vedi il modello base per contesto: Modello MiniMax-H3 R2V.

Ringraziamenti#

Questo workflow implementa e si basa sui seguenti lavori e risorse. Ringraziamo con gratitudine MiniMax per MiniMax H3, Comfy-Org per i pesi del modello MiniMax-H3 e il modello di workflow MiniMax H3 R2V, e Comfy.org per il tutorial MiniMax H3 per i loro contributi e manutenzione. Per dettagli autorevoli, si prega di fare riferimento alla documentazione originale e ai repository collegati di seguito.

Risorse#

Nota: L'uso dei modelli, dataset e codice di riferimento è soggetto alle rispettive licenze e termini forniti dai loro autori e manutentori.

RunComfy
Copyright 2026 RunComfy. Tutti i Diritti Riservati.

RunComfy è la piattaforma principale ComfyUI che offre ComfyUI online ambiente e servizi, insieme a workflow di ComfyUI con visuali mozzafiato. RunComfy offre anche AI Models, consentire agli artisti di sfruttare gli ultimi strumenti di AI per creare arte incredibile.