MiniMax H3 ComfyUI Reference to Video 4-step Turbo#
MiniMax H3 ComfyUI Reference to Video 4-step Turbo è un flusso di lavoro reference-to-video pronto per RunComfy che blocca una o più identità di personaggi da immagini statiche e genera un breve clip con audio stereo nativo in un unico passaggio accelerato. È progettato per creatori che necessitano di volti, guardaroba e messa in scena coerenti in una scena mantenendo movimento della fotocamera, dialogo e sincronizzazione labiale coerenti.
Questo grafico utilizza la pipeline ref2va di MiniMax H3 più un Turbo LoRA in modo che identità, movimento e discorso di più soggetti rimangano unificati senza la lunga pianificazione predefinita. Tagga le tue immagini statiche con <Picture N> all'interno del prompt, opzionalmente porta video e audio di riferimento e genera un clip pulito direttamente in ComfyUI su RunComfy.
Modelli chiave nel flusso di lavoro Turbo a 4 fasi di Comfyui MiniMax H3 ComfyUI Reference to Video#
- Modello di diffusione Reference-to-Video MiniMax-H3 (ref2va). Fornisce la spina dorsale generativa principale per il condizionamento su immagini statiche, video opzionali e testo per sintetizzare riprese coerenti. I pesi sono disponibili nel pacchetto Comfy-Org di MiniMax-H3 su Hugging Face. Comfy-Org/MiniMax-H3
- MiniMax-H3 Video VAE. Codifica e decodifica latenti video su cui opera il campionatore, preservando fluidità temporale e dettagli. Distribuito con lo stesso pacchetto. Comfy-Org/MiniMax-H3
- MiniMax-H3 Audio VAE. Gestisce la traccia audio stereo nativa insieme al video in modo che il discorso e l'ambiente siano creati con la ripresa. Incluso insieme ai componenti video. Comfy-Org/MiniMax-H3
- Qwen-VL 32B text encoder ottimizzato per MiniMax-H3. Traduce il prompt, inclusi i marker <Picture N> e le direzioni di scena, in segnali di condizionamento utilizzati da H3. Confezionato nel rilascio di Comfy-Org. Comfy-Org/MiniMax-H3
- MiniMax-H3 Turbo 4-step LoRA. Un LoRA di accelerazione che comprime la pianificazione in modo che la ripresa possa essere generata in un passaggio veloce mantenendo la coerenza di identità e movimento. larryvrh/MiniMax-H3-Turbo-Lora
Come utilizzare il flusso di lavoro Turbo a 4 fasi di Comfyui MiniMax H3 ComfyUI Reference to Video#
Il flusso di lavoro si muove dalle referenze e tempistica alla configurazione del modello, condizionamento, campionamento e mux finale. Puoi eseguirlo solo con immagini statiche, o combinare immagini statiche con video e audio di riferimento opzionali.
Fase 1 — Referenze, prompt e tempistica#
Carica una o più immagini statiche tramite i nodi LoadImage e pianifica di riferirle come <Picture 1>, <Picture 2>, e così via nel tuo prompt. Se hai un clip guida, passalo attraverso i nodi VHS_LoadVideo; il loro audio può anche essere trasmesso per guidare ritmo ed energia. Per fornire dialoghi o ambienti su misura, utilizza i nodi LoadAudio in aggiunta o al posto dell'audio video di riferimento. Inserisci la tua descrizione completa della ripresa in Input Text (Prompt) con eventuali blocchi di personaggi, movimenti della fotocamera e dialoghi. Il flusso di lavoro converte automaticamente la durata desiderata in un conteggio stabile di fotogrammi, allineando la timeline al passo interno di MiniMax H3.
Fase 2 — Configurazione del modello e accelerazione turbo#
Il core H3 ref2va UNet, text encoder e i VAE video e audio vengono caricati nel "Core Workspace". La patch di attenzione efficiente in termini di memoria consente riprese più grandi o risoluzioni più alte su GPU tipiche senza cambiare il tuo utilizzo. Il Turbo 4-step LoRA viene applicato da LoraLoaderModelOnly (#164) in modo da poter mantenere basso il conteggio dei passaggi preservando il blocco di identità e movimento. Non è necessario cablaggio manuale; il grafico è preconnesso per RunComfy. Se non stai utilizzando alcuni ingressi, disattiva i nodi Load Image / Load Video / Load Audio inutilizzati con Ctrl+B per mantenere l'esecuzione snella.
Fase 3 — Condizionamento e assemblaggio latente#
MiniMaxH3ReferenceToVideo (#136) ingerisce il tuo prompt, immagini statiche e eventuali riferimenti video o audio opzionali per costruire il condizionamento e una timeline latente iniziale. Usa i tag <Picture N> per legare chiaramente ogni persona o oggetto a un'immagine specifica; l'ordine segue gli slot di riferimento che hai riempito. Puoi dirigere il comportamento della fotocamera, la sincronizzazione labiale e l'ambiente in linguaggio naturale. Larghezza, altezza e durata fluiscono in questo nodo in modo che l'inquadratura e la tempistica corrispondano alla tua intenzione. Se hai molte immagini statiche, mantieni solo quelle che definiscono veramente identità e guardaroba per il battito corrente.
Fase 4 — Campionamento#
Il grafico instrada il latente attraverso una pianificazione minima e un campionatore veloce selezionato da KSamplerSelect (#123), guidato da BasicGuider (#126). BasicScheduler (#124) fornisce il pattern dei passaggi che il Turbo LoRA si aspetta, bilanciando velocità e fedeltà. SamplerCustomAdvanced (#125) risolve la timeline in un passaggio efficiente utilizzando rumore seminato per riproducibilità. Nella maggior parte dei casi puoi lasciare questi componenti come configurati e concentrarti su prompt, riferimenti e inquadratura.
Fase 5 — Decodifica, mux e salvataggio#
Dopo il campionamento, VAEDecode ripristina i fotogrammi video e VAEDecodeAudio ripristina la traccia stereo. CreateVideo (#130) multiplessa le immagini e l'audio in un file riproducibile con il tuo tasso e profondità di bit scelti. Infine, SaveVideo (#92) scrive il risultato su disco utilizzando il contenitore e codec selezionati. L'output è un breve clip con personaggi a identità bloccata, movimento della fotocamera e audio stereo nativo creato da MiniMax H3 ComfyUI Reference to Video 4-step Turbo.
Nodi chiave nel flusso di lavoro Turbo a 4 fasi di Comfyui MiniMax H3 ComfyUI Reference to Video#
MiniMaxH3ReferenceToVideo (#136)#
Questo è il cuore del flusso di lavoro che fonde testo del prompt, riferimenti statici e video/audio opzionali in condizionamento e un latente inizializzato. Regola prompt per includere i marker <Picture N> e direzioni di scena chiare per fotocamera, dialogo e ambiente. Modifica width, height e length per impostare inquadratura e durata per la ripresa. Se hai bisogno di bilanciare dettaglio contro velocità su immagini statiche, cambia ref_image_size tra modalità come la corrispondenza della dimensione di rendering contro il ridimensionamento per esecuzioni più leggere. Mantieni il tuo set di riferimenti focalizzato sulle identità di cui hai effettivamente bisogno nella scena.
LoraLoaderModelOnly (#164)#
Applica il MiniMax-H3 Turbo 4-step LoRA al modello ref2va in modo che la pianificazione possa essere compressa per inferenza rapida. La strength controlla quanto fortemente il LoRA influenza la spina dorsale; valori più alti favoriscono velocità e l'aspetto turbo mentre valori più bassi si fondono verso la base H3. Se noti perdita di dettagli fini con accelerazione estrema, riduci leggermente la forza del LoRA o allunga la pianificazione nel pianificatore per recuperare fedeltà. Vedi la scheda modello LoRA per note di versione e uso previsto. MiniMax-H3 Turbo LoRA
MiniMaxH3MemoryEfficientSageAttentionPatch (#163)#
Abilita un'implementazione di attenzione efficiente in termini di memoria compatibile con MiniMax H3 in modo da poter eseguire risoluzioni più alte o riprese più lunghe su VRAM limitata. È senza parametri in questo grafico; basta tenerlo abilitato per la migliore capacità. Il nodo fa parte di KJNodes per ComfyUI. kijai/ComfyUI-KJNodes
BasicScheduler (#124)#
Definisce la pianificazione di diffusione utilizzata durante il campionamento. Con il Turbo LoRA attivo, mantieni il conteggio dei passaggi compatto per velocità, spostandolo solo quando hai bisogno di maggiore nitidezza o stabilità. denoise ti consente di spingere una reinterpretazione più forte dei riferimenti se il tuo prompt richiede cambiamenti maggiori. Le modifiche qui interagiscono con la forza del LoRA e il campionatore scelto, quindi regola in piccoli incrementi.
KSamplerSelect (#123)#
Seleziona l'algoritmo di campionamento per il passaggio. Un campionatore semplice e stabile si abbina bene con pianificazioni turbo e aiuta a preservare l'identità tra i fotogrammi. Se enfatizzi la stilizzazione o il movimento molto veloce della fotocamera, prova campionatori alternativi che possono aggiungere texture di movimento al costo di una leggera variabilità.
CreateVideo (#130) e SaveVideo (#92)#
CreateVideo assembla i fotogrammi decodificati e l'audio in un flusso finale, dove puoi impostare fps e bit_depth per soddisfare le tue esigenze di consegna. SaveVideo seleziona il contenitore e il codec per l'esportazione; usa una combinazione ampiamente supportata per la condivisione generale o una variante di alta qualità per il lavoro post. Se stai iterando rapidamente, mantieni le impostazioni leggere e poi passa alle impostazioni di produzione per il render finale.
Extra opzionali#
- Per più personaggi, posiziona le immagini statiche più chiare con il volto in avanti per prime e riferiscile come <Picture 1>, <Picture 2>, ecc. Usa una o due immagini statiche aggiuntive per soggetto per copertura di angoli o guardaroba.
- Se porti un video di riferimento, includi una breve descrizione del comportamento desiderato della fotocamera nel prompt in modo che H3 sappia cosa preservare e cosa reinterpretare.
- Il controllo della durata si aggancia internamente a un conteggio sicuro di fotogrammi per H3; se cambi il tuo tasso di fotogrammi obiettivo in
CreateVideo, ricontrolla le note di tempistica nel tuo prompt. - I nodi helper video e audio provengono da Video Helper Suite; forniscono robusti I/O multimediali all'interno di ComfyUI. Kosinkadink/ComfyUI-VideoHelperSuite
- Cerchi un flusso di lavoro di confronto basale per MiniMax H3 reference-to-video in ComfyUI? Rivedi il template ufficiale e adatta idee come necessario. Comfy-Org workflow template
Riconoscimenti#
Questo flusso di lavoro implementa e si basa sui seguenti lavori e risorse. Riconosciamo con gratitudine MiniMax Research per il modello MiniMax H3, Comfy.org per gli esempi di flussi di lavoro MiniMax H3 ComfyUI, Comfy-Org per i pesi del modello MiniMax-H3 e larryvrh per il MiniMax-H3 Turbo LoRA per i loro contributi e la manutenzione. Per dettagli autorevoli, fare riferimento alla documentazione originale e ai repository collegati di seguito.
Risorse#
- MiniMax Research/MiniMax H3 annuncio ufficiale
- Docs / Note di rilascio: MiniMax H3 annuncio ufficiale
- Comfy.org/MiniMax H3 tutorial
- GitHub: comfy-org/docs
- Docs / Note di rilascio: MiniMax H3: ComfyUI Workflow Examples
- Comfy-Org/MiniMax-H3 model weights
- Hugging Face: Comfy-Org/MiniMax-H3
- larryvrh/MiniMax-H3 Turbo LoRA
- GitHub: Larryvrh/ComfyUI-MiniMax-H3-Turbo
- Hugging Face: larryvrh/MiniMax-H3-Turbo-Lora
Nota: L'uso dei modelli, dataset e codice di riferimento è soggetto alle rispettive licenze e termini forniti dai loro autori e manutentori.



