Minimax H3 I2V Dual Clock 8-Step di Alta Qualità Ultra-Veloce#
Questo flusso di lavoro ComfyUI pronto per RunComfy trasforma un'immagine di riferimento singola e un prompt combinato di movimento e audio in un video breve e sincronizzato con suono stereo nativo. Costruito attorno al condizionamento MiniMax H3 Ref2VA e a un campionatore Dual Clock a 8 passi, offre un'animazione delle immagini veloce e un suono strettamente collegato senza sacrificare la coerenza visiva.
Utilizza il flusso di lavoro Minimax H3 I2V Dual Clock 8-Step di Alta Qualità Ultra-Veloce per l'animazione cinematografica delle immagini, performance dei personaggi, veicoli, riprese di prodotti e scene atmosferiche che beneficiano di movimento sincronizzato e audio generato. Il grafico integra SageAttention per un'inferenza efficiente nella memoria e il MiniMax-H3 Turbo LoRA per una generazione accelerata mantenendo l'esperienza I2V semplice per l'utente.
Modelli chiave nel flusso di lavoro ComfyUI Minimax H3 I2V Dual Clock 8-Step di Alta Qualità Ultra-Veloce#
- Modello di Fondazione MiniMax-H3 AV. Il trasformatore audiovisivo di base che alimenta il condizionamento delle immagini di riferimento, la generazione di movimento e la sintesi audio nativa. Consulta la scheda del modello ufficiale su Hugging Face: MiniMaxAI/MiniMax-H3.
- MiniMax-H3 Turbo LoRA V4 step600. Un adattatore leggero che accelera e stabilizza MiniMax-H3 per il campionamento a 8 passi preservando la fedeltà. Scheda del modello: larryvrh/MiniMax-H3-Turbo-Lora.
- MiniMax-H3 Video VAE e Audio VAE. Decoder associati che convertono latenti audiovisivi in frame RGB e forme d'onda stereo. Assicurano un trasporto latente efficiente durante il campionamento e una decodifica di alta qualità alla fine.
Come utilizzare il flusso di lavoro ComfyUI Minimax H3 I2V Dual Clock 8-Step di Alta Qualità Ultra-Veloce#
Questo flusso di lavoro si esegue da sinistra a destra in tre fasi raggruppate: configurazione del modello e delle risorse, campionamento dual-clock e decodifica più muxing MP4. Fornisci un'immagine di riferimento e un singolo prompt che include sia la direzione visiva che una sezione "Audio:" che descrive il suono desiderato.
Caricatori H3 + Turbo LoRA (EMA)#
Questo gruppo prepara lo stack MiniMax-H3 e applica il Turbo LoRA per la velocità. Carica la tua immagine di riferimento in LoadImage, quindi scrivi un prompt di movimento descrittivo che termina con una clausola "Audio: …" in CR Prompt Text. Scegli la tua dimensione di output usando ResolutionSelector, che mantiene le dimensioni allineate a multipli di 32 per la stabilità del video. Imposta la tua durata target in secondi con il controllo Float (duration); la matematica interna del grafico la converte in un conteggio dei frame allineato al tempo del modello in modo che il campionatore funzioni senza problemi. Una patch SageAttention viene applicata al modello per ridurre l'uso di VRAM e migliorare il throughput senza modificare l'aspetto finale.
STABILE: video 4 / audio 4#
Questo gruppo esegue il cuore della generazione con un campionatore MiniMax H3 Dual Clock a 8 passi. Il blocco di condizionamento utilizza Ref2VA per fondere la tua immagine di riferimento e il prompt di testo in un latente AV, che ancora l'identità, la composizione e gli indizi sonori di alto livello. Il campionatore Dual Clock avanza video e audio con orologi separati ma sincronizzati in modo che il movimento e il suono sembrino naturalmente bloccati. Se hai bisogno di correggere il percepito anticipo o ritardo, regola gli spostamenti degli orologi video e audio per spostare in avanti o indietro uno dei due flussi fino a quando la performance non si allinea perfettamente. Una guida in stile CFG di base bilancia la fedeltà al tuo prompt con i priors appresi dal modello per un movimento cinematografico pulito.
Decodifica + MP4 sincronizzato#
Il decoder converte il latente AV finale in una sequenza di frame e una traccia audio stereo usando i MiniMax-H3 VAE dedicati. La fase VHS_VideoCombine confeziona i frame e l'audio in un singolo H.264 MP4 alla tua frequenza di fotogrammi scelta, salvando un video pronto per la condivisione. Se porti il tuo audio in seguito, puoi adattarlo alla lunghezza audio o esportare solo immagini per il montaggio esterno. Il risultato è una clip compatta e sincronizzata che preserva l'aspetto della tua immagine di riferimento aggiungendo movimento e suono realistici.
Nodi chiave nel flusso di lavoro ComfyUI Minimax H3 I2V Dual Clock 8-Step di Alta Qualità Ultra-Veloce#
MiniMaxH3AudioConditioningT8 (#6)#
Questo nodo implementa il condizionamento Ref2VA, prendendo il tuo prompt, l'immagine di riferimento, la larghezza target, l'altezza e la lunghezza per creare un latente audiovisivo e un condizionamento positivo. Usalo per impostare l'intento creativo: descrivi il movimento, il comportamento della telecamera e la continuità della scena, quindi aggiungi un segmento "Audio:" che specifica strumenti, timbro, ambiente e dinamiche. Mantieni larghezza e altezza coerenti con l'aspetto della tua immagine di riferimento per i layout più coerenti. Il controllo della lunghezza mappa la tua durata sui frame allineati al tempo interno del campionatore, il che aiuta a mantenere il movimento fluido e l'audio stabile. Fornito dal progetto ComfyUI MiniMax H3 Turbo: Larryvrh/ComfyUI-MiniMax-H3-Turbo.
MiniMaxH3DualClockSamplerT8 (#7)#
Un campionatore a 8 passi progettato specificamente per la generazione AV MiniMax-H3 con orologi video e audio separati. Produce risultati veloci e di alta qualità coordinando entrambe le linee temporali rispettando i tuoi vincoli Ref2VA. Se i visivi sembrano leggermente in anticipo o in ritardo rispetto al ritmo o all'azione, regola gli spostamenti degli orologi video e audio in piccoli incrementi per ricentrare la sincronizzazione. Mantieni il numero di passi a otto per l'equilibrio previsto di Alta Qualità Ultra-Veloce. Implementato nello stesso plugin: Larryvrh/ComfyUI-MiniMax-H3-Turbo.
LoraLoaderBypassModelOnly (#2)#
Inietta il MiniMax-H3 Turbo LoRA nel modello base per accelerare la convergenza e migliorare la stabilità a bassi passi. Se noti un eccessivo affinamento o una deriva dell'identità su alcune immagini, riduci leggermente la forza del LoRA per recuperare la neutralità. Per dettagli più incisivi o un bloccaggio temporale più forte, aumenta la forza con moderazione. Riferimento LoRA: larryvrh/MiniMax-H3-Turbo-Lora.
MiniMaxH3MemoryEfficientSageAttentionPatch (#17)#
Applica un'implementazione di attenzione efficiente in termini di memoria al modello MiniMax-H3 per un miglior throughput su GPU tipiche. Usalo così com'è per ridurre la pressione VRAM su risoluzioni più grandi e durate più lunghe. La patch è parte della suite KJNodes per ComfyUI: kijai/ComfyUI-KJNodes.
MiniMaxH3AVDecodeT8 (#11)#
Decodifica il latente audiovisivo in frame RGB e audio stereo usando i VAE MiniMax-H3 associati. Qui viene realizzata la fedeltà finale, quindi mantieni le scelte di risoluzione realistiche per la tua GPU per evitare colli di bottiglia nella decodifica. Il nodo produce frame e un segnale audio che sono allineati nel tempo con gli orologi del campionatore, pronti per il muxing. Fornito dal plugin MiniMax H3 Turbo: Larryvrh/ComfyUI-MiniMax-H3-Turbo.
VHS_VideoCombine (#12)#
Combina frame decodificati e audio stereo in un unico MP4 utilizzando Video Helper Suite. Imposta la tua frequenza di fotogrammi preferita e abilita il taglio se successivamente sostituisci l'audio personalizzato. Questo nodo finalizza la consegna in modo che tu possa visualizzare l'anteprima ed esportare rapidamente. Riferimento del progetto: Kosinkadink/ComfyUI-VideoHelperSuite.
Extra opzionali#
- Il prompting funziona meglio quando separi la direzione visiva e il design del suono. Scrivi prima la scena, poi aggiungi "Audio:" con strumenti, stile, tipo di stanza e intensità.
- Inizia con dimensioni moderate che corrispondono all'aspetto della tua immagine. Aumenta una volta che ti piace il movimento e il tempo.
- Se la sincronizzazione sembra fuori, sposta lo spostamento dell'orologio video o audio invece di cambiare la durata. Piccole regolazioni possono bloccare la performance al ritmo.
- Per riprese di personaggi, scegli immagini con chiara separazione del soggetto e illuminazione coerente per preservare l'identità attraverso il movimento.
- Rinnova per esplorare micro-variazioni nella fraseologia e nel tempo mantenendo la stessa configurazione.
Riconoscimenti#
Questo flusso di lavoro implementa e si basa sui seguenti lavori e risorse. Ringraziamo calorosamente RunningHub per il modello di flusso di lavoro Source, MiniMaxAI per i pesi del modello MiniMax-H3, e Larryvrh per MiniMax-H3 Turbo LoRA e il progetto ComfyUI MiniMax H3 Turbo per i loro contributi e la manutenzione. Per dettagli autorevoli, si prega di fare riferimento alla documentazione originale e ai repository collegati di seguito.
Risorse#
- RunningHub/Source workflow template
- Documenti / Note di rilascio: Source workflow template
- MiniMaxAI/MiniMax H3 model weights
- Hugging Face: MiniMaxAI/MiniMax-H3
- larryvrh/MiniMax-H3 Turbo LoRA
- Hugging Face: larryvrh/MiniMax-H3-Turbo-Lora
- Larryvrh/ComfyUI MiniMax H3 Turbo project
Nota: L'uso dei modelli, dataset e codice di riferimento è soggetto alle rispettive licenze e termini forniti dai loro autori e manutentori.


