MiniMax H3 ComfyUI Parlante e Cantante Doppio Personaggio Accelerazione a 4 fasi#
Questo workflow pronto per RunComfy trasforma due ritratti fissi e una breve traccia di discorso o canto in un video sincronizzato con le labbra in cui entrambi i personaggi condividono la scena. Costruito su MiniMax H3 riferimento a video con il Turbo LoRA ufficiale, offre una generazione a pochi passi mantenendo entrambe le identità stabili e il movimento della bocca bloccato al tuo audio sorgente.
MiniMax H3 ComfyUI Parlante e Cantante Doppio Personaggio Accelerazione a 4 fasi è ideale per duetti, dialoghi a due persone, trailer o anteprime rapide di performance. Porti due immagini e un file audio, aggiungi un breve prompt, scegli una dimensione e il grafico rende un mp4 con la colonna sonora originale intatta.
Modelli chiave nel workflow Comfyui MiniMax H3 ComfyUI Parlante e Cantante Doppio Personaggio Accelerazione a 4 fasi#
- MiniMax-H3 riferimento a video backbone da Comfy-Org — il modello generativo che mappa i tuoi riferimenti e il testo in un latente audio-visivo per la sintesi video. Hugging Face: Comfy-Org/MiniMax-H3
- MiniMax-H3 Video VAE FP16 — codifica e decodifica latenti video in modo che i fotogrammi possano essere denoised efficientemente e ricostruiti con fedeltà. Incluso nel pacchetto modello. Hugging Face: Comfy-Org/MiniMax-H3
- MiniMax-H3 Audio VAE FP32 — rappresenta l'audio guida nello spazio latente in modo che il movimento delle labbra e il timing siano appresi dal tuo brano. Incluso nel pacchetto modello. Hugging Face: Comfy-Org/MiniMax-H3
- Qwen3-VL 32B text encoder (varianti AWQ/NVFP confezionate per H3) — interpreta il tuo prompt per impostare scena, stile e intento di ripresa per la composizione a doppio personaggio. Incluso nel pacchetto modello. Hugging Face: Comfy-Org/MiniMax-H3
- MiniMax-H3 Turbo 4-step LoRA — accelera il campionamento in modo da poter rendere con pochi passaggi di denoise preservando identità e sincronizzazione labiale. Hugging Face: larryvrh/MiniMax-H3-Turbo-Lora
Come utilizzare Comfyui MiniMax H3 ComfyUI Parlante e Cantante Doppio Personaggio Accelerazione a 4 fasi#
Questo grafico scorre da sinistra a destra: carichi due immagini fisse di personaggi e una clip audio, imposti prompt e dimensione, quindi il percorso H3 principale fonde riferimenti e audio in un latente AV. Una breve fase di blocco audio preserva la tua colonna sonora originale mentre guida il movimento delle labbra, e il campionatore con Turbo LoRA esegue il denoise a pochi passi prima dell'assemblaggio finale del video.
- Carica Immagine (Personaggio A)
- Inserisci un'immagine chiara, frontale del personaggio A in
LoadImage(#227). Preferisci dimensioni della testa e illuminazione simili al personaggio B per una co-presenza stabile. Lo sfondo può essere semplice; identità e posa sono la priorità. Il nodo alimenta lo stack di riferimento H3 in modo che il modello apprenda chi è il primo oratore nella scena condivisa.
- Inserisci un'immagine chiara, frontale del personaggio A in
- Carica Immagine (Personaggio B)
- Fornisci il personaggio B in
LoadImage(#137). Mantieni l'inquadratura, l'orientamento e l'espressione approssimativamente comparabili al personaggio A per ridurre la deriva tra le riprese. Questo secondo riferimento consente a H3 di sintetizzare una doppia ripresa in cui entrambi gli individui rimangono coerenti mentre parlano o cantano l'uno all'altro.
- Fornisci il personaggio B in
- Carica Audio
- Aggiungi il tuo dialogo o vocali in
LoadAudio(#171). UsaAudioCrop(#177) per impostare i tempi di inizio e fine in modo che la lunghezza della clip corrisponda al segmento desiderato. L'audio pulito e centrato migliora l'articolazione della bocca e riduce il jitter del timing.
- Aggiungi il tuo dialogo o vocali in
- Prompt
- Descrivi la ripresa in
Input Text (Prompt)(#138). Frasi brevi e cinematografiche funzionano bene, ad esempio descrivendo la distanza della telecamera, lo sfondo e l'atmosfera per i due personaggi. Il prompt guida il layout e lo stile senza sostituire la guida dell'identità dalle immagini fisse e il timing dal tuo brano.
- Descrivi la ripresa in
- Selettore di Risoluzione (Dimensione)
- Scegli l'aspetto e la dimensione target in
Resolution Selector (Size)(#115). Il selettore fornisce larghezza e altezza già allineate a multipli favorevoli al modello per bilanciare dettaglio e velocità. Una nota di dimensione integrata offre preset 16:9 pronti all'uso, in modo da poter scegliere un livello di megapixel adatto al tuo budget GPU.
- Scegli l'aspetto e la dimensione target in
- Risultato
- I fotogrammi vengono decodificati e uniti con l'audio originale in
VHS_VideoCombine(#142) per produrre un mp4. Se il tuo rendering è leggermente lungo o corto, usa l'interruttore fornito in questo passaggio per adattarlo alla lunghezza dell'audio. I nomi dei file e il formato sono preconfigurati per iterazioni rapide.
- I fotogrammi vengono decodificati e uniti con l'audio originale in
- Core (Non Modificare)
- All'interno di quest'area protetta,
MiniMaxH3ReferenceToVideo(#136) fonde entrambe le immagini di riferimento, il prompt e l'audio ritagliato in un latente AV con condizionamento positivo.VRGDG_MiniMaxH3AudioDrive(#172) blocca l'audio sorgente in modo che la sincronizzazione labiale segua il tuo brano mentre la colonna sonora viene trasmessa invariata. L'UNet è ottimizzato per l'efficienza della memoria, eLoraLoaderModelOnly(#234) applica il Turbo 4-step LoRA prima che il campionatore esegua il denoise eVAEDecodericostruisca i fotogrammi. Questi interni sono ottimizzati per stabilità e velocità, quindi generalmente non è necessario modificarli.
- All'interno di quest'area protetta,
Nodi chiave nel workflow Comfyui MiniMax H3 ComfyUI Parlante e Cantante Doppio Personaggio Accelerazione a 4 fasi#
MiniMaxH3ReferenceToVideo(#136)- Il cuore del grafico che ingerisce entrambe le immagini fisse dei personaggi, il tuo prompt, larghezza, altezza e una lunghezza della clip calcolata automaticamente. Accetta anche l'audio ritagliato come riferimento in modo che il timing dei fonemi e le forme viseme si allineino alla colonna sonora. Se hai bisogno di un controllo più stretto, puoi regolare direttamente
prompt,width,heighto sovrascriverelengthper timing speciali.
- Il cuore del grafico che ingerisce entrambe le immagini fisse dei personaggi, il tuo prompt, larghezza, altezza e una lunghezza della clip calcolata automaticamente. Accetta anche l'audio ritagliato come riferimento in modo che il timing dei fonemi e le forme viseme si allineino alla colonna sonora. Se hai bisogno di un controllo più stretto, puoi regolare direttamente
VRGDG_MiniMaxH3AudioDrive(#172)- Blocca il movimento delle labbra all'audio sorgente fornito mentre garantisce che il video finale utilizzi quella stessa traccia audio. Usa questo quando desideri un timing esatto dei testi o del dialogo senza alcun cambiamento audio generativo. Fornisci vocali o dialoghi puliti per i migliori risultati.
LoraLoaderModelOnly(#234)- Carica il MiniMax-H3 Turbo 4-step LoRA in modo che il campionatore possa convergere in pochissimi passaggi. Se preferisci un denoise più lento ma potenzialmente più conservativo, puoi ridurre l'influenza LoRA; per la massima velocità, mantieni la forza predefinita. Riferimento modello: MiniMax-H3 Turbo LoRA.
SamplerCustomAdvanced(#125)- Esegue il denoise effettivo utilizzando lo scheduler e il campionatore selezionati a monte. Con il Turbo LoRA attivo, puoi rendere rapidamente con pochi passaggi; aumenta i passaggi solo se noti instabilità nel movimento. Il controllo del seme proviene da
RandomNoise(#129) per riprese riproducibili.
- Esegue il denoise effettivo utilizzando lo scheduler e il campionatore selezionati a monte. Con il Turbo LoRA attivo, puoi rendere rapidamente con pochi passaggi; aumenta i passaggi solo se noti instabilità nel movimento. Il controllo del seme proviene da
Resolution Selector (Size)(#115)- Fornisce larghezza e altezza allineate al modello in modo da non dover gestire multipli o calcoli di aspetto. Usalo per passare tra anteprima, medio e dimensioni finali mantenendo la composizione coerente. Dimensioni maggiori aumentano il dettaglio dell'identità ma richiedono più VRAM e tempo.
AudioCrop(#177)- Taglia l'audio di input al segmento esatto che desideri animare. Usa questo per eliminare il silenzio o isolare un verso o un battito di dialogo. Punti di ingresso e uscita puliti aiutano con il timing apertura/chiusura della bocca.
VHS_VideoCombine(#142)- Assembla i fotogrammi decodificati e l'audio pass-through in un mp4 condivisibile. Usa le opzioni integrate per allineare la durata alla colonna sonora e per impostare le convenzioni sui nomi dei file. Questo è il tuo passaggio finale di consegna per le uscite MiniMax H3 ComfyUI Parlante e Cantante Doppio Personaggio Accelerazione a 4 fasi.
Extra opzionali#
- Abbinare la scala del soggetto e l'angolo del viso tra entrambe le immagini per minimizzare la deriva dell'identità.
- Mantieni i prompt concisi e visivi: distanza della telecamera, ambiente, atmosfera e indicazioni di illuminazione.
- Usa semi di rumore quando iteri in modo da poter confrontare i cambiamenti in modo affidabile tra le riprese.
- Se la clip supera di poco, abilita il taglio nel passaggio di combinazione per una sincronizzazione accurata dei fotogrammi.
- Inizia con una risoluzione di livello medio, quindi aumenta una volta che il blocco e il timing sembrano corretti.
Riconoscimenti#
Questo workflow implementa e si basa sui seguenti lavori e risorse. Ringraziamo MiniMax Research per MiniMax H3, Comfy.org per il tutorial ComfyUI MiniMax H3, e Comfy-Org e larryvrh per i pesi del modello MiniMax-H3 e MiniMax-H3 Turbo LoRA per i loro contributi e manutenzione. Per dettagli autorevoli, si prega di fare riferimento alla documentazione e ai repository originali collegati di seguito.
Risorse#
- Annuncio ufficiale MiniMax Research/MiniMax H3
- Documenti / Note di rilascio: Annuncio ufficiale MiniMax H3
- Tutorial Comfy.org/MiniMax H3
- GitHub: Comfy-Org/docs
- Documenti / Note di rilascio: Tutorial Comfy.org MiniMax H3
- Pesi modello Comfy-Org/MiniMax-H3
- GitHub: Comfy-Org/workflow_templates
- Hugging Face: Comfy-Org/MiniMax-H3
- larryvrh/MiniMax-H3 Turbo LoRA
- GitHub: Larryvrh/ComfyUI-MiniMax-H3-Turbo
- Hugging Face: larryvrh/MiniMax-H3-Turbo-Lora
Nota: L'uso dei modelli, dei dataset e del codice di riferimento è soggetto alle rispettive licenze e termini forniti dai loro autori e manutentori.

