ComfyUI>Workflow>MiniMax H3 Parlante e Cantante Doppio Personaggio | Accelerazione a 4 fasi

MiniMax H3 Parlante e Cantante Doppio Personaggio | Accelerazione a 4 fasi

Workflow Name: RunComfy/MiniMax-H3-Talking-Singing-Dual-Character-4-step-Acceleration
Workflow ID: 0000...1486
Trasforma due immagini fisse in una performance di dialogo e canto faccia a faccia. Guida il dialogo o i vocali con una clip audio. Hailuo H3 mantiene entrambe le identità stabili. Il blocco audio offre una sincronizzazione labiale precisa. Turbo LoRA funziona in quattro fasi. Ottieni duetti veloci senza uno stack di sincronizzazione labiale separato.
Avoid using 2X Large or 2XL Plus for this workflow. These machine types may cause the generated video to contain only noise. Use Medium, Large, or X Large instead.

MiniMax H3 ComfyUI Talking and Singing Dual Character 4-step Acceleration Workflow

MiniMax H3 Talking & Singing Dual Character | 4-step Acceleration
Vuoi eseguire questo workflow?
  • Workflow completamente operativi
  • Nessun nodo o modello mancante
  • Nessuna configurazione manuale richiesta
  • Presenta visuali mozzafiato

MiniMax H3 ComfyUI Talking and Singing Dual Character 4-step Acceleration Examples

MiniMax H3 ComfyUI Parlante e Cantante Doppio Personaggio Accelerazione a 4 fasi#

Questo workflow pronto per RunComfy trasforma due ritratti fissi e una breve traccia di discorso o canto in un video sincronizzato con le labbra in cui entrambi i personaggi condividono la scena. Costruito su MiniMax H3 riferimento a video con il Turbo LoRA ufficiale, offre una generazione a pochi passi mantenendo entrambe le identità stabili e il movimento della bocca bloccato al tuo audio sorgente.

MiniMax H3 ComfyUI Parlante e Cantante Doppio Personaggio Accelerazione a 4 fasi è ideale per duetti, dialoghi a due persone, trailer o anteprime rapide di performance. Porti due immagini e un file audio, aggiungi un breve prompt, scegli una dimensione e il grafico rende un mp4 con la colonna sonora originale intatta.

Modelli chiave nel workflow Comfyui MiniMax H3 ComfyUI Parlante e Cantante Doppio Personaggio Accelerazione a 4 fasi#

  • MiniMax-H3 riferimento a video backbone da Comfy-Org — il modello generativo che mappa i tuoi riferimenti e il testo in un latente audio-visivo per la sintesi video. Hugging Face: Comfy-Org/MiniMax-H3
  • MiniMax-H3 Video VAE FP16 — codifica e decodifica latenti video in modo che i fotogrammi possano essere denoised efficientemente e ricostruiti con fedeltà. Incluso nel pacchetto modello. Hugging Face: Comfy-Org/MiniMax-H3
  • MiniMax-H3 Audio VAE FP32 — rappresenta l'audio guida nello spazio latente in modo che il movimento delle labbra e il timing siano appresi dal tuo brano. Incluso nel pacchetto modello. Hugging Face: Comfy-Org/MiniMax-H3
  • Qwen3-VL 32B text encoder (varianti AWQ/NVFP confezionate per H3) — interpreta il tuo prompt per impostare scena, stile e intento di ripresa per la composizione a doppio personaggio. Incluso nel pacchetto modello. Hugging Face: Comfy-Org/MiniMax-H3
  • MiniMax-H3 Turbo 4-step LoRA — accelera il campionamento in modo da poter rendere con pochi passaggi di denoise preservando identità e sincronizzazione labiale. Hugging Face: larryvrh/MiniMax-H3-Turbo-Lora

Come utilizzare Comfyui MiniMax H3 ComfyUI Parlante e Cantante Doppio Personaggio Accelerazione a 4 fasi#

Questo grafico scorre da sinistra a destra: carichi due immagini fisse di personaggi e una clip audio, imposti prompt e dimensione, quindi il percorso H3 principale fonde riferimenti e audio in un latente AV. Una breve fase di blocco audio preserva la tua colonna sonora originale mentre guida il movimento delle labbra, e il campionatore con Turbo LoRA esegue il denoise a pochi passi prima dell'assemblaggio finale del video.

  • Carica Immagine (Personaggio A)
    • Inserisci un'immagine chiara, frontale del personaggio A in LoadImage (#227). Preferisci dimensioni della testa e illuminazione simili al personaggio B per una co-presenza stabile. Lo sfondo può essere semplice; identità e posa sono la priorità. Il nodo alimenta lo stack di riferimento H3 in modo che il modello apprenda chi è il primo oratore nella scena condivisa.
  • Carica Immagine (Personaggio B)
    • Fornisci il personaggio B in LoadImage (#137). Mantieni l'inquadratura, l'orientamento e l'espressione approssimativamente comparabili al personaggio A per ridurre la deriva tra le riprese. Questo secondo riferimento consente a H3 di sintetizzare una doppia ripresa in cui entrambi gli individui rimangono coerenti mentre parlano o cantano l'uno all'altro.
  • Carica Audio
    • Aggiungi il tuo dialogo o vocali in LoadAudio (#171). Usa AudioCrop (#177) per impostare i tempi di inizio e fine in modo che la lunghezza della clip corrisponda al segmento desiderato. L'audio pulito e centrato migliora l'articolazione della bocca e riduce il jitter del timing.
  • Prompt
    • Descrivi la ripresa in Input Text (Prompt) (#138). Frasi brevi e cinematografiche funzionano bene, ad esempio descrivendo la distanza della telecamera, lo sfondo e l'atmosfera per i due personaggi. Il prompt guida il layout e lo stile senza sostituire la guida dell'identità dalle immagini fisse e il timing dal tuo brano.
  • Selettore di Risoluzione (Dimensione)
    • Scegli l'aspetto e la dimensione target in Resolution Selector (Size) (#115). Il selettore fornisce larghezza e altezza già allineate a multipli favorevoli al modello per bilanciare dettaglio e velocità. Una nota di dimensione integrata offre preset 16:9 pronti all'uso, in modo da poter scegliere un livello di megapixel adatto al tuo budget GPU.
  • Risultato
    • I fotogrammi vengono decodificati e uniti con l'audio originale in VHS_VideoCombine (#142) per produrre un mp4. Se il tuo rendering è leggermente lungo o corto, usa l'interruttore fornito in questo passaggio per adattarlo alla lunghezza dell'audio. I nomi dei file e il formato sono preconfigurati per iterazioni rapide.
  • Core (Non Modificare)
    • All'interno di quest'area protetta, MiniMaxH3ReferenceToVideo (#136) fonde entrambe le immagini di riferimento, il prompt e l'audio ritagliato in un latente AV con condizionamento positivo. VRGDG_MiniMaxH3AudioDrive (#172) blocca l'audio sorgente in modo che la sincronizzazione labiale segua il tuo brano mentre la colonna sonora viene trasmessa invariata. L'UNet è ottimizzato per l'efficienza della memoria, e LoraLoaderModelOnly (#234) applica il Turbo 4-step LoRA prima che il campionatore esegua il denoise e VAEDecode ricostruisca i fotogrammi. Questi interni sono ottimizzati per stabilità e velocità, quindi generalmente non è necessario modificarli.

Nodi chiave nel workflow Comfyui MiniMax H3 ComfyUI Parlante e Cantante Doppio Personaggio Accelerazione a 4 fasi#

  • MiniMaxH3ReferenceToVideo (#136)
    • Il cuore del grafico che ingerisce entrambe le immagini fisse dei personaggi, il tuo prompt, larghezza, altezza e una lunghezza della clip calcolata automaticamente. Accetta anche l'audio ritagliato come riferimento in modo che il timing dei fonemi e le forme viseme si allineino alla colonna sonora. Se hai bisogno di un controllo più stretto, puoi regolare direttamente prompt, width, height o sovrascrivere length per timing speciali.
  • VRGDG_MiniMaxH3AudioDrive (#172)
    • Blocca il movimento delle labbra all'audio sorgente fornito mentre garantisce che il video finale utilizzi quella stessa traccia audio. Usa questo quando desideri un timing esatto dei testi o del dialogo senza alcun cambiamento audio generativo. Fornisci vocali o dialoghi puliti per i migliori risultati.
  • LoraLoaderModelOnly (#234)
    • Carica il MiniMax-H3 Turbo 4-step LoRA in modo che il campionatore possa convergere in pochissimi passaggi. Se preferisci un denoise più lento ma potenzialmente più conservativo, puoi ridurre l'influenza LoRA; per la massima velocità, mantieni la forza predefinita. Riferimento modello: MiniMax-H3 Turbo LoRA.
  • SamplerCustomAdvanced (#125)
    • Esegue il denoise effettivo utilizzando lo scheduler e il campionatore selezionati a monte. Con il Turbo LoRA attivo, puoi rendere rapidamente con pochi passaggi; aumenta i passaggi solo se noti instabilità nel movimento. Il controllo del seme proviene da RandomNoise (#129) per riprese riproducibili.
  • Resolution Selector (Size) (#115)
    • Fornisce larghezza e altezza allineate al modello in modo da non dover gestire multipli o calcoli di aspetto. Usalo per passare tra anteprima, medio e dimensioni finali mantenendo la composizione coerente. Dimensioni maggiori aumentano il dettaglio dell'identità ma richiedono più VRAM e tempo.
  • AudioCrop (#177)
    • Taglia l'audio di input al segmento esatto che desideri animare. Usa questo per eliminare il silenzio o isolare un verso o un battito di dialogo. Punti di ingresso e uscita puliti aiutano con il timing apertura/chiusura della bocca.
  • VHS_VideoCombine (#142)
    • Assembla i fotogrammi decodificati e l'audio pass-through in un mp4 condivisibile. Usa le opzioni integrate per allineare la durata alla colonna sonora e per impostare le convenzioni sui nomi dei file. Questo è il tuo passaggio finale di consegna per le uscite MiniMax H3 ComfyUI Parlante e Cantante Doppio Personaggio Accelerazione a 4 fasi.

Extra opzionali#

  • Abbinare la scala del soggetto e l'angolo del viso tra entrambe le immagini per minimizzare la deriva dell'identità.
  • Mantieni i prompt concisi e visivi: distanza della telecamera, ambiente, atmosfera e indicazioni di illuminazione.
  • Usa semi di rumore quando iteri in modo da poter confrontare i cambiamenti in modo affidabile tra le riprese.
  • Se la clip supera di poco, abilita il taglio nel passaggio di combinazione per una sincronizzazione accurata dei fotogrammi.
  • Inizia con una risoluzione di livello medio, quindi aumenta una volta che il blocco e il timing sembrano corretti.

Riconoscimenti#

Questo workflow implementa e si basa sui seguenti lavori e risorse. Ringraziamo MiniMax Research per MiniMax H3, Comfy.org per il tutorial ComfyUI MiniMax H3, e Comfy-Org e larryvrh per i pesi del modello MiniMax-H3 e MiniMax-H3 Turbo LoRA per i loro contributi e manutenzione. Per dettagli autorevoli, si prega di fare riferimento alla documentazione e ai repository originali collegati di seguito.

Risorse#

Nota: L'uso dei modelli, dei dataset e del codice di riferimento è soggetto alle rispettive licenze e termini forniti dai loro autori e manutentori.

RunComfy
Copyright 2026 RunComfy. Tutti i Diritti Riservati.

RunComfy è la piattaforma principale ComfyUI che offre ComfyUI online ambiente e servizi, insieme a workflow di ComfyUI con visuali mozzafiato. RunComfy offre anche AI Models, consentire agli artisti di sfruttare gli ultimi strumenti di AI per creare arte incredibile.