MiniMax H3 Sostituzione del Personaggio ComfyUI#
MiniMax H3 Sostituzione del Personaggio ComfyUI è un workflow di editing video guidato da riferimenti per sostituire una persona o un personaggio in un clip sorgente mantenendo il movimento originale, il timing della telecamera e il layout della scena intatti. Si abbina al rilevamento e mascheramento del soggetto SAM3 con MiniMax H3 Ref2VA affinché l'identità sostitutiva rimanga coerente attraverso i fotogrammi senza ritocchi manuali.
Costruito per i creatori che necessitano di sostituzioni affidabili di personaggi, sostituzioni di identità, variazioni di abbigliamento o modifiche guidate da riferimenti all'interno di ComfyUI, questo workflow accetta un video sorgente, una o più immagini di riferimento e un audio di riferimento opzionale. Il risultato è una sostituzione che preserva il movimento e che sembra nativa alla ripresa, alimentata dalla logica MiniMax H3 Sostituzione del Personaggio ComfyUI end to end.
Modelli chiave nel workflow Comfyui MiniMax H3 Sostituzione del Personaggio ComfyUI#
- MiniMax H3 Ref2VA diffusion backbone. Fornisce la generazione da riferimento a audio-video che trasferisce identità e aspetto rispettando movimento e timing. Vedi la scheda modello ufficiale per le capacità e le linee guida sui prompt qui e i pesi e VAE pronti per Comfy qui.
- MiniMax H3 Video VAE e Audio VAE. Codifica e decodifica latenti video e audio per campionamento efficiente e ricostruzione fedele. Inclusi nel bundle Comfy-Org MiniMax H3 sopra.
- Qwen3-VL 32B text encoder. Funziona come l'encoder di testo multimodale usato da MiniMax H3 per interpretare prompt e riferimenti per un trasferimento coerente dell'identità.
- SAM 3.1 Multiplex. Un modello di segmentazione di alta qualità usato per rilevare e mascherare il soggetto sullo schermo in modo che il workflow possa isolare i segnali di movimento e preparare un riferimento più pulito per la sostituzione del personaggio. Checkpoint ospitato da Comfy-Org qui.
Come usare il workflow Comfyui MiniMax H3 Sostituzione del Personaggio ComfyUI#
Il workflow si muove dalla preparazione delle maschere e dei riferimenti al condizionamento H3, campionamento e rendering finale. I gruppi vengono eseguiti in sequenza per produrre una sostituzione che preserva il movimento e che sostituisce solo il performer.
Mascheramento#
Questo gruppo carica il tuo clip sorgente, opzionalmente lo ritaglia e prepara maschere per fotogramma. LoadVideo (#459) alimenta Video Slice (#483) in modo da poter impostare l'ora di inizio e la durata. I fotogrammi e l'audio vengono estratti con GetVideoComponents (#460, #505). SAM3_Detect (#503) utilizza un breve testo di categoria da CLIPTextEncode (#502), come "persona", per trovare il soggetto e produrre maschere. La maschera viene visualizzata tramite MaskToImage (#491), quindi ImageCompositeMasked (#454) e ImageScaleToTotalPixels (#456) preparano un riferimento di movimento leggero che mette in risalto il performer per MiniMax H3.
Modelli#
Questo gruppo carica i principali asset MiniMax H3 usati all'inferenza. UNETLoader (#463) inizializza i pesi di diffusione H3 Ref2VA, CLIPLoader (#465) imposta l'encoder di testo Qwen3-VL, e VAELoader (#470, #474) caricano i VAE video e audio. Insieme definiscono il contesto del modello che il campionatore userà per il trasferimento dell'identità e la decodifica.
Condizionamento#
Questo gruppo trasforma i tuoi riferimenti e prompt nel condizionamento H3 e in un latente iniziale. MiniMaxH3ReferenceToVideo (#464) accetta un'immagine di identità sostitutiva, il riferimento di movimento preparato dal gruppo di Mascheramento, e un audio di riferimento opzionale dalla sorgente. Larghezza e altezza provengono da ResolutionSelector (#501); la lunghezza in fotogrammi viene calcolata automaticamente da ComfyMathExpression (#481) da una durata di facile comprensione impostata con Float (Duration) (#480), adattandosi a un conteggio dei fotogrammi amichevole per il modello. Un prompt strutturato è generato da DapaoH3VideoPromptNode (#517) e passato attraverso easy showAnything (#515), oppure puoi scrivere il tuo secondo la guida ufficiale MiniMax H3 riferimento-video qui.
Campionamento#
Questo gruppo esegue la rimozione del rumore con il campionatore e il programma selezionati. RandomNoise (#467) semina il processo per la riproducibilità. BasicScheduler (#473) e KSamplerSelect (#468) definiscono il programma dei passaggi e l'algoritmo, mentre BasicGuider (#466) fonde il modello con il condizionamento positivo dal nodo H3. SamplerCustomAdvanced (#469) esegue il raffinamento iterativo per produrre i latenti video finali.
Decodifica e creazione video#
Questo gruppo trasforma i latenti in un risultato riproducibile. VAEDecode (#472) ricostruisce i fotogrammi, che vengono combinati con l'audio del tuo clip in CreateVideo (#476) per preservare il timing e l'ambiente. SaveVideo (#482) scrive un file di output con il formato e il codec scelti in modo che il tuo render MiniMax H3 Sostituzione del Personaggio ComfyUI sia pronto per essere rivisto o pubblicato.
Testato con queste impostazioni#
Quest'area di supporto contiene note sui prompt ed esempi di metadati usati durante la creazione. Non è richiesta per il funzionamento ma può ispirare la tua struttura di prompt e le scelte di timing.
Nodi chiave nel workflow Comfyui MiniMax H3 Sostituzione del Personaggio ComfyUI#
MiniMaxH3ReferenceToVideo (#464)#
Centrale per il trasferimento dell'identità. Accetta un'immagine di sostituzione, un riferimento video che preserva il movimento e un audio di riferimento opzionale, quindi emette sia il condizionamento positivo che un latente iniziale. I parametri utili da considerare sono prompt, width, height e length. Se fornisci più riferimenti, mantienili visivamente coerenti per evitare derive di identità.
SAM3_Detect (#503)#
Trova e segmenta il soggetto sullo schermo che verrà sostituito. Un breve prompt di categoria tramite CLIPTextEncode (#502) guida il rilevamento. Regola le opzioni di qualità della maschera solo quando la selezione predefinita manca il soggetto o include lo sfondo; maschere più pulite di solito producono sostituzioni più stabili.
ImageCompositeMasked (#454)#
Costruisce un riferimento focalizzato sul performer dai fotogrammi tagliati e dalla maschera SAM3. Usa x, y, e resize_source solo se hai bisogno di allineare gli overlay o adattare la scalatura dei fotogrammi prima di inviare le immagini all'input di riferimento H3. L'obiettivo è un segnale di movimento che isola l'attore lasciando intatta la geometria della scena.
ResolutionSelector (#501)#
Controlla la dimensione di rendering target in pochi clic. Scegli un aspetto e un budget in megapixel che si adattino al tuo hardware o alle esigenze di turnaround. Inizia in modo modesto, conferma la stabilità dell'identità, poi aumenta la risoluzione per il tuo passaggio finale.
SamplerCustomAdvanced (#469)#
Esegue la rimozione del rumore usando il pianificatore, il campionatore, la guida, il rumore e il latente iniziale. Per uno sviluppo più rapido, prova un programma più leggero o un campionatore ottimizzato per la velocità, poi passa alle tue impostazioni di qualità preferite una volta che identità e timing sembrano corretti.
Extra opzionali#
- Selezione del riferimento
- Usa da 1 a 3 immagini nitide e ben illuminate che mostrano chiaramente il viso e l'abbigliamento target. Evita identità miste o pose estreme.
- Mantieni l'età, l'acconciatura e l'abbigliamento del soggetto di riferimento coerenti per minimizzare la deriva durante i movimenti lunghi.
- Consigli per il mascheramento
- Se SAM3 include lo sfondo, affina il tuo testo di categoria o riesegui con una soglia diversa. Maschere pulite riducono l'alonatura e mantengono stabile l'illuminazione della scena.
- Prompt
- Descrivi solo identità e abbigliamento nella sostituzione mentre dici a H3 di preservare il movimento originale e la scena. La guida ufficiale ha esempi concisi qui.
- Template
- Se vuoi un punto di partenza minimo, confronta il tuo grafico con il template ufficiale ComfyUI MiniMax H3 R2V qui.
- Diritti e sicurezza
- Usa solo sembianze, performance e audio che hai il diritto di trasformare. MiniMax H3 Sostituzione del Personaggio ComfyUI è potente, quindi applicalo responsabilmente.
Ringraziamenti#
Questo workflow implementa e si basa sui seguenti lavori e risorse. Ringraziamo con gratitudine MiniMaxAI per il modello MiniMax-H3 e la guida ai prompt video di riferimento, Comfy-Org per il template ufficiale ComfyUI MiniMax H3 R2V, e RunningHub.ai per la fonte del workflow e il riferimento per i loro contributi e manutenzione. Per dettagli autorevoli, si prega di fare riferimento alla documentazione originale e ai repository collegati di seguito.
Risorse#
- RunningHub.ai/Fonte del workflow e riferimento
- Documenti / Note di rilascio: Fonte del workflow e riferimento
- MiniMaxAI/Modello ufficiale MiniMax H3
- GitHub: MiniMax-AI/MiniMax-H3
- Hugging Face: MiniMaxAI/MiniMax-H3
- MiniMaxAI/Guida ai prompt video di riferimento MiniMax H3
- GitHub: MiniMax-AI/MiniMax-H3
- Hugging Face: MiniMaxAI/MiniMax-H3
- Documenti / Note di rilascio: Guida ai prompt video di riferimento MiniMax H3
- Comfy-Org/Template ufficiale ComfyUI MiniMax H3 R2V
- GitHub: Comfy-Org/workflow_templates (video_minimax_h3_r2v.json)
- Hugging Face: Comfy-Org/MiniMax-H3
Nota: L'uso dei modelli, dei dataset e del codice di riferimento è soggetto alle rispettive licenze e termini forniti dai loro autori e manutentori.

