MiniMax H3 Fun Control: generazione controllabile da immagine di riferimento a video in ComfyUI#
Questo canvas pronto per RunComfy porta MiniMax H3 Fun Control in ComfyUI per immagini a video precise e promptable. Segue il tuo passaggio strutturale (profondità, canny, pose, HED, o MLSD) rispettando un riferimento del primo fotogramma o riferimenti completi di carattere/stile. Il layout predefinito è dotato di tre rami pronti all'uso, così puoi iniziare in modo semplice e aumentare il controllo secondo necessità.
Il Grafico 1 esegue un flusso di controllo singolo ed è abilitato per impostazione predefinita. Il Grafico 2 aggiunge una configurazione concatenata di profondità più pose con riferimenti di carattere/stile e prompt negativi veri. Il Grafico 3 rispecchia il Grafico 2 ma include una patch di accelerazione opzionale SolAttn. Puoi abilitare o bypassare qualsiasi ramo preparato dopo aver caricato il workflow.
Modelli chiave nel workflow Comfyui MiniMax H3 Fun Control#
- MiniMax H3 base UNet (fl2va) e UNet da riferimento a video (ref2va). Questi sono i backbone video che sintetizzano il movimento da un prompt e primo fotogramma (fl2va) o da riferimenti di immagine persistenti (ref2va). I pesi confezionati dalla community per ComfyUI sono disponibili nel set sperimentale MiniMax H3 su Hugging Face: MiniMax-H3-experimental.
- MiniMax H3 Video VAE e Audio VAE. Questi codificano e decodificano i flussi video e audio latenti utilizzati da H3 in modo che la pipeline possa campionare in modo efficiente, quindi trasformare i risultati in pixel e suoni. Vedi lo stesso pacchetto di modelli: MiniMax-H3-experimental.
- Codificatore di testo della famiglia Qwen-VL. Il workflow utilizza una variante MiniMax-tuned della serie Qwen-VL per analizzare i prompt e alimentare il testo di condizionamento in H3. Per informazioni su questa famiglia di modelli, vedi il repository ufficiale: Qwen2-VL.
- MiniMax H3 Fun ControlNet Union (curve-form). Questo singolo ControlNet supporta più passaggi di controllo (profondità, canny, HED, pose, MLSD) e ti permette di guidare la struttura della scena attraverso i fotogrammi. Usa il checkpoint curve-form dal rilascio ufficiale: MiniMax-H3-Fun-Controlnet-Union.
Come utilizzare il workflow Comfyui MiniMax H3 Fun Control#
Il canvas contiene tre rami preparati. Il Grafico 1 (controllo singolo) è abilitato, il Grafico 2 (profondità+pose con riferimenti) e il Grafico 3 (accelerazione SolAttn) sono bypassati. Attiva un ramo quando sei pronto; solo il ramo abilitato verrà eseguito.
01 · Controllo Singolo · ABILITATO DI DEFAULT#
01 · Modelli Questo gruppo carica il MiniMax H3 base UNet, il codificatore di testo Qwen-VL e gli H3 VAE per video e audio. Carica anche la MiniMax H3 Fun ControlNet Union in forma di curva in modo che un singolo flusso di controllo possa guidare la struttura. Non è necessario modificare nulla qui a meno che tu non voglia scambiare i pesi da un diverso set di checkpoint.
01 · CONTROLLO: questo è il nodo Carica un video di controllo che corrisponda alla larghezza, altezza e conteggio dei fotogrammi desiderati; il nodo verifica e alzerà entrambi i numeri se non corrispondono. Scegli uno dei passaggi supportati (profondità, canny, pose, HED, MLSD) in base a ciò che cattura meglio il tuo movimento e le silhouette. La forza agisce come un budget di adesione; 1.0 è il punto di partenza giusto per un controllo singolo, e spingere più in alto tende a saturare i dettagli. La finestra di programmazione del controllo definisce quando il controllo è attivo durante il campionamento; terminare la finestra intorno allo 0.6 spesso blocca la struttura in anticipo mentre libera i passaggi finali per aggiungere texture fine. Usa il checkpoint ControlNet in forma di curva; la variante a larghezza completa non si caricherà in questo nodo.
01 · Condizionamento Scrivi il tuo prompt e fornisci facoltativamente un primo fotogramma. Con un primo fotogramma, il modello si inizializza da quell'immagine e tende a preservare la composizione; senza di essa, il prompt da solo guida l'aspetto. Imposta larghezza, altezza e lunghezza qui; MiniMax H3 scatta la lunghezza alla sua griglia valida a 24 fps (17n + 5), quindi pianifica il tuo montaggio attorno a quei conteggi. Lasciare i primi e ultimi fotogrammi non impostati utilizza l'inizio e la fine naturali del modello; aggiungere un ultimo fotogramma non è richiesto per questo ramo.
01 · Campionamento Il campionatore funziona con una guida di base che non ha CFG e nessun input negativo, il che significa che i negativi nel tuo testo vengono ignorati qui; usa il Grafico 2 o passa a una guida CFG se hai bisogno di negativi. Il cambio di sigma viene applicato per bilanciare i programmi di diffusione video e audio per una decodifica stabile in seguito. La scelta del programma e del campionatore in questo ramo è sintonizzata per compromessi sensati tra qualità e velocità; una volta che hai una base, sentiti libero di sperimentare.
01 · Output I latenti campionati vengono decodificati con l'H3 Video VAE e, se presente, l'Audio VAE. I fotogrammi e l'audio vengono muxati in un video e salvati nei tuoi output. Usa il risultato salvato come controllo dello stile e torna alla forza del controllo, alla finestra di programmazione o al prompt secondo necessità.
02 · Riferimento Profondità + Pose · BYPASSATO DI DEFAULT#
02 · Modelli Questo ramo carica l'H3 reference-to-video UNet, progettato per mantenere l'identità e lo stile delle immagini statiche in ogni fotogramma. Condivide il codificatore di testo Qwen-VL e gli H3 VAE. La MiniMax H3 Fun ControlNet Union in forma di curva viene riutilizzata qui per guidare la struttura.
02 · CONTROLLO: concatenato, le forze SOMMANO a circa 1.0 Due nodi Apply sono concatenati in modo che ogni flusso di controllo aggiunga il proprio contributo, prima la profondità poi la pose. Tratta la forza come un budget: le due forze si sommano, e spingere il totale ben oltre 1.0 laverà via i dettagli e sfumerà il soggetto. La profondità è ottima per la geometria grossolana e il posizionamento della telecamera; la pose blocca gli arti e l'articolazione. Sintonizza impostando una forza a zero e ascoltando l'altra, quindi portale insieme vicino a un totale di 1.0.
02 · Condizionamento e riferimenti Usa MiniMaxH3ReferenceToVideo per alimentare immagini di riferimento reali insieme al tuo prompt in modo che identità e stile persistano attraverso tutti i fotogrammi. ref_image_size di max dà l'identità più forte (token di riferimento più grandi) a un costo computazionale; match è più veloce e spesso sufficiente per un controllo dello stile più libero. Aggiungi un ramo negativo con gli stessi riferimenti e il tuo testo negativo in modo che la guida CFG possa sottrarre ciò che non vuoi. Lunghezza, dimensione e conteggio dei fotogrammi seguono le stesse regole del Grafico 1.
02 · Campionamento Passa a un CFGGuider in modo che il condizionamento negativo si applichi effettivamente; la guida aggiunge costo perché il modello valuta sia il positivo che il negativo a ogni passaggio. I passaggi sono impostati più in alto qui per dare ai controlli concatenati e ai riferimenti spazio per risolversi; puoi ridurre per velocità una volta che ti piace l'aspetto. I controlli dei semi la riproducibilità; mantienilo fisso mentre bilanci il budget di profondità e pose.
02 · Output La decodifica e l'assemblaggio video rispecchiano il Grafico 1. Se l'output corrisponde alla struttura ma appare troppo levigato, riduci la fine della finestra di controllo verso 0.6 o abbassa leggermente la forza totale del controllo. Se l'identità scivola, alza ref_image_size o aggiungi una seconda immagine di riferimento.
03 · Accelerazione Sol-Attn Opzionale · BYPASSATO DI DEFAULT#
03 · Modelli Questo ramo rispecchia i modelli e i controlli del Grafico 2 ma aggiunge una patch di accelerazione a attenzione sparsa. Richiede l'estensione SolAttn Triton. Se non hai Triton o il pacchetto di nodi installato, lascia questo ramo bypassato.
03 · CONTROLLO: concatenato, le forze SOMMANO a circa 1.0 Si applica la stessa concatenazione di profondità più pose; mantieni la forza combinata vicino a 1.0 per risultati nitidi. Usa lo stesso approccio di tuning del Grafico 2 per trovare la divisione che meglio si adatta alla tua ripresa e dimensione del soggetto.
03 · Condizionamento e riferimenti Identico al Grafico 2. Mantieni i riferimenti coerenti tra i rami positivi e negativi in modo che CFG sottragga le caratteristiche giuste. Se vuoi la massima identità, combina ref_image_size: max con un conteggio dei passaggi leggermente più alto.
03 · OPZIONALE: attenzione sparsa SolAttnPatch accelera i blocchi pesanti di attenzione preservando la qualità dove conta di più. Lascia morton disattivato, perché riordinare i token video in ordine Z disallinea dove il ControlNet applica i suoi offset riga per riga e rimuove efficacemente il controllo. Mantenere i primi e gli ultimi blocchi del trasformatore esatti è un'impostazione sicura quando vuoi velocità senza perdere aderenza. Aspettati esecuzioni più rapide dopo che Triton compila i suoi kernel; il primo passaggio misura principalmente il tempo di compilazione.
03 · Campionamento e Output Campionamento, decodifica e salvataggio seguono il Grafico 2. Confronta SolAttn acceso contro spento con un seme fisso per giudicare la qualità e l'aderenza per il tuo contenuto. Se il controllo appare più debole con SolAttn, ricontrolla che morton sia disattivato prima di regolare le forze.
Nodi chiave nel workflow Comfyui MiniMax H3 Fun Control#
Apply H3 Fun ControlNet (#23) Aggiunge un flusso di controllo al modello corrente e prende un lotto di fotogrammi di controllo estratti dal tuo video di controllo. Usa strength come un budget di aderenza: per un controllo singolo inizia a 1.0; quando concatenando controlli mantieni la somma vicino a 1.0 per evitare dettagli lavati via. La finestra di programmazione (start_percent, end_percent) determina quando il controllo è attivo; terminare vicino a 0.6 spesso preserva le texture che il controllo non può descrivere.
Prompt + primo fotogramma -> condizionamento (#31) Costruisce il condizionamento dal tuo prompt di testo e un primo fotogramma opzionale in modo che il modello possa rispettare la composizione iniziale. Se ometti il primo fotogramma, il prompt da solo guida il contenuto. Larghezza, altezza e lunghezza vivono qui; H3 accetta lunghezze sulla sua griglia 17n + 5 a 24 fps, quindi pianifica modifiche per quelle durate.
Positivo: riferimenti + prompt (#1031) Alimenta riferimenti di immagine persistenti e testo del prompt in H3 in modo che identità e stile si mantengano in ogni fotogramma. ref_image_size di max utilizza token più grandi per un'identità più forte a costo più alto; match è più veloce con pressione di identità più leggera. Abbina questo con un ramo negativo e CFGGuider se hai bisogno di esclusioni forti.
CFGGuider: il negativo funziona solo qui (#1040) Abilita la guida senza classificazione in modo che il condizionamento negativo abbia effetto. Una guida più alta rafforza l'aderenza al prompt e al riferimento ma aumenta il calcolo perché ogni passaggio esegue sia il positivo che il negativo. Per briefing di stile lunghi e specifici, un cfg moderato può migliorare significativamente l'aderenza; testa fianco a fianco con un seme fisso.
Cambio sigma (video 12 / audio 3) (#24) Regola i programmi di diffusione per dare al percorso video e al percorso audio profili sigma appropriati prima del campionamento. Mantieni questo nella catena quando pianifichi di decodificare l'audio in modo che l'Audio VAE riceva una distribuzione latente compatibile.
Sol-Attn (OPZIONALE, necessita del pacchetto di nodi SolAttn + Triton) (#2060) Applica kernel di attenzione sparsa per accelerare H3 senza cambiare il grafico. Lascia morton disabilitato; abilitarlo riordina i token e fa sì che il contributo del ControlNet manchi le righe previste, il che sembra un output perfetto che semplicemente ignora il controllo. Per accelerazioni conservative, mantieni i blocchi del trasformatore più precoci e più tardi esatti e profila dopo la compilazione di Triton.
BasicScheduler (#42) Fornisce il programma sigma e il conteggio dei passaggi per il campionamento. Per riprese strettamente controllate, qualche passo in più può aiutare a stabilizzare la struttura prima che il controllo svanisca; per passaggi di stile rapidi, riduci i passaggi per risparmiare tempo. Combina le modifiche al programmatore con la finestra di controllo per bilanciare aderenza e texture.
Extra opzionali#
- Il video di controllo deve corrispondere esattamente alla larghezza, altezza e conteggio dei fotogrammi di generazione; il nodo verifica e alza entrambi i numeri se differiscono.
- Usa il checkpoint ControlNet in forma di curva; il rilascio originale a larghezza completa non si caricherà in
H3FunControlLoader. - Se il tuo passaggio di controllo ha grandi aree prive di caratteristiche, termina la finestra di controllo vicino a 0.6 in modo che i passaggi finali possano aggiungere texture dal prompt.
- Per clip critici per l'identità, preferisci il Grafico 2 o il Grafico 3 con
MiniMaxH3ReferenceToVideoe consideraref_image_size: max. - Hai bisogno di negativi nel Grafico 1? Sostituisci con un
CFGGuidero passa al Grafico 2/3 dove il ramo negativo è già cablato. - Risorse di progetto: nodo personalizzato ComfyUI-H3-FunControl, ControlNet in forma di curva MiniMax-H3-Fun-Controlnet-Union, pesi H3 della community MiniMax-H3-experimental, accelerazione opzionale ComfyUI-SolAttn_triton.
Ringraziamenti#
Questo workflow implementa e si basa sui seguenti lavori e risorse. Ringraziamo wyzborrero per il nodo personalizzato ComfyUI-H3-FunControl, alibabajson -pai per il modello MiniMax H3 Fun ControlNet Union, Kijai per i file di modello sperimentali MiniMax H3, kijai per il nodo opzionale di accelerazione SolAttn Triton, e RunComfy per il workflow Cloud Save per i loro contributi e la manutenzione. Per dettagli autorevoli, si prega di fare riferimento alla documentazione e ai repository originali collegati di seguito.
Risorse#
- wyzborrero/ComfyUI-H3-FunControl
- GitHub: wyzborrero/ComfyUI-H3-FunControl
- alibaba-pai/MiniMax-H3-Fun-Controlnet-Union
- Hugging Face: alibaba-pai/MiniMax-H3-Fun-Controlnet-Union
- Kijai/MiniMax-H3-experimental
- Hugging Face: Kijai/MiniMax-H3-experimental
- kijai/ComfyUI-SolAttn_triton
- GitHub: kijai/ComfyUI-SolAttn_triton
- RunComfy/Cloud Save workflow
- Docs / Release Notes: RunComfy Cloud Save workflow
Nota: L'uso dei modelli, dataset e codice di riferimento è soggetto alle rispettive licenze e termini forniti dai loro autori e manutentori.

