FastH3 8-Step V2 ComfyUI Workflow: video MiniMax H3 condizionato a due fotogrammi con audio#
FastH3 8-Step V2 ComfyUI Workflow trasforma un primo e un ultimo fotogramma di riferimento in un video MiniMax H3 continuo con audio generato sincronizzato. Utilizza il checkpoint FastVideo FastH3 V2 INT8 con una pianificazione a otto passaggi, attenzione sparsa e condizionamento esplicito del primo/ultimo fotogramma per fornire risultati rapidi e controllati.
Questo workflow è ideale per transizioni cinematografiche, movimento dei personaggi, concetti di video sociali e scatti narrativi brevi che necessitano di una composizione di apertura e chiusura definita. Se desideri soggetti stabili, inquadrature bloccate e movimento naturale mantenendo alta la velocità, il FastH3 8-Step V2 ComfyUI Workflow è costruito per te.
Modelli chiave in ComfyUI FastH3 8-Step V2 ComfyUI Workflow#
- FastVideo FastH3 8-Step V2 (INT8). La base di diffusione che genera latenti video e audio in soli otto passaggi di campionamento per iterazioni rapide. Checkpoint: FastVideo/FastVideo-FastH3-8-Step-V2 e pesi pronti per ComfyUI in FastVideo/FastVideo-FastH3-Comfy.
- Qwen3-VL 32B encoder di testo per MiniMax H3. Codifica il prompt in embedding di condizionamento utilizzati per guidare il movimento, i dettagli della scena e i segnali audio. I pesi sono distribuiti con il set di modelli ufficiale su Comfy-Org/MiniMax-H3.
- MiniMax H3 Video VAE. Decodifica latenti video in fotogrammi RGB alla risoluzione di destinazione specificata dagli input. Vedi Comfy-Org/MiniMax-H3.
- MiniMax H3 Audio VAE. Decodifica latenti audio in audio a forma d'onda che viene muxato con i fotogrammi generati. Vedi Comfy-Org/MiniMax-H3.
Come utilizzare ComfyUI FastH3 8-Step V2 ComfyUI Workflow#
Il grafico segue il modello ufficiale FastH3 da immagine a video e assembla il tuo scatto da sinistra a destra. Fornisci due immagini di riferimento e un prompt di testo, il workflow calcola il condizionamento necessario e il campionamento in otto passaggi con attenzione sparsa, quindi decodifica video e audio sincronizzati e salva un file pronto per la pubblicazione.
Input Immagine/Video (2)
- Carica i tuoi primi e ultimi fotogrammi utilizzando
LoadImage(#136) eLoadImage(#161). Scegli immagini dalla stessa scena e rapporto d'aspetto in modo che composizione e identità rimangano coerenti durante tutto il clip. - Il primo fotogramma viene ridimensionato automaticamente da
ImageScaleToTotalPixels(#142) per adattarsi a un budget di calcolo, quindiGetImageSize(#141) legge la sua larghezza e altezza in modo che la sequenza generata corrisponda a quella risoluzione. - Usa fotogrammi di riferimento naturali e accurati per la scena. L'ultimo fotogramma ancora la composizione finale in modo che lo scatto si risolva esattamente dove intendi.
Elaborazione (19)
- I pesi core sono caricati con
UNETLoader(#151),CLIPLoader(#152) e due nodiVAELoader(#143 video, #144 audio). Il nodoMiniMaxH3ImageToVideo(#155) fonde il tuo primo fotogramma, l'ultimo fotogramma, il prompt e la durata target in un unico pacchetto di condizionamento e latente iniziale. - La durata è impostata una volta con il pratico controllo
Float (duration)(#157). UnComfyMathExpression(#156) converte quel tempo in un conteggio dei fotogrammi allineato alla cadenza del modello per un'attenzione fluida lungo la sequenza. - Gli aiutanti temporali e di efficienza includono
MiniMaxH3SigmaShift(#160) per inclinare il programma per MiniMax H3,ModelAttentionBackend(#159) per selezionare l'implementazione dell'attenzione eBlockSparseAttention(#158) per ridurre il calcolo preservando la fedeltà nelle regioni importanti. - Il nucleo di denoising utilizza
BasicGuider(#150) con condizionamento positivo dal nodo immagine-a-video, unBasicSchedulera otto passaggi (#148), il campionatoreres_multistepscelto inKSamplerSelect(#147), eSamplerCustomAdvanced(#149) per produrre latenti video e audio congiunti in un solo passaggio.
Output (2)
- I latenti video vengono decodificati in fotogrammi tramite
VAEDecode(#146) mentre i latenti audio vengono decodificati tramiteVAEDecodeAudio(#145).CreateVideo(#154) quindi muxa la sequenza di immagini e l'audio in un unico clip. SaveVideo(#92) scrive il file. Imposta un prefisso del nome file e scegli un formato e un codec che corrispondano alla tua piattaforma di distribuzione o pipeline di editing.
Nodi chiave in ComfyUI FastH3 8-Step V2 ComfyUI Workflow#
MiniMaxH3ImageToVideo (#155)
- Costruisce il condizionamento dai tuoi primi e ultimi fotogrammi di riferimento più il prompt, e fornisce un latente iniziale per la generazione congiunta di video e audio. Affina il prompt di testo per descrivere il movimento, la macchina da presa, l'atmosfera e qualsiasi segnale sonoro desiderato. Mantieni identità ed elementi della scena coerenti con i riferimenti per ottenere i risultati più stabili. Regola il controllo della durata nel gruppo a sinistra per modificare la lunghezza del clip senza toccare le impostazioni del campionatore.
BlockSparseAttention (#158)
- Applica attenzione sparsa al modello caricato per accelerare il campionamento preservando l'attenzione dove è più importante. Se vedi perdita di dettagli in scene affollate, aumenta la frazione mantenuta o riserva token aggiuntivi per i soggetti in primo piano. Per scene semplici, una maggiore scarsità può accelerare significativamente i rendering.
MiniMaxH3SigmaShift (#160)
- Sposta il programma di rumore per video e audio in modo che la struttura temporale e il suono rimangano coerenti lungo la breve traiettoria a otto passaggi. Se il movimento appare traballante, sposta più in alto il video shift; se l'allineamento audio si sposta, regola leggermente l'audio shift. Usa piccoli cambiamenti e testa anteprime brevi per trovare un equilibrio.
SamplerCustomAdvanced (#149)
- Esegue il denoising a otto passaggi con il campionatore
res_multistepe il programma daBasicScheduler(#148). Mantieni il seed fisso inRandomNoise(#153) per la riproducibilità, quindi varialo per esplorare alternative una volta che il movimento ti piace. Una guida forte daBasicGuider(#150) aiuta ad aderire al prompt quando le composizioni sono complesse.
CreateVideo (#154)
- Muxa fotogrammi decodificati e audio in un clip finale. Imposta i fotogrammi al secondo per controllare il ritmo, scegli uno spazio colore per il tuo workflow e, se prevedi di modificare in seguito, scegli un codec che bilanci dimensioni e qualità per il tuo NLE.
Extra opzionali#
- Selezione dei riferimenti: scegli due fotogrammi dallo stesso obiettivo e prospettiva, con esposizione e bilanciamento del bianco corrispondenti. Riferimenti più nitidi producono solitamente texture più pulite.
- Promozione: scrivi cosa fa il soggetto, come si comporta la macchina da presa e come suona l'ambiente. Mantieni la formulazione coerente con i tuoi riferimenti per evitare derive di identità.
- Risoluzione vs velocità: se raggiungi limiti di memoria, abbassa il budget pixel target in
ImageScaleToTotalPixels(#142). Per scatti eroici, aumentalo e rendi meno variazioni. - Durata e fps: regola la durata per il ritmo, quindi imposta fps in
CreateVideo(#154) per controllare la sensazione. Il workflow allinea automaticamente il conteggio dei fotogrammi per un'attenzione stabile. - Semi e iterazione: blocca il seme del rumore per affinare i prompt e i riferimenti, quindi prova nuovi semi per alternative una volta bloccate composizione e tempistica.
- Parità del modello: il grafico segue la struttura ufficiale FastH3 I2V, quindi i suggerimenti dal modello di riferimento su Comfy-Org/workflow_templates si trasferiscono direttamente.
Riconoscimenti#
Questo workflow implementa e si basa sui seguenti lavori e risorse. Ringraziamo con gratitudine FastVideo per il modello FastH3 8-Step V2 e pesi ComfyUI, Comfy-Org per il modello di workflow FastH3 I2V, e RunningHub.ai per la fonte del workflow per i loro contributi e la manutenzione. Per dettagli autorevoli, si prega di fare riferimento alla documentazione originale e ai repository collegati di seguito.
Risorse#
- RunningHub.ai/Workflow source
- Documenti / Note di rilascio: RunningHub.ai post
- FastVideo/FastVideo-FastH3-8-Step-V2
- GitHub: hao-ai-lab/FastVideo
- Hugging Face: FastVideo/FastVideo-FastH3-8-Step-V2
- arXiv: 2405.14867
- FastVideo/FastVideo-FastH3-Comfy
- Hugging Face: FastVideo/FastVideo-FastH3-Comfy
- Comfy-Org/workflow_templates (FastH3 I2V template)
- GitHub: Comfy-Org/workflow_templates
Nota: L'uso dei modelli, dataset e codice referenziati è soggetto alle rispettive licenze e termini forniti dai loro autori e manutentori.

