ComfyUI>Workflow>FastH3 8-Step V2 ComfyUI Workflow | Fast MiniMax H3 I2V

FastH3 8-Step V2 ComfyUI Workflow | Fast MiniMax H3 I2V

Workflow Name: RunComfy/FastH3-8-Step-V2
Workflow ID: 0000...1518
Scegli i primi e gli ultimi fotogrammi. FastH3 V2 crea un video MiniMax H3 continuo tra di essi. Ottieni audio generato e movimento fluido. L'inferenza INT8 a otto passaggi risparmia tempo. L'attenzione sparsa aumenta l'efficienza. Crea transizioni cinematografiche e brevi storie con scatti iniziali e finali definiti.

FastH3 8-Step V2 ComfyUI Workflow Workflow

FastH3 8-Step V2 ComfyUI Workflow | INT8 Video + Audio
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

FastH3 8-Step V2 ComfyUI Workflow Examples

FastH3 8-Step V2 ComfyUI Workflow: video MiniMax H3 condizionato a due fotogrammi con audio#

FastH3 8-Step V2 ComfyUI Workflow trasforma un primo e un ultimo fotogramma di riferimento in un video MiniMax H3 continuo con audio generato sincronizzato. Utilizza il checkpoint FastVideo FastH3 V2 INT8 con una pianificazione a otto passaggi, attenzione sparsa e condizionamento esplicito del primo/ultimo fotogramma per fornire risultati rapidi e controllati.

Questo workflow è ideale per transizioni cinematografiche, movimento dei personaggi, concetti di video sociali e scatti narrativi brevi che necessitano di una composizione di apertura e chiusura definita. Se desideri soggetti stabili, inquadrature bloccate e movimento naturale mantenendo alta la velocità, il FastH3 8-Step V2 ComfyUI Workflow è costruito per te.

Modelli chiave in ComfyUI FastH3 8-Step V2 ComfyUI Workflow#

  • FastVideo FastH3 8-Step V2 (INT8). La base di diffusione che genera latenti video e audio in soli otto passaggi di campionamento per iterazioni rapide. Checkpoint: FastVideo/FastVideo-FastH3-8-Step-V2 e pesi pronti per ComfyUI in FastVideo/FastVideo-FastH3-Comfy.
  • Qwen3-VL 32B encoder di testo per MiniMax H3. Codifica il prompt in embedding di condizionamento utilizzati per guidare il movimento, i dettagli della scena e i segnali audio. I pesi sono distribuiti con il set di modelli ufficiale su Comfy-Org/MiniMax-H3.
  • MiniMax H3 Video VAE. Decodifica latenti video in fotogrammi RGB alla risoluzione di destinazione specificata dagli input. Vedi Comfy-Org/MiniMax-H3.
  • MiniMax H3 Audio VAE. Decodifica latenti audio in audio a forma d'onda che viene muxato con i fotogrammi generati. Vedi Comfy-Org/MiniMax-H3.

Come utilizzare ComfyUI FastH3 8-Step V2 ComfyUI Workflow#

Il grafico segue il modello ufficiale FastH3 da immagine a video e assembla il tuo scatto da sinistra a destra. Fornisci due immagini di riferimento e un prompt di testo, il workflow calcola il condizionamento necessario e il campionamento in otto passaggi con attenzione sparsa, quindi decodifica video e audio sincronizzati e salva un file pronto per la pubblicazione.

Input Immagine/Video (2)

  • Carica i tuoi primi e ultimi fotogrammi utilizzando LoadImage (#136) e LoadImage (#161). Scegli immagini dalla stessa scena e rapporto d'aspetto in modo che composizione e identità rimangano coerenti durante tutto il clip.
  • Il primo fotogramma viene ridimensionato automaticamente da ImageScaleToTotalPixels (#142) per adattarsi a un budget di calcolo, quindi GetImageSize (#141) legge la sua larghezza e altezza in modo che la sequenza generata corrisponda a quella risoluzione.
  • Usa fotogrammi di riferimento naturali e accurati per la scena. L'ultimo fotogramma ancora la composizione finale in modo che lo scatto si risolva esattamente dove intendi.

Elaborazione (19)

  • I pesi core sono caricati con UNETLoader (#151), CLIPLoader (#152) e due nodi VAELoader (#143 video, #144 audio). Il nodo MiniMaxH3ImageToVideo (#155) fonde il tuo primo fotogramma, l'ultimo fotogramma, il prompt e la durata target in un unico pacchetto di condizionamento e latente iniziale.
  • La durata è impostata una volta con il pratico controllo Float (duration) (#157). Un ComfyMathExpression (#156) converte quel tempo in un conteggio dei fotogrammi allineato alla cadenza del modello per un'attenzione fluida lungo la sequenza.
  • Gli aiutanti temporali e di efficienza includono MiniMaxH3SigmaShift (#160) per inclinare il programma per MiniMax H3, ModelAttentionBackend (#159) per selezionare l'implementazione dell'attenzione e BlockSparseAttention (#158) per ridurre il calcolo preservando la fedeltà nelle regioni importanti.
  • Il nucleo di denoising utilizza BasicGuider (#150) con condizionamento positivo dal nodo immagine-a-video, un BasicScheduler a otto passaggi (#148), il campionatore res_multistep scelto in KSamplerSelect (#147), e SamplerCustomAdvanced (#149) per produrre latenti video e audio congiunti in un solo passaggio.

Output (2)

  • I latenti video vengono decodificati in fotogrammi tramite VAEDecode (#146) mentre i latenti audio vengono decodificati tramite VAEDecodeAudio (#145). CreateVideo (#154) quindi muxa la sequenza di immagini e l'audio in un unico clip.
  • SaveVideo (#92) scrive il file. Imposta un prefisso del nome file e scegli un formato e un codec che corrispondano alla tua piattaforma di distribuzione o pipeline di editing.

Nodi chiave in ComfyUI FastH3 8-Step V2 ComfyUI Workflow#

MiniMaxH3ImageToVideo (#155)

  • Costruisce il condizionamento dai tuoi primi e ultimi fotogrammi di riferimento più il prompt, e fornisce un latente iniziale per la generazione congiunta di video e audio. Affina il prompt di testo per descrivere il movimento, la macchina da presa, l'atmosfera e qualsiasi segnale sonoro desiderato. Mantieni identità ed elementi della scena coerenti con i riferimenti per ottenere i risultati più stabili. Regola il controllo della durata nel gruppo a sinistra per modificare la lunghezza del clip senza toccare le impostazioni del campionatore.

BlockSparseAttention (#158)

  • Applica attenzione sparsa al modello caricato per accelerare il campionamento preservando l'attenzione dove è più importante. Se vedi perdita di dettagli in scene affollate, aumenta la frazione mantenuta o riserva token aggiuntivi per i soggetti in primo piano. Per scene semplici, una maggiore scarsità può accelerare significativamente i rendering.

MiniMaxH3SigmaShift (#160)

  • Sposta il programma di rumore per video e audio in modo che la struttura temporale e il suono rimangano coerenti lungo la breve traiettoria a otto passaggi. Se il movimento appare traballante, sposta più in alto il video shift; se l'allineamento audio si sposta, regola leggermente l'audio shift. Usa piccoli cambiamenti e testa anteprime brevi per trovare un equilibrio.

SamplerCustomAdvanced (#149)

  • Esegue il denoising a otto passaggi con il campionatore res_multistep e il programma da BasicScheduler (#148). Mantieni il seed fisso in RandomNoise (#153) per la riproducibilità, quindi varialo per esplorare alternative una volta che il movimento ti piace. Una guida forte da BasicGuider (#150) aiuta ad aderire al prompt quando le composizioni sono complesse.

CreateVideo (#154)

  • Muxa fotogrammi decodificati e audio in un clip finale. Imposta i fotogrammi al secondo per controllare il ritmo, scegli uno spazio colore per il tuo workflow e, se prevedi di modificare in seguito, scegli un codec che bilanci dimensioni e qualità per il tuo NLE.

Extra opzionali#

  • Selezione dei riferimenti: scegli due fotogrammi dallo stesso obiettivo e prospettiva, con esposizione e bilanciamento del bianco corrispondenti. Riferimenti più nitidi producono solitamente texture più pulite.
  • Promozione: scrivi cosa fa il soggetto, come si comporta la macchina da presa e come suona l'ambiente. Mantieni la formulazione coerente con i tuoi riferimenti per evitare derive di identità.
  • Risoluzione vs velocità: se raggiungi limiti di memoria, abbassa il budget pixel target in ImageScaleToTotalPixels (#142). Per scatti eroici, aumentalo e rendi meno variazioni.
  • Durata e fps: regola la durata per il ritmo, quindi imposta fps in CreateVideo (#154) per controllare la sensazione. Il workflow allinea automaticamente il conteggio dei fotogrammi per un'attenzione stabile.
  • Semi e iterazione: blocca il seme del rumore per affinare i prompt e i riferimenti, quindi prova nuovi semi per alternative una volta bloccate composizione e tempistica.
  • Parità del modello: il grafico segue la struttura ufficiale FastH3 I2V, quindi i suggerimenti dal modello di riferimento su Comfy-Org/workflow_templates si trasferiscono direttamente.

Riconoscimenti#

Questo workflow implementa e si basa sui seguenti lavori e risorse. Ringraziamo con gratitudine FastVideo per il modello FastH3 8-Step V2 e pesi ComfyUI, Comfy-Org per il modello di workflow FastH3 I2V, e RunningHub.ai per la fonte del workflow per i loro contributi e la manutenzione. Per dettagli autorevoli, si prega di fare riferimento alla documentazione originale e ai repository collegati di seguito.

Risorse#

Nota: L'uso dei modelli, dataset e codice referenziati è soggetto alle rispettive licenze e termini forniti dai loro autori e manutentori.

RunComfy
Copyright 2026 RunComfy. Tutti i Diritti Riservati.

RunComfy è la piattaforma principale ComfyUI che offre ComfyUI online ambiente e servizi, insieme a workflow di ComfyUI con visuali mozzafiato. RunComfy offre anche AI Models, consentire agli artisti di sfruttare gli ultimi strumenti di AI per creare arte incredibile.