FastH3 4-Step ComfyUI Workflow#
Questo grafico pronto per RunComfy offre una rapida creazione di video da testo e immagini di prima cornice di MiniMax H3 con audio sincronizzato. Il FastH3 4-Step ComfyUI Workflow segue il percorso a 4 fasi FastVideo VSA-DataFree mantenendo un pianificatore a 8 fasi in ComfyUI per una stabilità visiva pratica. È adatto per scene cinematografiche, momenti guidati dai personaggi, scatti di prodotto e clip ricche di atmosfera in cui l'iterazione rapida è importante.
Il flusso di lavoro auto-muxa i fotogrammi e l'audio in un MP4 e supporta un ramo opzionale I2V di prima cornice. Collega un'immagine iniziale per scatti sensibili alla continuità o lasciala vuota per una generazione T2V pura. I prompt possono essere strutturati e di lunga durata, permettendoti di mantenere la continuità visiva e sonora tra le clip.
Modelli chiave nel Comfyui FastH3 4-Step ComfyUI Workflow#
- Modello di diffusione MiniMax H3 (FL2VA). Guida la generazione video e audio cross-modale con un design latente unificato. Riferimento alla famiglia di modelli: MiniMaxAI/MiniMax-H3.
- Pesi FastVideo FastH3 4-step VSA-DataFree. Abilita il percorso ultra-corto a 4 fasi utilizzato qui per la bozza a velocità prioritaria. Riferimento ai pesi: FastVideo/FastVideo-FastH3-4-step-Preview-v1-VSA-DataFree.
- Codificatore di testo Qwen3-VL 32B AWQ per MiniMax H3. Fornisce una comprensione del prompt ad alta capacità per stile, composizione e suggerimenti audio. Distribuito con le risorse Comfy-Org MiniMax H3: Comfy-Org/MiniMax-H3.
- MiniMax H3 Video VAE (FP16). Decodifica video latente in fotogrammi RGB con il codec nativo di H3. Riferimento alle risorse: Comfy-Org/MiniMax-H3.
- MiniMax H3 Audio VAE (FP32). Decodifica la traccia audio latente allineata ai fotogrammi generati. Riferimento alle risorse: Comfy-Org/MiniMax-H3.
Come utilizzare il Comfyui FastH3 4-Step ComfyUI Workflow#
A un livello elevato, gli input dell'utente definiscono risoluzione, durata e prompt. Il grafico prepara i componenti di MiniMax H3, costruisce il condizionamento per T2V o I2V, quindi esegue un passaggio di campionamento conciso ottimizzato per il percorso a 4 fasi FastH3. Infine, decodifica video e audio e li combina in un MP4 pronto per la condivisione.
Input dell'utente#
Imposta il tuo look e il tuo tempo di destinazione nel gruppo Input dell'utente. Usa ResolutionSelector (#115) per scegliere aspetto e budget pixel; le risoluzioni sono quantizzate a multipli di 32 per compatibilità con il decoder. Scegli i fotogrammi al secondo tramite (input:FPS) PrimitiveFloat (#5986) e la lunghezza del clip in secondi tramite (input:Duration) Seconds (#221). L'espressione in ComfyMathExpression (#220) converte la durata in un conteggio di fotogrammi e la aggancia a un multiplo adatto al passo, offrendo pianificazione stabile e lunghezze di clip coerenti. Aggiungi il tuo prompt di lunga durata in (input:prompt) Text Prompt PrimitiveStringMultiline (#6005); un aiuto StringConcatenate (#6115) ti consente di mantenere ancore di stile o continuità riutilizzabili.
Modelli#
Il gruppo Modelli carica i componenti principali di H3 e modifiche opzionali all'attenzione. UNETLoader (#215) seleziona i pesi FL2VA FastVideo VSA-DataFree che rendono il percorso a 4 fasi praticabile per la velocità mantenendo la coerenza sotto un pianificatore a 8 fasi. CLIPLoader (#216) introduce il codificatore di testo Qwen3-VL 32B AWQ per un ricco ancoraggio linguistico. Due nodi VAELoader gestiscono i rami video e audio per una decodifica fedele alla fine. PathchSageAttentionKJ (#223) applica una modifica leggera all'attenzione prima della pianificazione che può migliorare la ritenzione dei dettagli in programmi molto brevi.
Condizionamento#
Il condizionamento è assemblato da MiniMaxH3ImageToVideo (#219), che funge anche da punto di ingresso per T2V o prima cornice I2V. Se colleghi un'immagine a first_frame, il nodo condiziona il movimento da quel fotogramma; altrimenti esegue la generazione pura da testo a video dal tuo prompt. Larghezza, altezza e lunghezza fluiscono dal gruppo Input dell'utente in modo che tu possa scalare rapidamente senza toccare i nodi a valle. Get_duration (#6067) e Get_strPrompt (#6069) gestiscono i valori condivisi in modo pulito in modo che il prompt e il tempo si applichino in modo coerente. L'output fornisce un condizionamento positivo e un latente preparato che il campionatore affinerà.
Campionamento#
Il campionamento è compatto e ottimizzato per FastH3. RandomNoise (#217) semina la traiettoria, BasicGuider (#214) costruisce la guida dal tuo condizionamento, e KSamplerSelect (#211) sceglie un campionatore multi-step ottimizzato per percorsi brevi. MiniMaxH3SigmaShift (#6007) regola il programma di rumore di H3 per i pesi FL2VA, mentre BasicScheduler (#212) mantiene il flusso di lavoro salvato a 8 fasi per un equilibrio pratico tra velocità e fedeltà. SamplerCustomAdvanced (#213) quindi guida la denoising per produrre un flusso latente unico che contiene sia contenuti video che audio.
Decodifica e creazione video#
Una volta completato il campionamento, VAEDecode (#210) trasforma il video latente in fotogrammi e VAEDecodeAudio (#209) ricostruisce l'audio sincronizzato. VHS_VideoCombine (#6104) della Video Helper Suite muxa la sequenza in MP4 con il frame rate del progetto. Puoi visualizzare l'anteprima del risultato e il nodo scriverà un unico file nella directory di output, pronto per la revisione. Poiché larghezza, altezza e conteggio dei fotogrammi sono già convalidati a monte, questa fase è senza mani e veloce. Se hai fornito un primo fotogramma, il movimento fluirà da esso; altrimenti il clip avrà origine interamente dal prompt.
Nodi chiave nel Comfyui FastH3 4-Step ComfyUI Workflow#
MiniMaxH3ImageToVideo (#219)#
Centro di condizionamento centrale per T2V e prima cornice I2V. Fornisci i tuoi input di prompt e tempo e, facoltativamente, collega first_frame per scatti sensibili alla continuità. Regola larghezza e altezza per scala e aspetto mantenendoli come multipli di 32. La lunghezza deriva dalla logica durata-a-fotogrammi così raramente devi impostarla manualmente.
MiniMaxH3SigmaShift (#6007)#
Applica uno spostamento sigma adattato al programma FL2VA di MiniMax H3 in modo che il campionatore a percorso breve rimanga stabile. Lascialo configurato per il percorso FastH3; è principalmente una salvaguardia di compatibilità e qualità. Considera di cambiarlo solo se cambi pesi o pianificatori H3.
BasicScheduler (#212)#
Fornisce un piano a 8 fasi che si abbina bene al percorso di peso a 4 fasi per una base di qualità pratica. Puoi ridurre i passaggi per bozze più rapide o sollevarle leggermente per maggiore stabilità, notando il compromesso tra dettaglio e velocità. Il conteggio dei passaggi interagisce con il cambio sigma e la scelta del campionatore, quindi apporta modifiche con attenzione.
SamplerCustomAdvanced (#213) con KSamplerSelect (#211)#
Esegue la breve traiettoria di denoising utilizzata da FastH3. Il campionatore selezionato è ottimizzato per efficienza multi-step e coerenza con pochissimi aggiornamenti. Mantieni questo abbinamento a meno che tu non stia sperimentando campionatori alternativi convalidati per H3.
ResolutionSelector (#115)#
Controllo di alto livello per aspetto e budget pixel. Usalo per scalare l'aspetto senza toccare gli interni del modello e preferisci risoluzioni che si traducono in circa 0.7–1.0 megapixel per bozze molto veloci, quindi scala verso l'alto quando blocchi i colpi finali. Gli output sono quantizzati per mantenere i decoder efficienti.
VHS_VideoCombine (#6104)#
Combina i fotogrammi decodificati e l'audio in un unico MP4. Qualità e dimensioni possono essere bilanciati tramite i suoi controlli di compressione e frame rate. Fa parte della Video Helper Suite, che puoi esplorare qui: Kosinkadink/ComfyUI-VideoHelperSuite.
Extra opzionali#
- Prima cornice I2V: collega un'immagine a
first_framesuMiniMaxH3ImageToVideo(#219) per continuità da una bacheca di progettazione, foto o scatto precedente. - Prompting: mantieni una bibbia di stile riutilizzabile in
StringConcatenate(#6115) e metti solo le indicazioni specifiche della scena nel prompt principale per coerenza tra le clip. - Temporizzazione: regola solo i secondi; il grafico aggancia il conteggio dei fotogrammi a un multiplo adatto al passo per evitare balbettii e mantiene l'audio allineato automaticamente.
- Velocità vs qualità: bozza a megapixel inferiori in
ResolutionSelector(#115), quindi alza la risoluzione e, se necessario, il conteggio dei passaggi inBasicScheduler(#212) per finalizzare. - Riferimenti: esplora i pesi e le risorse utilizzate da questo flusso di lavoro su MiniMaxAI/MiniMax-H3, FastVideo/FastVideo-FastH3-4-step-Preview-v1-VSA-DataFree, e l'adattamento Comfy su barelymining/ComfyUI-MiniMax-H3-FastVideo.
Riconoscimenti#
Questo flusso di lavoro implementa e si basa sui seguenti lavori e risorse. Ringraziamo con gratitudine MiniMaxAI per MiniMax-H3, FastVideo per i pesi FastH3 4-step VSA-DataFree e barelymining per ComfyUI-MiniMax-H3-FastVideo per i loro contributi e la manutenzione. Per dettagli autorevoli, si prega di fare riferimento alla documentazione originale e ai repository collegati di seguito.
Risorse#
- AI Future Tech/Origine e riferimento del flusso di lavoro
- Documenti / Note di rilascio: Post Patreon
- barelymining/ComfyUI-MiniMax-H3-FastVideo
- Hugging Face: barelymining/ComfyUI-MiniMax-H3-FastVideo
- FastVideo/FastVideo-FastH3-4-step-Preview-v1-VSA-DataFree
- MiniMaxAI/MiniMax-H3
- Hugging Face: MiniMaxAI/MiniMax-H3
- Comfy.org/Tutorial MiniMax H3
- Documenti / Note di rilascio: Tutorial Comfy.org
Nota: L'uso dei modelli, set di dati e codice di riferimento è soggetto alle rispettive licenze e termini forniti dai loro autori e manutentori.

