ComfyUI>Workflow>VDN H3 ComfyUI Testo a Video | Flusso di lavoro MiniMax H3 VDN 8-Step più veloce senza LoRA

VDN H3 ComfyUI Testo a Video | Flusso di lavoro MiniMax H3 VDN 8-Step più veloce senza LoRA

Workflow Name: RunComfy/VDN-H3-Text-To-Video
Workflow ID: 0000...1513
Crea video MiniMax H3 con audio da prompt testuali. Ottieni campionamento a 8 passi con attenzione ibrida Video DeltaNet. Costruisci scene di fantasia, guida o combattimento. Confronta i risultati con il ramo FastVideo. Affina i prompt per un controllo creativo.

VDN H3 ComfyUI Text To Video Workflow

VDN H3 ComfyUI Text To Video | 8-Step Video and Audio
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

VDN H3 ComfyUI Text To Video Examples

VDN H3 MiniMax ComfyUI Testo a Video#

VDN H3 ComfyUI Testo a Video trasforma i prompt in linguaggio naturale in brevi video cinematografici con audio sincronizzato. Combina la famiglia MiniMax H3 con attenzione ibrida Video DeltaNet e campionamento a 8 passi per generare video e audio da un singolo prompt. È ben adatto per storyboard, clip di prodotto e scene stilizzate come fantasia cinematografica, guida rally e schermaglie con spade corazzate.

Il grafico include due rami selezionabili indipendentemente. Il ramo VDN-H3 applica la patch Video DeltaNet ed è stato utilizzato per produrre gli esempi inclusi. Il ramo FastVideo è fornito per confrontare i tempi di output e generazione con il percorso VDN. Entrambi i rami rendono MP4 con audio al frame rate scelto.

Costruito su componenti aperti: VDN per MiniMax H3 GitHub e Hugging Face, nodi VDN-H3 ComfyUI di Saganaki22 GitHub, e pesi di base MiniMax H3 e VAEs Hugging Face.

Modelli chiave nel flusso di lavoro Comfyui VDN H3 ComfyUI Testo a Video#

  • Modello di diffusione MiniMax-H3 (UNet). Guida il processo di denoising che trasforma il rumore in video e audio latenti coerenti spaziotemporali. I pesi sono forniti nel pacchetto MiniMax H3 su Hugging Face.
  • Codificatore di testo Qwen3-VL 32B MiniMax-H3. Converte il tuo prompt in condizionamento per la generazione di video e audio, sintonizzato per la famiglia H3. Incluso nel rilascio MiniMax H3 su Hugging Face.
  • MiniMax-H3 Video VAE. Decodifica i latenti video in frame RGB. Disponibile nella sezione VAEs di Hugging Face.
  • MiniMax-H3 Audio VAE. Ricostruisce l'audio dalla forma d'onda dai latenti audio. Anche fornito su Hugging Face.
  • Pesi patch VDN-H3. Video DeltaNet applica attenzione ibrida a MiniMax H3. Ottieni i checkpoint da Hugging Face.
  • Variante FastVideo UNet. Il ramo di confronto utilizza minimax_h3_fastvideo_vsa_datafree_1300step_4step_int8_convrot.safetensors da Kijai/MiniMax-H3-experimental.

Come usare il flusso di lavoro Comfyui VDN H3 MiniMax ComfyUI Testo a Video#

Inizia impostando il tuo prompt, risoluzione, durata e frame rate. Seleziona il ramo VDN-H3 o il ramo FastVideo per un'esecuzione individuale. Queue All può eseguire entrambi i rami abilitati e produrre due MP4; i rami grafici separati non garantiscono l'esecuzione simultanea della GPU. Entrambi i rami sono configurati per 8 passi di campionamento.

Input Utente#

Utilizza il pannello (input:prompt) Testo Prompt per descrivere sia i suoni che le immagini in linguaggio semplice. Per l'audio, aggiungi una linea finale che inizia con Audio: per richiedere Foley o ambiente specifico, per esempio "Audio: battiti ritmici di zoccoli, vento, ruggito distante." Controlla la dimensione visiva con (input:Resolution) Megapixel che alimenta il ResolutionSelector per produrre una larghezza e un'altezza compatibili con il calcolo. Imposta (input:Duration) Secondi e (input:FPS) per definire quanto lungo e fluido dovrebbe sentirsi il clip. Il flusso di lavoro converte durata e FPS in un conteggio di frame valido e lo aggancia silenziosamente a una lunghezza di sequenza che si adatta bene agli interni di H3.

Modelli#

Il CLIPLoader fornisce il codificatore di testo sintonizzato MiniMax utilizzato per il condizionamento. Due nodi VAELoader portano nel MiniMax-H3 Video VAE e Audio VAE affinché i frame decodificati e i suoni corrispondano allo spazio latente del modello. Questi loader sono condivisi da entrambi i rami per garantire risultati A/B coerenti.

Condizionamento#

MiniMaxH3ImageToVideo (#219) trasforma il tuo prompt più dimensioni e lunghezza nel latente iniziale video e audio insieme al condizionamento positivo. Input di immagini opzionali possono essere utilizzati per bloccare il primo o l'ultimo frame quando hai bisogno di una posa specifica all'ingresso o all'uscita. Questa fase è quella in cui le tue decisioni narrative contano di più: il movimento della fotocamera, l'azione del soggetto, l'illuminazione e la linea Audio: diventano tutte linee guida per il campionatore a valle.

Patch VDN-H3#

Il ramo VDN applica l'aggiornamento Video DeltaNet con ApplyVDNH3Advanced (#6126). Applica la patch di attenzione ibrida selezionata. MiniMaxChunkFeedForward e ModelPatchTorchSettings configurano memoria e impostazioni di esecuzione. MiniMaxH3SigmaShift regola il programma del rumore per video e audio prima dell'inizio del campionamento.

Campionamento (VDN-H3)#

Il campionamento VDN inizia da RandomNoise (#6141), unisce la guida con BasicGuider (#6134), sceglie il solutore in KSamplerSelect (#6137), e pianifica un numero compatto di passi di diffusione in BasicScheduler (#6136). SamplerCustomAdvanced (#6135) esegue il denoising sull'intera sequenza per produrre video e audio latenti raffinati. Mantieni il seed fisso per la ripetibilità o cambialo per nuove variazioni con lo stesso prompt.

Decodifica e creazione video (VDN-H3)#

VAEDecode (#6146) ricostruisce i frame mentre VAEDecodeAudio (#6145) ricostruisce la colonna sonora. VHS_VideoCombine (#6170) unisce frame e audio in un MP4, rispettando il frame rate impostato in precedenza e salvando un file pronto per l'anteprima. L'output VDN è salvato con un prefisso di nome file distintivo, quindi è facile confrontarlo con il risultato FastVideo.

Ramo di confronto FastVideo#

Il percorso FastVideo carica un MiniMax H3 UNet ottimizzato per la velocità e applica una patch di attenzione leggera prima del campionamento. Riutilizza il tuo prompt, dimensioni e conteggio dei frame in modo che tu possa confrontare direttamente i tempi e l'aspetto. Il campionamento rispecchia la struttura del ramo VDN ed è anche configurato per 8 passi. I frame e l'audio sono decodificati e combinati con VHS_VideoCombine (#6104) per produrre un secondo MP4. Usa questi output affiancati per decidere quale ramo si adatta meglio alla tua scena.

Nodi chiave nel flusso di lavoro Comfyui VDN H3 ComfyUI Testo a Video#

  • ApplyVDNH3Advanced (#6126). Abilita Video DeltaNet su MiniMax H3 utilizzando il checkpoint selezionato dal rilascio VDN-H3. Regola solo quando desideri cambiare il checkpoint VDN o passare a backend di attenzione; mantieni i default di attenzione ibrida per uso generale. Implementazione di riferimento: Saganaki22/ComfyUI-VDN-H3.
  • MiniMaxH3ImageToVideo (#219). Punto di controllo centrale per storia e tempistica, accettando il prompt di testo, larghezza e altezza calcolate, e il conteggio dei frame derivato. Per l'audio, aggiungi una singola linea Audio: al prompt per guidare Foley e ambiente evitando il parlato a meno che non sia esplicitamente richiesto.
  • MiniMaxH3SigmaShift (#6131, #6007). Ribilancia il programma sigma per flussi video e audio, che può aiutare a ridurre il tremolio e preservare i dettagli a conteggi di passi bassi. Considera piccoli aggiustamenti solo se cambi varianti del modello o noti instabilità nel movimento.
  • VHS_VideoCombine (#6170, #6104). Unisce frame decodificati e audio in MP4 con il frame rate e il prefisso del nome file scelti. Opzioni utili includono il taglio alla lunghezza dell'audio e la selezione del formato pixel H.264 desiderato. Pagina del progetto: ComfyUI-VideoHelperSuite.

Extra opzionali#

  • Suggerimenti per i prompt: inizia con una singola frase che imposta soggetto, azione e movimento della fotocamera, poi aggiungi suggerimenti di look-and-feel e una linea Audio: per il Foley.
  • Per clip più lunghi, preferisci megapixel modesti rispetto all'alta risoluzione per mantenere il movimento stabile e l'uso della memoria sotto controllo.
  • Fissa il seed in RandomNoise quando desideri iterazioni consistenti; cambialo per esplorare variazioni.
  • Confronta i due rami sulla tua scena per valutare la qualità dell'output e il tempo di generazione.
  • Se raggiungi i limiti di memoria, riduci i megapixel o la durata prima; il feed-forward a blocchi aiuta già con sequenze più lunghe.

Ringraziamenti#

Questo flusso di lavoro implementa e si basa sui seguenti lavori e risorse. Ringraziamo con gratitudine OpenVDN per il modello vdn-minimax-h3, i pesi e il repository, Saganaki22 per i nodi ComfyUI-VDN-H3, e Benji (AI Future Tech) per il flusso di lavoro VDN-H3 per i loro contributi e manutenzione. Per dettagli autorevoli, si prega di fare riferimento alla documentazione originale e ai repository collegati qui sotto.

Risorse#

Nota: L'uso dei modelli, dei dataset e del codice di riferimento è soggetto alle rispettive licenze e termini forniti dai loro autori e manutentori.

RunComfy
Copyright 2026 RunComfy. Tutti i Diritti Riservati.

RunComfy è la piattaforma principale ComfyUI che offre ComfyUI online ambiente e servizi, insieme a workflow di ComfyUI con visuali mozzafiato. RunComfy offre anche AI Models, consentire agli artisti di sfruttare gli ultimi strumenti di AI per creare arte incredibile.