ComfyUI>Workflow>MiniMax H3 ComfyUI Text-to-Video 4-step Turbo

MiniMax H3 ComfyUI Text-to-Video 4-step Turbo

Workflow Name: RunComfy/MiniMax-H3-Turbo
Workflow ID: 0000...1483
Trasforma un prompt cinematografico in un breve video. Ottieni suono stereo nativo nello stesso passaggio. Crea dialoghi chiari, canto e scene ambientali. Hailuo H3 Turbo utilizza un campionamento a quattro fasi per bozze più veloci. Puoi testare rapidamente le idee. Esporta insieme movimento e audio.

MiniMax H3 ComfyUI Text-to-Video 4-step Turbo Workflow

MiniMax H3 ComfyUI Text-to-Video | 4-Step Turbo
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

MiniMax H3 ComfyUI Text-to-Video 4-step Turbo Examples

MiniMax H3 ComfyUI Text-to-Video 4-step Turbo: prompt-to-clip con audio nativo in un solo passaggio#

Questo flusso di lavoro trasforma un singolo prompt cinematografico in un breve video con audio stereo generato congiuntamente utilizzando MiniMax H3. Applica un'accelerazione LoRA Turbo a 4 fasi per consentirti di iterare rapidamente su dialoghi, canto e scene ambientali mantenendo strettamente collegati movimento e suono.

Progettato per i creatori che desiderano solo bozze di prompt, il flusso di lavoro Turbo a 4 fasi MiniMax H3 ComfyUI Text-to-Video produce discorsi o voci pulite, suoni ambientali coerenti e cinematografia costante senza assemblaggio audio manuale. Il grafico gestisce l'allineamento della lunghezza, il campionamento latente, la decodifica e il muxing automaticamente, in modo da poter concentrarti sulla narrazione e sui segnali di performance.

Modelli chiave nel flusso di lavoro MiniMax H3 ComfyUI Text-to-Video 4-step Turbo#

  • Modello di diffusione MiniMax H3 (FL2VA UNet). Generatore audiovisivo di base che apprende un latente condiviso per immagine e suono, consentendo movimento e audio sincronizzati dallo stesso passaggio di campionamento. Pesi: Comfy-Org/MiniMax-H3.
  • Codificatore di testo Qwen3-VL 32B per H3 (variante AWQ/NVFP4). Codifica prompt ricchi e multi-frase in una condizione che guida il layout della scena, la performance e gli eventi audio. Incluso in Comfy-Org/MiniMax-H3.
  • MiniMax H3 Video VAE. Decodifica il video latente campionato in frame con tono e dettagli cinematografici. File: minimax_h3_video_vae_fp16.safetensors.
  • MiniMax H3 Audio VAE. Decodifica il latente condiviso in audio stereo allineato nel tempo per discorsi, canto e ambiente. File: minimax_h3_audio_vae_fp32.safetensors.
  • MiniMax H3 Turbo 4-step LoRA. Applica la ricetta di accelerazione che preserva la fedeltà della scena consentendo un campionamento molto veloce. File: minimax_h3_turbo_4step_pruned_comfyui.safetensors.

Come usare il flusso di lavoro MiniMax H3 ComfyUI Text-to-Video 4-step Turbo#

A un livello elevato, il tuo prompt viene codificato, un modello H3 aumentato Turbo campiona un singolo latente audiovisivo e i VAEs video e audio decodificano quel latente prima che la clip venga muxata in un file riproducibile.

1) Scrivi il prompt cinematografico e imposta la durata#

Usa il campo di testo easy positive (#147) per descrivere aspetto, azione e performance. Per guidare la voce o la musica, includi istruzioni chiare come "Audio: voce maschile di mezza età pronuncia la battuta... ambiente pioggia... basso thriller di sottofondo." Il controller Float (duration) (#133) imposta la lunghezza della clip in secondi. Un nodo matematico converte la tua durata in frame e allinea silenziosamente il conteggio alla cadenza richiesta da H3, quindi non devi gestire la matematica dei frame.

2) Carica H3, codificatore di testo, VAEs e Turbo LoRA#

UNETLoader (#127) carica il modello di diffusione MiniMax H3 e CLIPLoader (#128) carica il codificatore di testo Qwen3‑VL su misura per H3. Due nodi VAELoader portano nel video VAE (#119) e nell'audio VAE (#120). LoraLoaderModelOnly (#153) applica il MiniMax H3 Turbo 4-step LoRA al modello in modo che lo scheduler e il sampler operino in un regime veloce senza perdere coerenza audiovisiva.

3) Costruisci la condizione e il latente audiovisivo iniziale#

MiniMaxH3ImageToVideo (#131) trasforma il tuo prompt in una condizione positiva e prepara un latente iniziale allineato alla larghezza, altezza e conteggio frame scelti. Esistono input opzionali first_frame e last_frame per ancorare un'immagine di partenza o di fine se scegli di estendere il grafico più tardi. Il nodo produce la condizione e il latente che il campionamento a valle perfezionerà.

4) Campiona con Turbo#

BasicGuider (#126) abbina il modello alla tua condizione, KSamplerSelect (#123) sceglie l'algoritmo di campionamento e BasicScheduler (#124) imposta la pianificazione dei passaggi che funziona con il Turbo LoRA. RandomNoise (#129) semina la generazione per la riproducibilità. SamplerCustomAdvanced (#125) esegue il passaggio di denoising per produrre il latente finale condiviso che codifica sia il video che l'audio.

5) Decodifica ed esporta la clip finale#

VAEDecode (#122) ricostruisce i frame dell'immagine dal latente mentre VAEDecodeAudio (#121) ricostruisce l'audio stereo sincronizzato. CreateVideo (#130) muxa frame e audio in un flusso unico, quindi SaveVideo (#92) scrive il file su disco utilizzando il prefisso del nome file impostato.

Nodi chiave nel flusso di lavoro MiniMax H3 ComfyUI Text-to-Video 4-step Turbo#

MiniMaxH3ImageToVideo (#131)#

Produce la condizione positiva e inizializza il latente audiovisivo dal tuo prompt, risoluzione e lunghezza. Modificare width, height o length cambia sia la scala del movimento che la quantità di azione sullo schermo che può essere inserita. Se in seguito estendi il grafico, first_frame e last_frame ti consentono di bloccare la continuità tra le riprese.

LoraLoaderModelOnly (#153)#

Applica il Turbo 4-step LoRA al modello H3 caricato. Mantieni lo scheduler in un regime a basso passo per beneficiare del Turbo; aumentare sostanzialmente i passaggi sposta l'aspetto lontano dal comportamento di iterazione veloce previsto. Questo LoRA è progettato appositamente per MiniMax H3 e vive accanto ai pesi principali nel repository H3.

BasicScheduler (#124)#

Controlla il programma di denoising che il sampler segue. Usalo per bilanciare velocità e fedeltà rimanendo compatibile con il Turbo LoRA. Se cambi l'algoritmo del sampler, rivedi la scelta del programma per mantenere movimento stabile e audio pulito.

SamplerCustomAdvanced (#125)#

Esegue il denoising effettivo dato rumore, guida, sampler, sigma e il latente iniziale. È l'arbitro finale di texture, timing e nitidezza audiovisiva. Usa lo stesso seme quando confronti modifiche al prompt per attribuire le differenze ai cambiamenti di testo piuttosto che al rumore.

PathchSageAttentionKJ (#150)#

Applica un'ottimizzazione dell'attenzione prima dell'iniezione LoRA per migliorare la produttività su grandi risoluzioni. Fornito da KJNodes, che offre supporti per le prestazioni di ComfyUI. Repository: ComfyUI-KJNodes.

CreateVideo (#130)#

Combina i frame decodificati con l'audio decodificato in una clip sincronizzata. Puoi cambiare il frame rate o la profondità di bit qui se hai bisogno di soddisfare le specifiche di consegna. Il nodo mantiene la sincronizzazione audio-video derivata dal latente condiviso.

SaveVideo (#92)#

Scrive la clip renderizzata su disco con il prefisso del nome file scelto, il contenitore e il codec. Usa una denominazione coerente per tracciare le iterazioni per la stessa scena e seme.

Extra opzionali#

  • Prompting per discorsi: metti la linea esatta dopo "Audio:" e descrivi età, sesso, tono e ritmo della voce. Per il canto, specifica stile e tempo. Per l'ambiente, elenca le fonti, l'intensità e se desideri solo sottofondo.
  • Compromessi di risoluzione e durata: conteggi di pixel più alti e clip più lunghe costano più tempo di campionamento. Se hai bisogno di molti tentativi, inizia più piccolo, poi aumenta o allunga una volta che timing e consegna sono corretti.
  • Riproducibilità: mantieni lo stesso seme quando modifichi solo il testo per poter confrontare piccole modifiche al prompt.
  • L'allineamento della lunghezza è automatico: il grafico converte i secondi in frame e allinea il conteggio alla cadenza interna di H3 per una sintesi audiovisiva stabile.
  • Opzioni di continuità: il nodo del modello espone opzioni first_frame e last_frame. Se estendi il flusso di lavoro più tardi, collega le immagini lì per abbinare le partenze o le conclusioni delle riprese tra le modifiche.
  • Sicurezza: evita personaggi protetti da copyright, somiglianze di persone reali senza consenso, e loghi o sottotitoli sullo schermo nel tuo prompt.

Riconoscimenti#

Questo flusso di lavoro implementa e si basa sui seguenti lavori e risorse. Ringraziamo sinceramente MiniMax per il modello di generazione multimodale MiniMax H3 e l'annuncio, Comfy.org per il tutorial sul flusso di lavoro MiniMax H3 ComfyUI, e Comfy-Org per i pesi del modello MiniMax-H3 per i loro contributi e manutenzione. Per dettagli autorevoli, si prega di fare riferimento alla documentazione originale e ai repository collegati di seguito.

Risorse#

Nota: L'uso dei modelli, dei dataset e del codice di riferimento è soggetto alle rispettive licenze e termini forniti dai loro autori e manutentori.

RunComfy
Copyright 2026 RunComfy. Tutti i Diritti Riservati.

RunComfy è la piattaforma principale ComfyUI che offre ComfyUI online ambiente e servizi, insieme a workflow di ComfyUI con visuali mozzafiato. RunComfy offre anche AI Models, consentire agli artisti di sfruttare gli ultimi strumenti di AI per creare arte incredibile.