MiniMax H3 ComfyUI Text-to-Video 4-step Turbo: prompt-to-clip con audio nativo in un solo passaggio#
Questo flusso di lavoro trasforma un singolo prompt cinematografico in un breve video con audio stereo generato congiuntamente utilizzando MiniMax H3. Applica un'accelerazione LoRA Turbo a 4 fasi per consentirti di iterare rapidamente su dialoghi, canto e scene ambientali mantenendo strettamente collegati movimento e suono.
Progettato per i creatori che desiderano solo bozze di prompt, il flusso di lavoro Turbo a 4 fasi MiniMax H3 ComfyUI Text-to-Video produce discorsi o voci pulite, suoni ambientali coerenti e cinematografia costante senza assemblaggio audio manuale. Il grafico gestisce l'allineamento della lunghezza, il campionamento latente, la decodifica e il muxing automaticamente, in modo da poter concentrarti sulla narrazione e sui segnali di performance.
Modelli chiave nel flusso di lavoro MiniMax H3 ComfyUI Text-to-Video 4-step Turbo#
- Modello di diffusione MiniMax H3 (FL2VA UNet). Generatore audiovisivo di base che apprende un latente condiviso per immagine e suono, consentendo movimento e audio sincronizzati dallo stesso passaggio di campionamento. Pesi: Comfy-Org/MiniMax-H3.
- Codificatore di testo Qwen3-VL 32B per H3 (variante AWQ/NVFP4). Codifica prompt ricchi e multi-frase in una condizione che guida il layout della scena, la performance e gli eventi audio. Incluso in Comfy-Org/MiniMax-H3.
- MiniMax H3 Video VAE. Decodifica il video latente campionato in frame con tono e dettagli cinematografici. File: minimax_h3_video_vae_fp16.safetensors.
- MiniMax H3 Audio VAE. Decodifica il latente condiviso in audio stereo allineato nel tempo per discorsi, canto e ambiente. File: minimax_h3_audio_vae_fp32.safetensors.
- MiniMax H3 Turbo 4-step LoRA. Applica la ricetta di accelerazione che preserva la fedeltà della scena consentendo un campionamento molto veloce. File: minimax_h3_turbo_4step_pruned_comfyui.safetensors.
Come usare il flusso di lavoro MiniMax H3 ComfyUI Text-to-Video 4-step Turbo#
A un livello elevato, il tuo prompt viene codificato, un modello H3 aumentato Turbo campiona un singolo latente audiovisivo e i VAEs video e audio decodificano quel latente prima che la clip venga muxata in un file riproducibile.
1) Scrivi il prompt cinematografico e imposta la durata#
Usa il campo di testo easy positive (#147) per descrivere aspetto, azione e performance. Per guidare la voce o la musica, includi istruzioni chiare come "Audio: voce maschile di mezza età pronuncia la battuta... ambiente pioggia... basso thriller di sottofondo." Il controller Float (duration) (#133) imposta la lunghezza della clip in secondi. Un nodo matematico converte la tua durata in frame e allinea silenziosamente il conteggio alla cadenza richiesta da H3, quindi non devi gestire la matematica dei frame.
2) Carica H3, codificatore di testo, VAEs e Turbo LoRA#
UNETLoader (#127) carica il modello di diffusione MiniMax H3 e CLIPLoader (#128) carica il codificatore di testo Qwen3‑VL su misura per H3. Due nodi VAELoader portano nel video VAE (#119) e nell'audio VAE (#120). LoraLoaderModelOnly (#153) applica il MiniMax H3 Turbo 4-step LoRA al modello in modo che lo scheduler e il sampler operino in un regime veloce senza perdere coerenza audiovisiva.
3) Costruisci la condizione e il latente audiovisivo iniziale#
MiniMaxH3ImageToVideo (#131) trasforma il tuo prompt in una condizione positiva e prepara un latente iniziale allineato alla larghezza, altezza e conteggio frame scelti. Esistono input opzionali first_frame e last_frame per ancorare un'immagine di partenza o di fine se scegli di estendere il grafico più tardi. Il nodo produce la condizione e il latente che il campionamento a valle perfezionerà.
4) Campiona con Turbo#
BasicGuider (#126) abbina il modello alla tua condizione, KSamplerSelect (#123) sceglie l'algoritmo di campionamento e BasicScheduler (#124) imposta la pianificazione dei passaggi che funziona con il Turbo LoRA. RandomNoise (#129) semina la generazione per la riproducibilità. SamplerCustomAdvanced (#125) esegue il passaggio di denoising per produrre il latente finale condiviso che codifica sia il video che l'audio.
5) Decodifica ed esporta la clip finale#
VAEDecode (#122) ricostruisce i frame dell'immagine dal latente mentre VAEDecodeAudio (#121) ricostruisce l'audio stereo sincronizzato. CreateVideo (#130) muxa frame e audio in un flusso unico, quindi SaveVideo (#92) scrive il file su disco utilizzando il prefisso del nome file impostato.
Nodi chiave nel flusso di lavoro MiniMax H3 ComfyUI Text-to-Video 4-step Turbo#
MiniMaxH3ImageToVideo (#131)#
Produce la condizione positiva e inizializza il latente audiovisivo dal tuo prompt, risoluzione e lunghezza. Modificare width, height o length cambia sia la scala del movimento che la quantità di azione sullo schermo che può essere inserita. Se in seguito estendi il grafico, first_frame e last_frame ti consentono di bloccare la continuità tra le riprese.
LoraLoaderModelOnly (#153)#
Applica il Turbo 4-step LoRA al modello H3 caricato. Mantieni lo scheduler in un regime a basso passo per beneficiare del Turbo; aumentare sostanzialmente i passaggi sposta l'aspetto lontano dal comportamento di iterazione veloce previsto. Questo LoRA è progettato appositamente per MiniMax H3 e vive accanto ai pesi principali nel repository H3.
BasicScheduler (#124)#
Controlla il programma di denoising che il sampler segue. Usalo per bilanciare velocità e fedeltà rimanendo compatibile con il Turbo LoRA. Se cambi l'algoritmo del sampler, rivedi la scelta del programma per mantenere movimento stabile e audio pulito.
SamplerCustomAdvanced (#125)#
Esegue il denoising effettivo dato rumore, guida, sampler, sigma e il latente iniziale. È l'arbitro finale di texture, timing e nitidezza audiovisiva. Usa lo stesso seme quando confronti modifiche al prompt per attribuire le differenze ai cambiamenti di testo piuttosto che al rumore.
PathchSageAttentionKJ (#150)#
Applica un'ottimizzazione dell'attenzione prima dell'iniezione LoRA per migliorare la produttività su grandi risoluzioni. Fornito da KJNodes, che offre supporti per le prestazioni di ComfyUI. Repository: ComfyUI-KJNodes.
CreateVideo (#130)#
Combina i frame decodificati con l'audio decodificato in una clip sincronizzata. Puoi cambiare il frame rate o la profondità di bit qui se hai bisogno di soddisfare le specifiche di consegna. Il nodo mantiene la sincronizzazione audio-video derivata dal latente condiviso.
SaveVideo (#92)#
Scrive la clip renderizzata su disco con il prefisso del nome file scelto, il contenitore e il codec. Usa una denominazione coerente per tracciare le iterazioni per la stessa scena e seme.
Extra opzionali#
- Prompting per discorsi: metti la linea esatta dopo "Audio:" e descrivi età, sesso, tono e ritmo della voce. Per il canto, specifica stile e tempo. Per l'ambiente, elenca le fonti, l'intensità e se desideri solo sottofondo.
- Compromessi di risoluzione e durata: conteggi di pixel più alti e clip più lunghe costano più tempo di campionamento. Se hai bisogno di molti tentativi, inizia più piccolo, poi aumenta o allunga una volta che timing e consegna sono corretti.
- Riproducibilità: mantieni lo stesso seme quando modifichi solo il testo per poter confrontare piccole modifiche al prompt.
- L'allineamento della lunghezza è automatico: il grafico converte i secondi in frame e allinea il conteggio alla cadenza interna di H3 per una sintesi audiovisiva stabile.
- Opzioni di continuità: il nodo del modello espone opzioni
first_frameelast_frame. Se estendi il flusso di lavoro più tardi, collega le immagini lì per abbinare le partenze o le conclusioni delle riprese tra le modifiche. - Sicurezza: evita personaggi protetti da copyright, somiglianze di persone reali senza consenso, e loghi o sottotitoli sullo schermo nel tuo prompt.
Riconoscimenti#
Questo flusso di lavoro implementa e si basa sui seguenti lavori e risorse. Ringraziamo sinceramente MiniMax per il modello di generazione multimodale MiniMax H3 e l'annuncio, Comfy.org per il tutorial sul flusso di lavoro MiniMax H3 ComfyUI, e Comfy-Org per i pesi del modello MiniMax-H3 per i loro contributi e manutenzione. Per dettagli autorevoli, si prega di fare riferimento alla documentazione originale e ai repository collegati di seguito.
Risorse#
- MiniMax/MiniMax H3: Un Modello Aperto che Rompe i Confini tra Compiti e Modalità
- GitHub: MiniMax-AI/MiniMax-H3
- Hugging Face: MiniMaxAI/MiniMax-H3
- Documenti / Note di Rilascio: Annuncio ufficiale di MiniMax H3
- Comfy.org/MiniMax H3: Esempi di Flusso di Lavoro ComfyUI
- GitHub: Comfy-Org/docs
- Documenti / Note di Rilascio: Tutorial Comfy.org MiniMax H3
- Comfy-Org/MiniMax-H3
- Hugging Face: Comfy-Org/MiniMax-H3
Nota: L'uso dei modelli, dei dataset e del codice di riferimento è soggetto alle rispettive licenze e termini forniti dai loro autori e manutentori.

