MiniMax H3 T2V ComfyUI: prompt-a-video con audio stereo nativo#
MiniMax H3 T2V ComfyUI trasforma un singolo prompt in un breve video cinematografico con audio stereo sincronizzato. Costruito dal template ufficiale di Comfy.org e dai pesi aperti MiniMax-H3 di Comfy-Org, segue il percorso FL2VA in modo che movimento e suono siano generati insieme, non uniti dopo il fatto. È ideale per esplorazioni rapide di scene solo con prompt, clip di dialogo o canto, e riprese concettuali che necessitano sia di immagini che di suono in un unico passaggio.
Descrivi le riprese, la camera, la performance e gli indizi audio in un unico blocco, scegli dimensione e durata, quindi metti in coda il grafico. Il workflow carica i componenti MiniMax-H3 corretti, campiona latenti audio-visivi congiunti, li decodifica in frame e audio stereo, multiplica il risultato e salva un file video finito.
Modelli chiave nel workflow Comfyui MiniMax H3 T2V ComfyUI#
- Modello di diffusione MiniMax-H3 FL2VA. Il core UNet che esegue la denoising audio-video congiunta in modo che movimento e suono rimangano allineati in fase. Pesi forniti da Comfy-Org sotto diffusion_models. Model files
- MiniMax-H3 Video VAE. Codifica e decodifica latenti visivi in frame RGB, preservando dettaglio cinematografico e continuità del movimento. minimax_h3_video_vae_fp16.safetensors
- MiniMax-H3 Audio VAE. Codifica e decodifica latenti audio in un'onda stereo allineata nel tempo per ogni clip. minimax_h3_audio_vae_fp32.safetensors
- Codificatore di testo Qwen3-VL 32B (AWQ per MiniMax-H3). Interpreta il prompt in condizioni che coprono semantica della scena, tempistica e intenzione audio. qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors
Se vuoi confrontare il template originale su cui si basa questo grafico, consulta il riferimento Comfy.org. Template JSON
Come usare il workflow Comfyui MiniMax H3 T2V ComfyUI#
A un livello alto, imposti la risoluzione e la durata target, scrivi un singolo prompt che include sia visuali che audio, opzionalmente aggiungi frame iniziali e finali, quindi esegui. All'interno del sottografo, MiniMax-H3 crea latenti video e audio sincronizzati, che vengono decodificati, uniti in un filmato a 24 fps e salvati.
ResolutionSelector (#115)#
Scegli un rapporto d'aspetto e una scala per impostare width e height. Il selettore arrotonda a multipli efficienti di 32 e fornisce quei valori al sottografo MiniMax-H3, quindi non è necessario calcolare manualmente le dimensioni. Inizia con dimensioni moderate per un'iterazione più veloce, quindi aumenta una volta che il tuo prompt è corretto. Cambiare il rapporto d'aspetto è una potente leva creativa per trailer, clip verticali e anteprime quadrate.
Image to Video (MiniMax H3) (#105)#
Questo sottografo orchestra la pipeline MiniMax H3 T2V ComfyUI. Incolla un unico prompt coerente che descrive riprese, montaggi e colonna sonora insieme, e opzionalmente fornisci immagini first_frame e last_frame per ancorare ingresso e uscita. Imposta una duration umana e il grafico la converte in un conteggio di frame valido per il modello. Il sottografo restituisce latenti audio-visivi sincronizzati che procedono alla decodifica e multiplexing.
Gruppo Modelli#
Il gruppo modelli carica i componenti esatti MiniMax-H3 per questo workflow. UNETLoader (#6) carica il modello di diffusione FL2VA, CLIPLoader (#13) carica il codificatore Qwen3-VL, e due nodi VAELoader (#11 video, #24 audio) preparano i decodificatori. Questi sono puntati ai file MiniMax-H3 di Comfy-Org così puoi eseguire senza cablaggi manuali. Mantenere i modelli centralizzati qui rende semplici futuri scambi o aggiornamenti.
Gruppo Condizionamento#
MiniMaxH3ImageToVideo (#104) trasforma il tuo prompt, opzionali first_frame e last_frame, e le dimensioni selezionate width, height, e length in condizionamento MiniMax-H3 più un latente iniziale. L'idea è di lasciare che il modello legga sia il contenuto della scena che l'intenzione audio contemporaneamente, il che porta a una sincronizzazione più stretta. Se fornisci frame di riferimento, l'ingresso e l'uscita sono guidati per la continuità; se li lasci vuoti, la generazione inizia a freddo.
Gruppo Campionamento#
Il campionamento è gestito da RandomNoise (#15), KSamplerSelect (#17), BasicScheduler (#9), BasicGuider (#16), e il principale SamplerCustomAdvanced (#14). Insieme denoizzano il latente congiunto in modo che movimento dell'immagine e eventi sonori si sviluppino in sincronia. Puoi rieseguire con un nuovo seed per take alternative mantenendo la stessa direzione creativa. Una volta a tuo agio, sperimentare con la scelta del campionatore o il programma può cambiare leggermente l'energia del movimento e la texture sonora.
Gruppo Decodifica e creazione video#
VAEDecode (#10) ricostruisce la sequenza di frame dal latente video, e VAEDecodeAudio (#23) ricostruisce un'onda stereo dal latente audio. CreateVideo (#91) multiplexa i frame e l'audio in un clip finito a 24 fps. Questo è il punto in cui tagli puliti e battiti specificati nel prompt si uniscono nella timeline. L'output procede al salvataggio.
SaveVideo (#92)#
Scrive il video finale nella tua uscita ComfyUI sotto video/MiniMax_H3. Il nodo utilizza la denominazione automatica così puoi iterare rapidamente, e puoi cambiare il percorso per mantenere separati diversi progetti. L'output contiene sia l'immagine generata che l'audio stereo.
Nodi chiave nel workflow Comfyui MiniMax H3 T2V ComfyUI#
MiniMaxH3ImageToVideo (#104)#
Nodo di condizionamento centrale per MiniMax-H3 che accetta prompt, opzionali first_frame e last_frame, più width, height, e length. Mantieni i prompt concisi ma cinematografici, e includi indizi audio come ambiente, SFX, dialogo e colpi musicali nello stesso blocco di testo. Usa frame di riferimento quando hai bisogno di un ingresso o uscita specifici; omettili per una messa in scena più libera.
ComfyMathExpression (#107)#
Mappa una duration leggibile in secondi all'intero length che il modello si aspetta, agganciandosi alla griglia dei frame del modello per un timing pulito. Imposta il float alla lunghezza del clip desiderata e lascia che il nodo gestisca la conversione. Clip leggermente più corti tendono a preservare movimento e sincronizzazione audio nitida a risoluzioni più alte.
SamplerCustomAdvanced (#14)#
Guida il processo di denoising basato sul campionatore e sul programma selezionati. Usa un noise_seed fisso per bloccare un take per il confronto, quindi cambia solo il seed per esplorare nuove variazioni. Se il movimento sembra troppo caotico o troppo rigido, prova un campionatore diverso in KSamplerSelect (#17) o regola il programma in BasicScheduler (#9).
CreateVideo (#91)#
Combina frame decodificati e audio stereo in un unico stream video alla frequenza di frame scelta. Per montaggi guidati dal ritmo, imposta fps per abbinare la cadenza descritta nel prompt. Il nodo è anche il punto in cui cambieresti fps se vuoi un effetto più lento o più veloce.
ResolutionSelector (#115)#
Un controllo per sia il rapporto d'aspetto che il conteggio complessivo dei pixel, con arrotondamento automatico a dimensioni compatibili con il modello. Scegli prima l'aspetto, quindi sposta la scala per bilanciare velocità e fedeltà. Canvas più grandi premiano un prompting accurato e durate più brevi.
SaveVideo (#92)#
Finalizza il clip su disco. Puntalo a una sottocartella del progetto per mantenere organizzati gli esperimenti e rinomina saggiamente quando trovi un keeper.
Extra opzionali#
- Scrivi i prompt come mini storyboard con indicazioni temporali e battiti audio espliciti per una sincronizzazione affidabile.
- Includi parole di intenzione audio come vento, passi, folla, riverbero, o strumenti specifici per guidare la colonna sonora.
- Aggiungi linee per dialoghi o canti direttamente nel prompt e nota il tono del parlante.
- Blocca un
noise_seedquando confronti modifiche del prompt, cambia solo il seed quando esplori take alternativi. - Usa
first_frameelast_frameper delimitare il movimento quando hai bisogno di continuità tra i tagli o di una posa finale precisa.
Ringraziamenti#
Questo workflow implementa e si basa sui seguenti lavori e risorse. Ringraziamo Comfy-Org per il template di workflow MiniMax H3 T2V e i pesi del modello MiniMax-H3, Comfy.org per il tutorial MiniMax H3, e MiniMax per l'annuncio ufficiale MiniMax H3 per i loro contributi e manutenzione. Per dettagli autorevoli, si prega di fare riferimento alla documentazione originale e ai repository collegati di seguito.
Risorse#
- Template di workflow Comfy-Org/MiniMax H3 T2V
- GitHub: video_minimax_h3_t2v.json
- Tutorial Comfy.org/MiniMax H3
- Documenti / Note di rilascio: MiniMax H3 tutorial
- Annuncio ufficiale MiniMax/MiniMax H3
- Documenti / Note di rilascio: MiniMax H3 official announcement
- Pesi del modello Comfy-Org/MiniMax-H3
- Hugging Face: Comfy-Org/MiniMax-H3
Nota: L'uso dei modelli, dataset e codice di riferimento è soggetto alle licenze e ai termini rispettivi forniti dai loro autori e manutentori.


