ComfyUI>Workflow>MiniMax H3 Accelerazione in 8 Fasi | Flusso di Lavoro Video Tutto-In-Uno

MiniMax H3 Accelerazione in 8 Fasi | Flusso di Lavoro Video Tutto-In-Uno

Workflow Name: RunComfy/MiniMax-H3-8-Step
Workflow ID: 0000...1505
MiniMax H3 Accelerazione in 8 Fasi è un flusso di lavoro ComfyUI tutto in uno per creare video cinematografici con audio nativo sincronizzato. Il suo nodo di riferimento unificato supporta immagini, video, video-audio accoppiati e audio standalone, mentre l'impostazione predefinita pronta all'uso utilizza un'immagine e un prompt di movimento. Un Turbo LoRA e un campionamento in 8 fasi accelerano la generazione, con impostazioni testate progettate per funzionare in modo affidabile su una GPU da 48 GB.

ComfyUI MiniMax H3 8-Step Acceleration Flusso di lavoro

MiniMax H3 8-Step Acceleration All-in-One Video Workflow in ComfyUI
Vuoi eseguire questo workflow?
  • Workflow completamente operativi
  • Nessun nodo o modello mancante
  • Nessuna configurazione manuale richiesta
  • Presenta visuali mozzafiato

ComfyUI MiniMax H3 8-Step Acceleration Esempi

MiniMax H3 Accelerazione in 8 Fasi: Generazione video multimodale tutto in uno con audio nativo#

MiniMax H3 Accelerazione in 8 Fasi è un flusso di lavoro ComfyUI tutto in uno per creare video cinematografici con audio nativo sincronizzato. Attraverso il nodo unificato MiniMaxH3Unified, supporta riferimenti immagine, riferimenti video, video con audio accompagnante e riferimenti audio standalone all'interno di un flusso di lavoro semplificato.

L'esempio pronto all'uso utilizza una singola immagine e un prompt testuale orientato al movimento, ma il riferimento-a-video è solo un modo per utilizzare il flusso di lavoro. Il suo design multimodale unificato supporta diverse combinazioni di guida visiva e audio senza richiedere grafici di flusso di lavoro separati per ciascun tipo di input.

Il flusso di lavoro combina il backbone MiniMax H3 FL2VA con il LightX2V Turbo LoRA e un programma di campionamento compatto in 8 fasi a due passaggi. È progettato per riprese di personaggi cinematografici, scene di dialogo, micro-storie atmosferiche e altri compiti video multimodali che beneficiano di iterazioni più rapide e audio nativo sincronizzato.

Modelli chiave nel flusso di lavoro ComfyUI MiniMax H3 Accelerazione in 8 Fasi#

  • Pesi ufficiali MiniMax-H3. Il backbone di diffusione audiovisiva che genera video e audio nativo da prompt e riferimenti multimodali. MiniMaxAI/MiniMax-H3
  • MiniMax H3 Video VAE e Audio VAE. Encoder e decoder accoppiati utilizzati per spostarsi tra spazio pixel, forme d'onda audio e latenti H3. Inclusi nella distribuzione Comfy-Org. Comfy-Org/MiniMax-H3
  • Codificatore di testo Qwen3-VL 32B (AWQ, MiniMax-tuned). Fornisce ancoraggio linguistico e visivo per prompt e riferimenti quando si guida MiniMax H3. Distribuito con il pacchetto Comfy-Org MiniMax H3. Comfy-Org/MiniMax-H3
  • LightX2V MiniMax H3 Turbo LoRA. Un LoRA orientato alla velocità che stringe le traiettorie in modo che H3 possa convergere efficacemente sotto un programma di 8 fasi. lightx2v/Minimax-h3-Turbo
  • MiniMax H3 Latent Upscaler 3D. Un upscale latente nativo di H3 utilizzato tra i passaggi per aumentare i dettagli spaziali senza rompere l'allineamento audio.

Come utilizzare il flusso di lavoro ComfyUI MiniMax H3 Accelerazione in 8 Fasi#

A livello generale, il flusso di lavoro raccoglie prompt e riferimenti multimodali attraverso un nodo di input unificato, costruisce un programma compatto in 8 fasi e esegue un passaggio rapido ad alto sigma per stabilire la struttura del movimento e della scena. Può quindi ingrandire il video latente in 3D prima di eseguire un passaggio di raffinamento a basso sigma, decodificando l'audio e il video sincronizzati ed esportando il risultato come un MP4.

Input e dimensionamento#

Utilizza Resolution Selector (Size) (#115) per scegliere la larghezza e l'altezza desiderate. Inserisci la descrizione della scena in Input Text (Prompt) (#217); puoi includere dialoghi citati se desideri parole parlate nel clip generato.

Il nodo tutto in uno MiniMaxH3Unified (#212) funge da hub di riferimento multimodale del flusso di lavoro. Supporta riferimenti immagine, riferimenti video, video con audio e riferimenti audio standalone, insieme a controlli di prompt, dimensionamento e durata.

L'esempio incluso è configurato con un'immagine di riferimento e un prompt di movimento per un uso immediato. Puoi sostituire quell'immagine o configurare un altro tipo di riferimento supportato all'interno dello stesso nodo unificato senza ricostruire le fasi di campionamento, upscaling, decodifica o esportazione.

Puoi impostare la duration in MiniMaxH3Unified, o attivare auto_length_from_audio quando utilizzi un riferimento audio esterno per guidare la temporizzazione.

Configurazione del modello e patch di accelerazione#

UNETLoader (#127) carica il checkpoint MiniMax H3 FL2VA. MiniMaxH3MemoryEfficientSageAttentionPatch (#160) e ModelAttentionBackend (#168) attivano quindi un backend di attenzione compatibile con VRAM.

MiniMaxH3SigmaShift (#207) allinea gli orizzonti di denoising video e audio per programmi brevi. LoraLoaderModelOnly (#167) applica il LightX2V Turbo LoRA che consente l'accelerazione in 8 fasi di MiniMax H3 senza richiedere un grafico di accelerazione separato.

Costruttore di programma in 8 fasi#

BasicScheduler (#163) costruisce una traiettoria compatta, che viene ottimizzata da ExtendIntermediateSigmas (#220) e H3SigmaRefiner (#209) per le dinamiche audiovisive di H3.

SplitSigmas (#197) divide il programma in un blocco ad alto sigma per la struttura e un blocco a basso sigma per i dettagli. Un singolo seme RandomNoise (#129) alimenta entrambi i passaggi per aiutare a mantenere il movimento e l'audio coerenti.

Campionatore del primo passaggio: alti sigma#

Il blocco ad alto sigma fluisce in SamplerCustomAdvanced (#125), guidato da BasicGuider (#126) con il condizionamento positivo da MiniMaxH3Unified (#212).

Questo passaggio stabilisce la composizione, il ritmo del movimento e una base audio grezza all'interno di un latente audiovisivo unificato. La sua uscita denoised viene quindi preparata per miglioramenti a metà pipeline.

Upscale nello spazio latente#

LTXVSeparateAVLatent (#199) separa il latente audiovisivo in modo che solo i canali video vengano ingranditi da MinimaxH3LatentUpscaler3D (#226). Il latente audio rimane intatto per preservare la sincronizzazione.

LTXVConcatAVLatent (#198) quindi ricombina il latente video migliorato con il latente audio originale, creando un latente audiovisivo più nitido ma ancora sincronizzato per il raffinamento.

Campionatore del secondo passaggio: bassi sigma#

Il latente ricombinato viene raffinato in SamplerCustomAdvanced (#177) utilizzando il blocco a basso sigma e BasicGuider (#178).

Questo passaggio aggiunge dettagli di superficie, pulisce i tratti del viso e rifinisce le texture audio mantenendo il movimento e la temporizzazione stabiliti durante il primo passaggio.

Decodifica ed esportazione#

VAEDecode (#186) converte i latenti video in fotogrammi, mentre VAEDecodeAudio (#185) ricostruisce la traccia audio nativa.

VHS_VideoCombine (#189) muxa i risultati in un MP4 al frame rate selezionato—24 fps per impostazione predefinita—producendo un clip audiovisivo pronto per la condivisione.

Nodi chiave nel flusso di lavoro ComfyUI MiniMax H3 Accelerazione in 8 Fasi#

  • MiniMaxH3Unified (#212). Il nodo centrale tutto in uno di riferimento multimodale per MiniMax H3. Porta riferimenti immagine, video, video-audio, audio standalone, prompt, dimensionamento e controlli di durata in un unico nodo, consentendo a diversi compiti di riferimento H3 di utilizzare lo stesso pipeline di generazione accelerata.
  • H3SigmaRefiner (#209). Regola il programma per favorire le parti della traiettoria dove H3 beneficia maggiormente. Se hai bisogno di dettagli più nitidi alla stessa velocità, aggiungi un po' di raffinamento; se dai priorità alla massima produzione, mantienilo snello.
  • SplitSigmas (#197). Divide il programma compatto in un piano a due passaggi. Con un programma in 8 fasi, la divisione a metà bilancia velocità e qualità; spostare la divisione assegna più fasi alla struttura o ai dettagli.
  • MiniMaxH3SigmaShift (#207). Compensa gli intervalli sigma per video e audio in modo che convergano chiaramente sotto programmi brevi. Lascia i cambiamenti forniti invariati a meno che tu non comprenda il loro effetto sulla sincronizzazione e stabilità.
  • LoraLoaderModelOnly (#167). Applica il LightX2V Turbo LoRA. Una forza minore ammorbidisce l'effetto Turbo per movimenti più delicati; una forza maggiore può aumentare lo scatto ma può accentuare eccessivamente le texture.
  • MinimaxH3LatentUpscaler3D (#226). Aumenta i dettagli spaziali tra i passaggi mantenendo intatto il latente audio. Usa un mode.scale modesto per output di tipo 720p o un moltiplicatore maggiore per 1080p quando la VRAM lo consente.
  • VHS_VideoCombine (#189). Gestisce il muxing finale e l'esportazione. Regola frame_rate, imposta un prefisso di nome file e opzionalmente usa il trimming o il looping ping-pong per le anteprime.

Extra opzionali#

  • Riferimenti multimodali. Usa il nodo unificato H3 per lavorare con riferimenti immagine, riferimenti video, video con audio o riferimenti audio standalone senza passare a un grafico di generazione separato.
  • Prompt di avvio rapido. MiniMax H3 risponde bene a verbi cinematografici e linguaggio della telecamera. Brevi, specifici suggerimenti come "lento avvicinamento," "oscillazione a mano libera," o una linea di dialogo citata solitamente producono un movimento più forte e un discorso più pulito.
  • Scorciatoie di risoluzione. 0,4 MP con un upscale latente di 1,6x si avvicina a 720p. Un primo passaggio di 0,5 MP con un upscale di 2x si avvicina a 1080p. Se raggiungi i limiti di VRAM, riduci i megapixel prima di modificare il programma delle fasi.
  • Consigli di stabilità. Mantieni lo stesso seme per riprese riproducibili. Cambia solo il seme per rapide variazioni mantenendo il resto della temporizzazione e della direzione della scena.
  • Quando bypassare l'upscaler. Se dai priorità alla velocità o alla memoria, imposta il moltiplicatore dell'upscaler latente a 1 per saltare efficacemente la fase di miglioramento.
  • Scenari adatti. Questo flusso di lavoro MiniMax H3 Accelerazione in 8 Fasi funziona bene per riprese di personaggi medio-vicine, dialoghi con suono ambientale, riferimenti di scena audiovisivi, brevi battute atmosferiche e compiti video multimodali dove l'iterazione rapida è importante.

Riconoscimenti#

Questo flusso di lavoro implementa e si basa sui seguenti lavori e risorse. Ringraziamo con gratitudine RunningHub per il riferimento al flusso di lavoro, MiniMaxAI per il modello ufficiale MiniMax-H3, Comfy-Org per i pesi del modello MiniMax-H3 e lightx2v per il MiniMax H3 Turbo LoRA.

Per dettagli autorevoli, informazioni sulle licenze e termini di utilizzo del modello, fare riferimento alla documentazione e ai repository originali collegati di seguito.

Risorse#

Nota: L'uso dei modelli, dataset e codice di riferimento è soggetto alle rispettive licenze e termini forniti dai loro autori e manutentori.

RunComfy
Copyright 2026 RunComfy. Tutti i Diritti Riservati.

RunComfy è la piattaforma principale ComfyUI che offre ComfyUI online ambiente e servizi, insieme a workflow di ComfyUI con visuali mozzafiato. RunComfy offre anche AI Models, consentire agli artisti di sfruttare gli ultimi strumenti di AI per creare arte incredibile.