ComfyUI>Workflow>MiniMax H3 Scene d'Azione | Video di Azione Guidata

MiniMax H3 Scene d'Azione | Video di Azione Guidata

Workflow Name: RunComfy/MiniMax-H3-Action
Workflow ID: 0000...1527
Trasforma due immagini di personaggi e un riferimento di scena in un video d'azione. Ottieni audio nativo e personaggi guidati dall'identità. Struttura i prompt per controllare la coreografia. Il campionamento a due stadi affina il movimento. Costruisci clip di combattimento con spade, boxe o sci-fi. Esamina contatti rapidi di mani e armi per artefatti.

ComfyUI MiniMax H3 Action Scenes Workflow

MiniMax H3 Action Scenes | Reference Video + Native Audio
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

ComfyUI MiniMax H3 Action Scenes Examples

MiniMax H3 Scene d'Azione: Generatore di video d'azione guidati da riferimento con audio nativo#

MiniMax H3 Scene d'Azione è un workflow ComfyUI per creare video d'azione diretti con precisione, guidati da riferimenti e con audio nativo sincronizzato. Fornisci due immagini di personaggi, un riferimento di scena e un prompt strutturato. Il workflow gestisce il movimento con MiniMax H3 Turbo, poi affina la composizione e la leggibilità del combattimento con LMS e Combat LoRAs preservando l'audio originale. Gli output includono un video “base” a prima passata veloce e un video “raffinato” di maggiore fedeltà.

Questo workflow Comfyui MiniMax H3 Scene d'Azione è progettato per previz, design di stunt e combattimenti, cinematica di giochi e VFX, e brevi clip sociali. Esempi testati includono duelli con spade nel castello, lavoro con guantoni in palestra di boxe e un'esercitazione con bastone su una nave spaziale. Mantieni l'identità dei personaggi e la coreografia espliciti nel prompt, e rivedi contatti rapidi di mani o armi per possibili artefatti.

Modelli chiave nel workflow Comfyui MiniMax H3 Scene d'Azione#

  • Comfy‑Org MiniMax H3 core suite. Fornisce l'encoder di testo più i VAEs video e audio usati per costruire, separare e decodificare il latente audio-video congiunto. Vedi modelli e LoRAs nella collezione ufficiale. MiniMax‑H3 models
  • Minimax‑h3 Singularity (UNet). Serve come generatore base ref‑to‑video che fonde riferimenti e prompt in un latente audio-video per scene d'azione. Minimax‑h3_Singularity
  • MiniMax‑H3 Turbo LoRA. Velocizza la prima passata così puoi iterare rapidamente sui battiti del movimento prima del raffinamento. Incluso nella collezione ufficiale MiniMax H3. MiniMax‑H3 LoRAs
  • MiniMax‑H3 LMS LoRA. Aggiunge layout, materiali e nitidezza strutturale adatti a output in stile live‑action; usato durante la seconda passata. LMS LoRA r64
  • H3 Combat LoRA. Migliora la chiarezza delle silhouette di combattimento, dei contatti delle lame e del lavoro di piedi a terra in scenari d'azione. Incluso nella collezione MiniMax H3. MiniMax‑H3 models
  • H3 Latent Upscaler LMS. Un upscaler temporale 3D che ingrandisce il latente video tra le passate mantenendo la continuità del movimento. Comfyui Minimax H3 Latent Upscaler

Come usare il workflow Comfyui MiniMax H3 Scene d'Azione#

La pipeline funziona in due passate coordinate. La Passata 1 stabilisce movimento e tempistica con Turbo per velocità. Il latente video viene poi ingrandito e raffinato nella Passata 2 con LMS e Combat LoRAs mentre l'audio nativo viene mantenuto. Ricevi sia un'anteprima “base” veloce che un'esportazione “raffinata” lucidata.

Impostazioni#

Usa il gruppo Impostazioni per scegliere rapporto d'aspetto, risoluzione di lavoro, durata del clip e frame rate. Il controllo della durata converte i secondi in un conteggio dei frame che si allinea con il campionamento del campionatore, il che aiuta la stabilità. Inizia più in basso per anteprime rapide, poi aumenta una volta che l'inquadratura e i battiti sembrano giusti. Risoluzioni più alte e clip più lunghi aumentano VRAM e tempo di rendering.

Riferimenti#

Carica tre riferimenti: un'immagine per personaggio e un'immagine che definisce l'ambiente. Le immagini dei personaggi agiscono come guide di identità e costume, non sfondi, quindi scegli ritratti puliti con volti leggibili e elementi chiave del guardaroba. Il riferimento di scena imposta l'illuminazione, la palette e l'architettura; scegli una vista che corrisponda all'altezza della telecamera desiderata. Puoi scambiare i riferimenti liberamente per esplorare diversi abbinamenti e location.

Condizioni#

Il nodo MiniMaxH3ReferenceToVideo (#56) fonde il prompt strutturato con i riferimenti e gli encoder MiniMax H3 per produrre un latente audio-video congiunto e un condizionamento positivo. Il prompt funziona meglio quando suddiviso in sezioni etichettate come definizioni_soggetto, sommario, analisi_conservazione, descrizione_dettagliata, paesaggio_sonoro_generale e musica_non_diegetica. Sii esplicito sul numero di combattenti, armi, movimento della telecamera e il conteggio esatto dei contatti puliti. Evita personaggi extra, teletrasporti, mosse sovrumane o effetti se vuoi risultati radicati.

LoRAs#

Le LoRAs sono applicate in due stadi. Turbo è iniettato per la prima passata per accelerare l'esplorazione del movimento senza sacrificare la ritenzione dell'identità. La LMS LoRA fluisce attraverso una correzione di compatibilità AdaLN, poi Combat è applicato così che il raffinatore enfatizzi silhouette leggibili e scambi di colpi e parate. Puoi regolare le forze delle LoRA per bilanciare realismo e stilizzazione per il tuo genere.

Patchs#

Questo gruppo configura prestazioni e modellazione degli orari. PathchSageAttentionKJ (#199) ottimizza l'attenzione per memoria e velocità in modo che le scene ad alto movimento rimangano reattive. MiniMaxH3SigmaShift (#297) allinea i programmi sigma di video e audio, migliorando la sincronizzazione dei movimenti delle labbra e del foley rispetto al movimento. Usa questi quando vedi deriva temporale o piccola instabilità identitaria.

1° Campionamento#

La prima passata inizializza il rumore, imposta un programma compatto e campiona con SamplerCustomAdvanced (#238) guidato dal tuo condizionamento positivo. L'output viene salvato come latente base e può essere decodificato in un video di anteprima veloce con audio nativo per una revisione rapida. Questa passata è dove giudichi il blocco, il viaggio della telecamera e la cadenza dei colpi. Se la mappa dei battiti è sbagliata, rivedi il prompt e i riferimenti qui prima di affinare.

2° Campionamento + Raffinatore#

Prima del raffinamento, l'audio e il video sono separati dalla prima passata, il latente video è ingrandito con MinimaxH3LatentUpscaler3D (#124), e il latente audio è mantenuto intatto. Il raffinatore poi campiona con sigmas a basso rumore usando LMS e Combat LoRAs per aggiungere dettaglio materiale, fedeltà dei bordi e leggibilità del combattimento. Infine, le immagini e l'audio preservato sono decodificati e combinati nell'esportazione raffinata. Aspettati bordi più nitidi, mani e lame più pulite, e identità più stabile rispetto alla passata base.

Nodi chiave nel workflow Comfyui MiniMax H3 Scene d'Azione#

MiniMaxH3ReferenceToVideo (#56)#

Costruisce un latente audio-video sincronizzato dal tuo prompt strutturato e dalle immagini di riferimento usando l'encoder di testo MiniMax H3 e i VAEs. Regola il prompt, width, height, e length per controllare contenuto, inquadratura e durata. Per i migliori risultati, mantieni le definizioni dei soggetti e i vincoli della scena non ambigui. Riferimento: Comfy‑Org MiniMax‑H3.

MinimaxH3LatentUpscaler3D (#124)#

Upscaler latente 3D temporale coerente che ingrandisce il latente video tra le passate prima del raffinamento. Aumenta mode.scale moderatamente per guadagnare dettaglio senza destabilizzare il movimento. Utile quando ti piace la tempistica della passata-1 ma vuoi bordi e texture più nitidi. Riferimento: Comfyui Minimax H3 Latent Upscaler.

MiniMaxH3SigmaShift (#297)#

Cambia i programmi sigma di audio e video usati da MiniMax H3 in modo che movimento, indizi delle labbra e foley rimangano allineati. Regolare shift_video e shift_audio può ridurre la deriva temporale nei dialoghi o negli impatti. Lascia piccoli offset a meno che non noti desincronizzazione all'inizio o alla fine. Riferimento: MiniMax‑H3 collection.

VHS_VideoCombine (#264)#

Combina fotogrammi decodificati e audio nel file MP4 finale con il frame rate e le impostazioni di qualità scelti. Abilita il salvataggio dei metadati per mantenere le origini e i dettagli del workflow nelle esportazioni. Usa trim_to_audio quando il tuo video raffinato si estende oltre l'audio preservato. Riferimento: ComfyUI‑VideoHelperSuite.

PathchSageAttentionKJ (#199)#

Ottimizzazione dell'attenzione che può migliorare il throughput e la stabilità per scene ad alto dettaglio e risoluzioni maggiori. Mantienilo abilitato per riprese più lunghe o ambienti complessi. Se incontri regressioni di prestazioni su clip più piccoli, prova la sua modalità automatica. Riferimento: ComfyUI‑KJNodes.

Extra opzionali#

  • Schema di prompting. Usa il formato sezionato fornito e scrivi una mappa dei battiti per l'azione. Specifica il numero esatto di combattenti e armi, movimento della telecamera, e il conteggio e la tempistica dei contatti leggibili.
  • Curazione dei riferimenti. Scegli foto di identità con volti chiari e guardaroba, e un'immagine di location che corrisponda alla prospettiva e all'illuminazione desiderate. Evita sfondi occupati sui riferimenti dei personaggi per ridurre conflitti.
  • Revisione passata. Guarda il video base per convalidare blocco e tempistica prima di affinare. Se i contatti sembrano sfocati, aumenta la chiarezza nel prompt e riduci la velocità frenetica di mani o lame.
  • Problemi tipici e soluzioni. Contatti rapidi di mani o armi possono causare piccole distorsioni; semplifica la coreografia attorno agli impatti, accorcia lo scambio o aumenta la distanza dalla telecamera per aiutare il modello a rendere il momento chiaramente.
  • Deliverables. Il workflow scrive un'anteprima base veloce e un'esportazione raffinata così puoi confrontare il movimento con l'aspetto finale. Usa il clip raffinato per la condivisione una volta che identità, ambiente e battiti soddisfano il tuo obiettivo.

Con MiniMax H3 Scene d'Azione puoi trasformare due immagini di personaggi, un riferimento di scena e un breve preciso in clip d'azione radicati e fedeli ai riferimenti con audio nativo sincronizzato, pronti per l'editoriale, la previz o la pubblicazione.

Riconoscimenti#

Questo workflow implementa e si basa sui seguenti lavori e risorse. Ringraziamo sinceramente Innovate Futures @ Benji per la guida sul workflow AI Video MiniMax H3 ComfyUI, WarmBloodAban per Minimax-h3_Singularity, e Comfy-Org e RunningHubAI per i modelli base MiniMax-H3 e LMS LoRA per i loro contributi e la manutenzione. Per dettagli autorevoli, si prega di fare riferimento alla documentazione originale e ai repository collegati di seguito.

Risorse#

Nota: L'uso dei modelli, dei dataset e del codice di riferimento è soggetto alle rispettive licenze e ai termini forniti dai loro autori e manutentori.

RunComfy
Copyright 2026 RunComfy. Tutti i Diritti Riservati.

RunComfy è la piattaforma principale ComfyUI che offre ComfyUI online ambiente e servizi, insieme a workflow di ComfyUI con visuali mozzafiato. RunComfy offre anche AI Models, consentire agli artisti di sfruttare gli ultimi strumenti di AI per creare arte incredibile.