ComfyUI>Workflow>MiniMax H3 Dual-Sampling R2V ad Alta Qualità

MiniMax H3 Dual-Sampling R2V ad Alta Qualità

Workflow Name: RunComfy/MiniMax-H3-Dual
Workflow ID: 0000...1503
Trasforma più immagini di riferimento in brevi video cinematografici. Mantieni coerenza tra personaggi e prodotti nelle riprese. Il campionamento duale bilancia dettaglio e movimento fluido. L'audio nativo rimane sincronizzato. Un Turbo LoRA a 4 fasi accelera la generazione. Il grafico MiniMax H3 pronto all'uso risparmia tempo di configurazione.

ComfyUI MiniMax H3 High Quality Dual-Sampling workflow Flusso di lavoro

MiniMax H3 Dual-Sampling Workflow | Ref2VA + Turbo LoRA
Vuoi eseguire questo workflow?
  • Workflow completamente operativi
  • Nessun nodo o modello mancante
  • Nessuna configurazione manuale richiesta
  • Presenta visuali mozzafiato

ComfyUI MiniMax H3 High Quality Dual-Sampling workflow Esempi

Flusso di lavoro Dual-Sampling ad Alta Qualità MiniMax H3: video multi-riferimento con audio nativo sincronizzato#

Il flusso di lavoro Dual-Sampling ad Alta Qualità MiniMax H3 è un grafico "reference-to-video" pronto per RunComfy, per trasformare più immagini di riferimento e opzionali suggerimenti video o audio in brevi clip cinematografiche con audio nativo generato nello stesso passaggio. Bilancia il mantenimento dell'identità, il movimento stabile e i dettagli nitidi combinando una programmazione dual-sampling, attenzione H3 efficiente in termini di memoria, VAEs dedicati per video e audio, e un percorso Turbo LoRA a 4 fasi.

Progettato per creatori che necessitano di continuità tra prodotti o personaggi, questo flusso di lavoro Dual-Sampling ad Alta Qualità MiniMax H3 ti consente di definire soggetti, scene e suoni in un unico prompt, poi produce output video H3 raffinati senza ricostruire un grafico. Alimentalo con un set di immagini fisse, inserisci un riferimento audio di stile e esporta un MP4 pronto per la condivisione.

Modelli chiave nel flusso di lavoro Dual-Sampling ad Alta Qualità MiniMax H3 di Comfyui#

  • Modello di diffusione MiniMax H3 Reference-to-Video (Ref2VA). Generatore centrale che converte riferimenti più testo in un latente audiovisivo, alimentando sia i fotogrammi che l'audio nativo. Vedi pacchetto modello e pesi nei repository ufficiali: MiniMaxAI/MiniMax-H3 e Comfy-Org/MiniMax-H3.
  • Codificatore di testo Qwen3-VL 32B ottimizzato per MiniMax H3. Interpreta prompt strutturati che descrivono soggetti, riprese e suoni, poi condiziona l'H3 UNet tramite embedding in stile CLIP inclusi nel pacchetto modello Comfy-Org: Comfy-Org/MiniMax-H3.
  • MiniMax H3 Video VAE. Comprimi e decodifica i latenti video per una generazione di fotogrammi efficiente e di alta qualità, fornito con la release Comfy-Org: Comfy-Org/MiniMax-H3.
  • MiniMax H3 Audio VAE. Codifica e decodifica i latenti audio nativi così che il discorso e l'ambiente siano prodotti e sincronizzati all'interno della stessa pipeline: Comfy-Org/MiniMax-H3.
  • MiniMax H3 Turbo 4-step LoRA. Un percorso di affinamento leggero che migliora i dettagli e la stabilità temporale mantenendo veloce il runtime. Si sovrappone al modello base H3 Ref2VA in questo flusso di lavoro.

Come usare il flusso di lavoro Dual-Sampling ad Alta Qualità MiniMax H3 di Comfyui#

Questo grafico è organizzato in gruppi chiari che passano il lavoro dai riferimenti e dal prompt, attraverso il campionamento H3, alla decodifica e all'esportazione MP4. Il campionamento duale stabilisce prima movimento e struttura, poi affina dettagli e audio preservando le identità.

Area di Riferimento#

Carica fino a nove riferimenti fissi per persone, oggetti o ambienti. Questi alimentano il nodo H3 ref-to-video affinché il modello possa bloccarsi su elementi di identità, guardaroba e scena. Puoi anche instradare un breve clip come riferimento visivo se lo desideri. Usa riferimenti che già corrispondono alla prospettiva o all'illuminazione target per una migliore ritenzione. Se porti un batch o un foglio di sprite, GetImageRangeFromBatch (#40) può estrarre i fotogrammi che vuoi usare a valle.

Area di Riferimento Video#

Se preferisci iniziare da un video di riferimento, usa il caricatore video per estrarre fotogrammi e opzionalmente limitare la durata. GetImageRangeFromBatch (#40) seleziona una porzione contigua così il flusso di lavoro rimane leggero. Questi fotogrammi agiscono come guida strutturale o di movimento per il primo passaggio H3. Puoi mescolare video con immagini fisse; l'encoder H3 li fonde prima del campionamento.

Area di Riferimento Audio#

Carica da uno a tre brevi frammenti audio per guidare timbro vocale, cadenza o ambiente. Questi non vengono copiati alla lettera; piuttosto modellano il latente audio in modo che il discorso finale o il paesaggio sonoro segua lo stesso stile. Per le linee parlate, brevi clip vocali pulite con minimo sfondo funzionano meglio. Se ometti l'audio, il flusso di lavoro genera comunque un ambiente plausibile dal prompt.

modello#

Questo gruppo collega l'H3 UNet, il codificatore di testo basato su Qwen e entrambi i VAEs, quindi applica una patch di attenzione efficiente in termini di memoria. Il Lora Loader Stack (rgthree) (#118) aggiunge il Turbo LoRA a 4 fasi così ottieni più dettagli senza lunghe programmazioni. Il nodo della patch di attenzione riduce la pressione VRAM, utile a risoluzioni più grandi. Insieme preparano lo stack di condizionamento che i campionatori useranno.

Campionamento#

MiniMaxH3ReferenceToVideo (#56) è dove il tuo prompt, i riferimenti e la risoluzione si uniscono per produrre condizionamento e un latente audiovisivo iniziale. Il nodo legge le sezioni del prompt strutturato come subject_definitions, summary, retention_analysis, detailed_description, overall_soundscape, e non_diegetic_music. Un guida base e una scelta di campionatore sono impostati qui per mantenere la configurazione semplice pur consentendo un forte controllo. Consideralo come l'area di preparazione prima che i raffinatori del campionamento duale prendano il sopravvento.

Sigmi#

Un breve scheduler produce il programma sigma, che viene poi diviso per guidare la struttura di campionamento duale. Un ramo enfatizza la stabilità e il movimento grossolano, mentre l'altro enfatizza il dettaglio ad alta frequenza e la nitidezza. Un piccolo interruttore booleano ti consente di estendere o bypassare una regione intermedia quando hai bisogno di più pulizia su riprese difficili. Non è necessario sintonizzare i numeri qui; basta scegliere se abilitare l'intervallo esteso quando volti o loghi necessitano di maggiore fedeltà.

SamplerCustomAdvanced#

Il primo passaggio SamplerCustomAdvanced (#108) funziona su un intervallo sigma più basso per stabilire layout, identità e ritmo del movimento. Il latente viene quindi separato in video e audio, e il latente video può essere leggermente upscale nello spazio latente per aggiungere margine di manovra per i dettagli. Il secondo passaggio SamplerCustomAdvanced (#103) utilizza una fetta sigma più alta per affilare bordi e texture rispettando il guida del primo passaggio. Un passaggio compagno SamplerCustomAdvanced (#106) può denoise selettivamente o preservare regioni, e un nodo interruttore decide il miglior latente finale prima della decodifica. Questa danza a due passaggi è ciò che conferisce al flusso di lavoro Dual-Sampling ad Alta Qualità MiniMax H3 il suo mix affidabile di stabilità e dettaglio nitido.

Nodi di Accelerazione#

Per GPU con VRAM più stretto, UniBlockSwap aiuta scambiando temporaneamente i blocchi UNet nella memoria di sistema, e VRAMReserver mantiene abbastanza margine per la decodifica e il muxing finale. Questi aiuti per velocità e memoria hanno un impatto minimo sulla qualità e possono essere attivati quando vedi avvisi di memoria insufficiente. Tienili vicino al percorso UNet come cablato nel grafico.

Salva Video#

Il latente finale è decodificato dai VAEs video e audio dedicati, quindi PixaromaSaveMp4 (#115) muxa i fotogrammi e l'audio in un MP4. Imposta il tuo frame rate target qui e scegli se tagliare il video alla lunghezza audio generata. Il prefisso del nome file e la sottocartella rendono facile mantenere le riprese organizzate. Quando ri-esegui con un nuovo seed o riferimenti, gli output si accumuleranno nella stessa cartella.

Nodi chiave nel flusso di lavoro Dual-Sampling ad Alta Qualità MiniMax H3 di Comfyui#

MiniMaxH3ReferenceToVideo (#56)#

Fonde testo, immagine e opzionali riferimenti video o audio in condizionamento e un latente audiovisivo iniziale per H3. Regola il prompt per definire soggetti, continuità della scena, tempistica delle riprese e design sonoro, e imposta width, height, e length per mirare ad aspetto e durata. Usa più immagini di riferimento per bloccare identità e guardaroba quando la continuità è importante.

Lora Loader Stack (rgthree) (#118)#

Applica il Turbo LoRA a 4 fasi MiniMax H3 sul modello base per migliorare i dettagli in programmazioni brevi. Modifica la forza del LoRA se i bordi diventano troppo nitidi o se lo stile del modello base viene sovrascritto. Mantieni la stratificazione LoRA minima quando i riferimenti già portano una forte texture.

MiniMaxH3MemoryEfficientSageAttentionPatch (#70)#

Abilita l'attenzione efficiente in termini di memoria per l'H3 UNet così puoi eseguire risoluzioni più alte o clip più lunghe su GPU modeste. Attivalo per schede da 8 a 12 GB o quando vedi picchi di VRAM. Disabilita solo se stai facendo benchmarking del throughput grezzo su GPU ad alta memoria.

SplitSigmas (#99)#

Divide lo scheduler in bande sigma complementari che alimentano i due passaggi del campionatore. Se la tua scena è stabile ma manca di mordente, sposta più peso sul ramo ad alto sigma. Se il movimento traballa o le identità si spostano, favorisci il ramo a basso sigma e tieni l'interruttore intermedio esteso spento.

SamplerCustomAdvanced (#108)#

Primo passaggio del campionatore che stabilisce struttura, movimento e identità. Mantieni il guida coerente con il tuo prompt e riferimenti così il secondo passaggio ha una base pulita. Usa questo passaggio per testare rapidamente semi e inquadrature prima di impegnarti nell'affinamento.

SamplerCustomAdvanced (#103)#

Campionatore di affinamento che utilizza una fetta sigma più alta per migliorare i dettagli e correggere i bordi. Funziona meglio dopo un solido primo passaggio; evita di sovraccaricarlo quando volti o loghi iniziano a sovraffilarsi. Abbinalo all'upscaling latente solo quando hai bisogno di ulteriore margine di texture.

ComfySwitchNode (#107)#

Sceglie tra alternative di affinamento latente dopo il campionamento duale. Attivalo quando confronti i risultati dal ramo di denoise ausiliario rispetto al ramo di affinamento diretto. Tieni nota di quale percorso mantiene meglio l'identità per il tuo set di soggetti.

PixaromaSaveMp4 (#115)#

Muxa fotogrammi decodificati e audio in MP4. Imposta fps per adattare la sensazione del tuo movimento e usa trim_to_audio per una stretta sincronizzazione audiovisiva. Aggiorna il filename_prefix per mantenere le riprese organizzate per scatto o soggetto.

Extra opzionali#

  • Inizia dal template ufficiale H3 R2V per imparare il pattern base prima di personalizzare questo grafico: Comfy-Org workflow template.
  • Usa ResolutionSelector (#73) per scegliere un aspetto e un target megapixel che la tua GPU può gestire, quindi aumenta gradualmente una volta che l'inquadratura sembra giusta.
  • Prompt in sezioni strutturate che il modello comprende: subject_definitions, summary, retention_analysis, detailed_description, overall_soundscape, non_diegetic_music. Questo stile dà a H3 vincoli più chiari.
  • Per scatti critici per l'identità, fornisci da 3 a 5 immagini fisse di alta qualità dello stesso soggetto in illuminazione e angolazione corrispondenti. Evita filtri pesanti sui riferimenti.
  • Fornisci un clip di stile vocale pulito da 1 a 5 secondi come riferimento audio per un timbro coerente tra i personaggi. Mantieni basso rumore e musica.
  • Se raggiungi i limiti di VRAM, abilita la patch di attenzione e il gruppo di Nodi di Accelerazione. Riduci prima la risoluzione, poi la lunghezza.
  • Quando il movimento è giusto ma le texture sono morbide, mantieni il primo passaggio come è e aumenta la dipendenza dal secondo ramo del campionatore anziché estendere i passaggi complessivi.
  • Salva spesso le versioni. Piccole modifiche al prompt hanno grandi effetti perché il flusso di lavoro Dual-Sampling ad Alta Qualità MiniMax H3 condiziona sia video che audio insieme.

Riconoscimenti#

Questo flusso di lavoro implementa e si basa sui seguenti lavori e risorse. Ringraziamo con gratitudine MiniMaxAI per il modello MiniMax-H3, Comfy-Org/Comfy.org per i template ComfyUI, i pesi e il tutorial per MiniMax H3, e RunningHub.ai per il riferimento al flusso di lavoro per i loro contributi e manutenzione. Per i dettagli autorevoli, si prega di fare riferimento alla documentazione originale e ai repository collegati di seguito.

Risorse#

Nota: L'uso dei modelli, dei dataset e del codice referenziati è soggetto alle rispettive licenze e termini forniti dai loro autori e manutentori.

RunComfy
Copyright 2026 RunComfy. Tutti i Diritti Riservati.

RunComfy è la piattaforma principale ComfyUI che offre ComfyUI online ambiente e servizi, insieme a workflow di ComfyUI con visuali mozzafiato. RunComfy offre anche AI Models, consentire agli artisti di sfruttare gli ultimi strumenti di AI per creare arte incredibile.