ComfyUI>Fluxos de Trabalho>MiniMax H3 All-in-One | Vídeo Rápido de Múltiplas Referências

MiniMax H3 All-in-One | Vídeo Rápido de Múltiplas Referências

Workflow Name: RunComfy/MiniMax-H3-ComfyUI
Workflow ID: 0000...1480
Use o MiniMax H3 Ref2VA para transformar nove imagens em uma cena cinematográfica. Adicione opcionalmente vídeo ou áudio para orientação. Você mantém personagens e detalhes consistentes. O som estéreo nativo chega junto com o clipe. SageAttention acelera a amostragem em GPUs compatíveis. Tags de imagem tornam o controle simples. Nota: Para máquinas 2XL ou maiores, por favor, defina sage_attention como desativado; caso contrário, o vídeo gerado pode parecer desfocado.

All-in-One MiniMax H3 ComfyUI Multi References Accelerated Workflow

MiniMax H3 ComfyUI Workflow | Fast Multi-Reference Video
Deseja executar este fluxo de trabalho?
  • Fluxos de trabalho totalmente operacionais
  • Sem nós ou modelos ausentes
  • Nenhuma configuração manual necessária
  • Apresenta visuais impressionantes

All-in-One MiniMax H3 ComfyUI Multi References Accelerated Examples

All-in-One MiniMax H3 ComfyUI Multi References Accelerated: vídeo multi-referência Ref2VA com áudio estéreo sincronizado#

Este workflow acelerado All-in-One MiniMax H3 ComfyUI Multi References transforma até nove referências visuais, além de dicas opcionais de vídeo e áudio, em um clipe cinematográfico curto com uma trilha sonora estéreo nativa. É projetado para criadores que desejam cenas consistentes em personagens que mesclam várias identidades, adereços ou locais, mantendo tags de prompt como <Picture 1> alinhadas à referência correta.

Construído em torno do stack aberto Comfy‑Org MiniMax‑H3 Ref2VA, o gráfico permite aceleração SageAttention para amostragem mais rápida em GPUs compatíveis e usa um modelo int8‑pruned para manter o VRAM sob controle sem sacrificar a coerência. O resultado é uma única tela pronta para RunComfy para MiniMax H3 onde a orientação multi-referência, tempo, resolução e exportação são conectados de ponta a ponta.

Modelos chave no workflow Comfyui All-in-One MiniMax H3 ComfyUI Multi References Accelerated#

  • Modelo de difusão MiniMax‑H3 Ref2VA (pruned int8 convrot). Gerador principal que funde suas referências e prompt em latentes conjuntos de vídeo e áudio. Pesos: Comfy‑Org/MiniMax‑H3.
  • Codificador de texto-imagem-linguagem Qwen3‑VL 32B (AWQ, embalado com o lançamento MiniMax‑H3). Interpreta seu prompt, incluindo tags como <Picture 1>, e condiciona o gerador. Os pesos estão incluídos em Comfy‑Org/MiniMax‑H3.
  • MiniMax H3 Video VAE (FP16). Decodifica latentes de vídeo em quadros com alta fidelidade. Pesos: Comfy‑Org/MiniMax‑H3.
  • MiniMax H3 Audio VAE (FP32). Decodifica latentes de áudio em uma forma de onda estéreo limpa, pronta para muxing. Pesos: Comfy‑Org/MiniMax‑H3.

Como usar o workflow Comfyui All-in-One MiniMax H3 ComfyUI Multi References Accelerated#

Em um nível alto, você carrega modelos, fornece referências e um prompt, o workflow constrói o condicionamento MiniMax‑H3, executa um sampler acelerado, depois decodifica e combina quadros de vídeo com o áudio estéreo gerado. Os grupos trabalham em sequência: Entradas do Usuário alimentam o Condicionamento, que dirige a Amostragem; os resultados decodificados vão para a Exportação.

Entradas do Usuário#

Use os nós LoadImage para conectar até nove referências. Mantenha uma ordem consistente para que as tags de prompt como <Picture 1>, <Picture 2>, e assim por diante, correspondam às imagens pretendidas. Escreva sua cena e diálogo no campo Input Text (Prompt), mapeando explicitamente identidades ou ativos para as tags numeradas no topo do prompt. Escolha aspecto e tamanho no Resolution Selector (Size); ele fornece largura e altura ajustadas a um múltiplo de 32 pixels para estabilidade. Defina a duração do clipe em segundos; uma expressão interna a converte em uma contagem de quadros próxima a 24 fps e a alinha a um múltiplo amigável para o modelo para uma amostragem suave.

Modelos#

Este grupo carrega o MiniMax‑H3 UNet, o codificador de texto Qwen3‑VL 32B, e ambos os VAEs. O modelo Ref2VA int8‑pruned reduz a memória enquanto preserva a qualidade de movimento e sincronização labial. O codificador de texto é inicializado para o MiniMax‑H3, então tags visuais em seu prompt se vinculam às referências corretas. VAEs separados para vídeo e áudio mantêm a decodificação precisa e eficiente. Os modelos são da mesma família usada pelo modelo oficial Ref2VA, adaptados aqui para controle multi-referência e áudio conjunto. Referência: MiniMax‑H3 R2V template.

Condicionamento#

MiniMaxH3ReferenceToVideo constrói o condicionamento H3 real e um clipe latente inicial. Ele ingere seu CLIP, VAEs, todas as imagens de referência conectadas, o prompt, e o comprimento, largura e altura escolhidos. O nó respeita tags de espaço reservado para que identidades, locais e adereços permaneçam conectados às referências corretas. Use o modo de tamanho de referência para manter a composição em escala em relação à sua saída. O nó emite um fluxo de condicionamento positivo e um clipe latente que juntos impulsionam o sampler.

Amostragem#

Antes da amostragem, o gráfico envolve o modelo com PathchSageAttentionKJ para habilitar a aceleração SageAttention, depois roteia através de um gerenciador de VRAM para que clipes grandes possam se ajustar mais confortavelmente. BasicGuider, BasicScheduler, e KSamplerSelect definem a estratégia de orientação, o cronograma de passos, e o algoritmo do sampler. RandomNoise semeia o processo e SamplerCustomAdvanced realiza as passagens de desnoising contra o modelo e condicionamento, produzindo latentes refinados de vídeo e áudio. O layout equilibra velocidade e qualidade para o MiniMax‑H3 enquanto mantém as configurações acessíveis.

Exportação#

VAEDecode e VAEDecodeAudio convertem os latentes finais em quadros e uma forma de onda estéreo. VHS_VideoCombine então muxa quadros e áudio em um único MP4 na taxa de quadros escolhida, com controle de qualidade via CRF e um prefixo de nome de arquivo simples para organização. Você pode visualizar o resultado imediatamente e salvá-lo em sua pasta de saída. Se você posteriormente fornecer um áudio de referência externo, o exportador pode cortar para esse comprimento de faixa para um alinhamento perfeito. O exportador vem da amplamente utilizada Video Helper Suite para ComfyUI: ComfyUI‑VideoHelperSuite.

Nós chave no workflow Comfyui All-in-One MiniMax H3 ComfyUI Multi References Accelerated#

MiniMaxH3ReferenceToVideo (#136) Este é o coração do workflow onde referências, prompt, tamanho e comprimento são fundidos em condicionamento MiniMax‑H3 e um clipe latente. Ajuste o texto prompt com mapeamentos de tag explícitos como <Picture 1> = character A para bloquear identidades. Ajuste width, height, e length para definir composição e tempo de execução; o seletor upstream e o controle de duração cuidam de múltiplos seguros. Use o modo de tamanho de referência para equilibrar a escala do sujeito em relação ao quadro de saída. O nó sustenta o caminho oficial Ref2VA e é adaptado aqui para controle multi-referência.

PathchSageAttentionKJ (#144) Envolve o modelo com SageAttention para acelerar camadas de atenção e reduzir a pressão de memória em GPUs suportadas. Deixe o modo de aceleração em auto para a maioria das placas; habilite a compilação do modelo apenas se o seu ambiente se beneficiar disso. Se você observar instabilidade, desligue o modo para comparar o desempenho. Fonte: ComfyUI‑KJNodes.

BasicScheduler (#124) Define o cronograma de sigma e os passos totais usados durante o desnoising. Aumentar os passos pode adicionar detalhes, mas aumenta o tempo de renderização; emparelhe qualquer mudança aqui com um tipo de sampler compatível. Mantenha denoise próximo ao máximo para geração pura, e considere reduzi-lo apenas ao fazer refinamento com força limitada.

SamplerCustomAdvanced (#125) Executa o loop de difusão com o sampler escolhido, cronograma, e guia. O sampler padrão equilibra estabilidade temporal e suavidade de movimento para o MiniMax‑H3. Se você mudar a família do scheduler, escolha um sampler projetado para ele para evitar artefatos.

Resolution Selector (Size) (#115) Fornece largura e altura ajustadas a um múltiplo de 32 pixels para formas amigáveis a GPU. Defina megapixels para um rápido tradeoff entre qualidade e velocidade, e escolha um aspecto como 16:9 para tomadas widescreen. Use tamanhos modestos para pré-visualizações de rascunho, depois aumente uma vez que o tempo e o enquadramento estejam travados.

ComfyMathExpression (#131) Transforma os segundos solicitados em uma contagem de quadros próxima a 24 fps e a alinha a um múltiplo que coopera com o sampler e o modelo. Isso ajuda a evitar tremores temporais e problemas de tempo fora de um. Você raramente precisa tocá-lo; controle o tempo a partir da entrada de segundos.

VHS_VideoCombine (#143) Muxa quadros e o áudio estéreo gerado em um produto final. Defina frame_rate para corresponder à sua linha do tempo alvo e ajuste crf para qualidade. Use trim_to_audio quando você fornecer uma faixa externa e quiser um corte perfeito para o comprimento.

Extras opcionais#

  • Tamanhos rápidos 16:9 que renderizam rápido e parecem limpos: 1056×608 (0.6 MP), 1216×672 (0.8 MP), 1344×768 (0.98 MP), 1664×928 (1.5 MP), 1920×1088 (2.0 MP).
  • Mantenha os prompts explícitos: comece com um bloco de mapeamento que vincule <Picture 1..9> a identidades, roupas, adereços ou locais antes de descrever a cena.
  • Para rostos consistentes, use imagens nítidas e de frente, variando apenas levemente a iluminação ou o ângulo nas referências.
  • Diálogo e foley funcionam bem quando escritos como frases curtas e naturais; o VAE de áudio sintetizará uma faixa estéreo limpa a partir do latente Ref2VA.
  • Se o VRAM estiver apertado, renderize um clipe mais curto primeiro ou reduza os megapixels, depois faça upscale ou estenda uma vez satisfeito com o movimento e o enquadramento.
  • Este layout segue a linhagem do modelo oficial Ref2VA, adaptado para controle multi-referência e aceleração. Veja o modelo base para contexto: MiniMax‑H3 R2V template.

Agradecimentos#

Este workflow implementa e constrói sobre os seguintes trabalhos e recursos. Agradecemos sinceramente à MiniMax pelo MiniMax H3, à Comfy-Org pelos pesos do modelo MiniMax-H3 e pelo modelo de workflow MiniMax H3 R2V, e à Comfy.org pelo tutorial MiniMax H3 por suas contribuições e manutenção. Para detalhes autoritativos, por favor, consulte a documentação original e os repositórios vinculados abaixo.

Recursos#

Nota: O uso dos modelos, datasets e códigos referenciados está sujeito às respectivas licenças e termos fornecidos por seus autores e mantenedores.

RunComfy
Copyright 2026 RunComfy. Todos os Direitos Reservados.

RunComfy é a principal ComfyUI plataforma, oferecendo ComfyUI online ambiente e serviços, juntamente com fluxos de trabalho do ComfyUI apresentando visuais impressionantes. RunComfy também oferece AI Models, permitindo que artistas utilizem as mais recentes ferramentas de AI para criar arte incrível.