All-in-One MiniMax H3 ComfyUI Multi References Accelerated: vídeo multi-referência Ref2VA com áudio estéreo sincronizado#
Este workflow acelerado All-in-One MiniMax H3 ComfyUI Multi References transforma até nove referências visuais, além de dicas opcionais de vídeo e áudio, em um clipe cinematográfico curto com uma trilha sonora estéreo nativa. É projetado para criadores que desejam cenas consistentes em personagens que mesclam várias identidades, adereços ou locais, mantendo tags de prompt como <Picture 1> alinhadas à referência correta.
Construído em torno do stack aberto Comfy‑Org MiniMax‑H3 Ref2VA, o gráfico permite aceleração SageAttention para amostragem mais rápida em GPUs compatíveis e usa um modelo int8‑pruned para manter o VRAM sob controle sem sacrificar a coerência. O resultado é uma única tela pronta para RunComfy para MiniMax H3 onde a orientação multi-referência, tempo, resolução e exportação são conectados de ponta a ponta.
Modelos chave no workflow Comfyui All-in-One MiniMax H3 ComfyUI Multi References Accelerated#
- Modelo de difusão MiniMax‑H3 Ref2VA (pruned int8 convrot). Gerador principal que funde suas referências e prompt em latentes conjuntos de vídeo e áudio. Pesos: Comfy‑Org/MiniMax‑H3.
- Codificador de texto-imagem-linguagem Qwen3‑VL 32B (AWQ, embalado com o lançamento MiniMax‑H3). Interpreta seu prompt, incluindo tags como <Picture 1>, e condiciona o gerador. Os pesos estão incluídos em Comfy‑Org/MiniMax‑H3.
- MiniMax H3 Video VAE (FP16). Decodifica latentes de vídeo em quadros com alta fidelidade. Pesos: Comfy‑Org/MiniMax‑H3.
- MiniMax H3 Audio VAE (FP32). Decodifica latentes de áudio em uma forma de onda estéreo limpa, pronta para muxing. Pesos: Comfy‑Org/MiniMax‑H3.
Como usar o workflow Comfyui All-in-One MiniMax H3 ComfyUI Multi References Accelerated#
Em um nível alto, você carrega modelos, fornece referências e um prompt, o workflow constrói o condicionamento MiniMax‑H3, executa um sampler acelerado, depois decodifica e combina quadros de vídeo com o áudio estéreo gerado. Os grupos trabalham em sequência: Entradas do Usuário alimentam o Condicionamento, que dirige a Amostragem; os resultados decodificados vão para a Exportação.
Entradas do Usuário#
Use os nós LoadImage para conectar até nove referências. Mantenha uma ordem consistente para que as tags de prompt como <Picture 1>, <Picture 2>, e assim por diante, correspondam às imagens pretendidas. Escreva sua cena e diálogo no campo Input Text (Prompt), mapeando explicitamente identidades ou ativos para as tags numeradas no topo do prompt. Escolha aspecto e tamanho no Resolution Selector (Size); ele fornece largura e altura ajustadas a um múltiplo de 32 pixels para estabilidade. Defina a duração do clipe em segundos; uma expressão interna a converte em uma contagem de quadros próxima a 24 fps e a alinha a um múltiplo amigável para o modelo para uma amostragem suave.
Modelos#
Este grupo carrega o MiniMax‑H3 UNet, o codificador de texto Qwen3‑VL 32B, e ambos os VAEs. O modelo Ref2VA int8‑pruned reduz a memória enquanto preserva a qualidade de movimento e sincronização labial. O codificador de texto é inicializado para o MiniMax‑H3, então tags visuais em seu prompt se vinculam às referências corretas. VAEs separados para vídeo e áudio mantêm a decodificação precisa e eficiente. Os modelos são da mesma família usada pelo modelo oficial Ref2VA, adaptados aqui para controle multi-referência e áudio conjunto. Referência: MiniMax‑H3 R2V template.
Condicionamento#
MiniMaxH3ReferenceToVideo constrói o condicionamento H3 real e um clipe latente inicial. Ele ingere seu CLIP, VAEs, todas as imagens de referência conectadas, o prompt, e o comprimento, largura e altura escolhidos. O nó respeita tags de espaço reservado para que identidades, locais e adereços permaneçam conectados às referências corretas. Use o modo de tamanho de referência para manter a composição em escala em relação à sua saída. O nó emite um fluxo de condicionamento positivo e um clipe latente que juntos impulsionam o sampler.
Amostragem#
Antes da amostragem, o gráfico envolve o modelo com PathchSageAttentionKJ para habilitar a aceleração SageAttention, depois roteia através de um gerenciador de VRAM para que clipes grandes possam se ajustar mais confortavelmente. BasicGuider, BasicScheduler, e KSamplerSelect definem a estratégia de orientação, o cronograma de passos, e o algoritmo do sampler. RandomNoise semeia o processo e SamplerCustomAdvanced realiza as passagens de desnoising contra o modelo e condicionamento, produzindo latentes refinados de vídeo e áudio. O layout equilibra velocidade e qualidade para o MiniMax‑H3 enquanto mantém as configurações acessíveis.
Exportação#
VAEDecode e VAEDecodeAudio convertem os latentes finais em quadros e uma forma de onda estéreo. VHS_VideoCombine então muxa quadros e áudio em um único MP4 na taxa de quadros escolhida, com controle de qualidade via CRF e um prefixo de nome de arquivo simples para organização. Você pode visualizar o resultado imediatamente e salvá-lo em sua pasta de saída. Se você posteriormente fornecer um áudio de referência externo, o exportador pode cortar para esse comprimento de faixa para um alinhamento perfeito. O exportador vem da amplamente utilizada Video Helper Suite para ComfyUI: ComfyUI‑VideoHelperSuite.
Nós chave no workflow Comfyui All-in-One MiniMax H3 ComfyUI Multi References Accelerated#
MiniMaxH3ReferenceToVideo (#136) Este é o coração do workflow onde referências, prompt, tamanho e comprimento são fundidos em condicionamento MiniMax‑H3 e um clipe latente. Ajuste o texto prompt com mapeamentos de tag explícitos como <Picture 1> = character A para bloquear identidades. Ajuste width, height, e length para definir composição e tempo de execução; o seletor upstream e o controle de duração cuidam de múltiplos seguros. Use o modo de tamanho de referência para equilibrar a escala do sujeito em relação ao quadro de saída. O nó sustenta o caminho oficial Ref2VA e é adaptado aqui para controle multi-referência.
PathchSageAttentionKJ (#144) Envolve o modelo com SageAttention para acelerar camadas de atenção e reduzir a pressão de memória em GPUs suportadas. Deixe o modo de aceleração em auto para a maioria das placas; habilite a compilação do modelo apenas se o seu ambiente se beneficiar disso. Se você observar instabilidade, desligue o modo para comparar o desempenho. Fonte: ComfyUI‑KJNodes.
BasicScheduler (#124) Define o cronograma de sigma e os passos totais usados durante o desnoising. Aumentar os passos pode adicionar detalhes, mas aumenta o tempo de renderização; emparelhe qualquer mudança aqui com um tipo de sampler compatível. Mantenha denoise próximo ao máximo para geração pura, e considere reduzi-lo apenas ao fazer refinamento com força limitada.
SamplerCustomAdvanced (#125) Executa o loop de difusão com o sampler escolhido, cronograma, e guia. O sampler padrão equilibra estabilidade temporal e suavidade de movimento para o MiniMax‑H3. Se você mudar a família do scheduler, escolha um sampler projetado para ele para evitar artefatos.
Resolution Selector (Size) (#115) Fornece largura e altura ajustadas a um múltiplo de 32 pixels para formas amigáveis a GPU. Defina megapixels para um rápido tradeoff entre qualidade e velocidade, e escolha um aspecto como 16:9 para tomadas widescreen. Use tamanhos modestos para pré-visualizações de rascunho, depois aumente uma vez que o tempo e o enquadramento estejam travados.
ComfyMathExpression (#131) Transforma os segundos solicitados em uma contagem de quadros próxima a 24 fps e a alinha a um múltiplo que coopera com o sampler e o modelo. Isso ajuda a evitar tremores temporais e problemas de tempo fora de um. Você raramente precisa tocá-lo; controle o tempo a partir da entrada de segundos.
VHS_VideoCombine (#143) Muxa quadros e o áudio estéreo gerado em um produto final. Defina frame_rate para corresponder à sua linha do tempo alvo e ajuste crf para qualidade. Use trim_to_audio quando você fornecer uma faixa externa e quiser um corte perfeito para o comprimento.
Extras opcionais#
- Tamanhos rápidos 16:9 que renderizam rápido e parecem limpos: 1056×608 (0.6 MP), 1216×672 (0.8 MP), 1344×768 (0.98 MP), 1664×928 (1.5 MP), 1920×1088 (2.0 MP).
- Mantenha os prompts explícitos: comece com um bloco de mapeamento que vincule
<Picture 1..9>a identidades, roupas, adereços ou locais antes de descrever a cena. - Para rostos consistentes, use imagens nítidas e de frente, variando apenas levemente a iluminação ou o ângulo nas referências.
- Diálogo e foley funcionam bem quando escritos como frases curtas e naturais; o VAE de áudio sintetizará uma faixa estéreo limpa a partir do latente Ref2VA.
- Se o VRAM estiver apertado, renderize um clipe mais curto primeiro ou reduza os megapixels, depois faça upscale ou estenda uma vez satisfeito com o movimento e o enquadramento.
- Este layout segue a linhagem do modelo oficial Ref2VA, adaptado para controle multi-referência e aceleração. Veja o modelo base para contexto: MiniMax‑H3 R2V template.
Agradecimentos#
Este workflow implementa e constrói sobre os seguintes trabalhos e recursos. Agradecemos sinceramente à MiniMax pelo MiniMax H3, à Comfy-Org pelos pesos do modelo MiniMax-H3 e pelo modelo de workflow MiniMax H3 R2V, e à Comfy.org pelo tutorial MiniMax H3 por suas contribuições e manutenção. Para detalhes autoritativos, por favor, consulte a documentação original e os repositórios vinculados abaixo.
Recursos#
- Anúncio oficial do MiniMax H3
- Docs / Notas de Lançamento: MiniMax H3 announcement
- Pesos do modelo Comfy-Org MiniMax-H3
- Hugging Face: Comfy-Org/MiniMax-H3
- Tutorial Comfy.org MiniMax H3
- Docs / Notas de Lançamento: Comfy.org tutorial
- Template Comfy.org MiniMax H3 R2V
- GitHub: Comfy-Org/workflow_templates
Nota: O uso dos modelos, datasets e códigos referenciados está sujeito às respectivas licenças e termos fornecidos por seus autores e mantenedores.


