ComfyUI>Fluxos de Trabalho>MiniMax H3 Reference to Video ComfyUI | Estéreo

MiniMax H3 Reference to Video ComfyUI | Estéreo

Workflow Name: RunComfy/MiniMax-H3-Ref2Video
Workflow ID: 0000...1473
Transforme duas referências em um clipe cinematográfico. Mantenha seus personagens consistentes. Gere áudio estéreo nativo com o vídeo. Use tags de imagem exatas para controle de prompt. Teste cenas estilizadas rapidamente. Crie conceitos de áudio e vídeo polidos com um gráfico MiniMax H3 Ref2VA.

MiniMax H3 Reference to Video ComfyUI Workflow

MiniMax H3 Ref to Video in ComfyUI | Native Stereo Audio
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

MiniMax H3 Reference to Video ComfyUI Examples

MiniMax H3 Reference to Video ComfyUI: fluxo de trabalho de áudio estéreo nativo Ref2VA#

Este fluxo de trabalho MiniMax H3 Reference to Video ComfyUI, pronto para RunComfy, transforma imagens de referência conectadas em um vídeo cinematográfico curto com áudio estéreo nativo gerado em conjunto. Construído a partir do modelo Reference-to-Video do Comfy.org e verificado contra os pesos abertos MiniMax-H3 do Comfy-Org, é ideal para tomadas consistentes com personagens, testes de cenas estilizadas e clipes conceituais onde a formulação do prompt e tags como <Picture 1> e <Picture 2> são importantes.

Pronto para uso, o gráfico conecta duas referências de imagem e um prompt de forma livre para produzir um vídeo com som sincronizado em uma única passagem. O nó central também expõe entradas opcionais para mais imagens de referência, vídeos de referência com seu áudio e referências de áudio autônomas, para que você possa aumentar a força do condicionamento conforme necessário. Se você deseja um ponto de partida alinhado com o design original, veja o arquivo de modelo Comfy.org no GitHub video_minimax_h3_r2v.json.

Modelos principais no fluxo de trabalho MiniMax H3 Reference to Video ComfyUI#

  • Comfy-Org/MiniMax-H3 diffusion weights (Ref2VA): O núcleo generativo especializado para vídeo e áudio a partir de referência, usado via UNETLoader. Aprende com referências de texto e visuais/áudio para produzir um único latente que carrega tanto vídeo quanto áudio estéreo. Model card and files
  • MiniMax H3 Video VAE (FP16): Decodifica a metade do vídeo do latente conjunto para quadros com alta fidelidade visual. minimax_h3_video_vae_fp16.safetensors
  • MiniMax H3 Audio VAE (FP32): Decodifica a metade do áudio do latente conjunto para forma de onda estéreo nativa. minimax_h3_audio_vae_fp32.safetensors
  • Qwen3-VL 32B MiniMax-H3 text-image encoder (AWQ): Codifica seu prompt mais tags de referência e tokens visuais para condicionamento. qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors

Como usar o fluxo de trabalho MiniMax H3 Reference to Video ComfyUI#

Este fluxo de trabalho direciona suas referências e prompt para o núcleo Ref2VA do MiniMax H3, amostra um único latente que contém tanto vídeo quanto áudio, depois decodifica e mistura o resultado para um MP4 com som sincronizado. Os grupos abaixo mapeiam para o gráfico para que você possa ver o que mudar e por quê.

Entradas do Usuário#

Use LoadImage (#137) e LoadImage (#139) para fornecer duas referências visuais. O prompt vai em Input Text (Prompt) (#138); faça referência a cada entrada explicitamente por tag na ordem em que você as conectou, por exemplo, <Picture 1> e <Picture 2>, antes de descrever a cena, movimento e som. Defina seu aspecto alvo e contagem de pixels em Resolution Selector (Size) (#115). Escolha a duração do vídeo em segundos com Float (Duration) (#132); é automaticamente convertido para um comprimento de quadro válido por ComfyMathExpression (#131) para que áudio e vídeo permaneçam alinhados.

Modelos#

UNETLoader (#127) carrega os pesos de difusão MiniMax H3 Ref2VA que impulsionam a geração. CLIPLoader (#128) carrega o codificador Qwen3-VL 32B usado para tokenizar seu texto e tags de referência. Dois nós VAELoader (#119 vídeo, #120 áudio) fornecem os decodificadores emparelhados que posteriormente desempacotarão o latente conjunto de volta em quadros e áudio estéreo. Esses modelos são os únicos ativos que você precisa trocar ao migrar para diferentes variantes MiniMax H3 dentro da mesma família de tarefas.

Condicionamento#

MiniMaxH3ReferenceToVideo (#136) é o coração do pipeline. Ele aceita seu prompt de texto, largura, altura e o length (quadros) calculado, além de quaisquer ref_images, ref_videos e referências de áudio opcionais conectadas. O nó emite um fluxo de condicionamento positivo para orientação e um latente inicializado que ancora identidade, composição, movimento e design de som de acordo com suas referências e tags. Para fidelidade de identidade a partir de imagens, conecte referências bem iluminadas, no modelo, e faça referência a elas precisamente no prompt; para movimento ou ritmo, você pode adicionar referências de vídeo com ou sem seu áudio.

Amostragem#

RandomNoise (#129) inicia o processo, enquanto KSamplerSelect (#123) escolhe a variante do sampler e BasicScheduler (#124) define o cronograma de etapas. BasicGuider (#126) aplica o condicionamento produzido pelo nó MiniMax H3, e SamplerCustomAdvanced (#125) realiza as etapas reais de remoção de ruído para evoluir o latente conjunto de áudio+vídeo. As escolhas aqui principalmente trocam velocidade por fidelidade e aderência à referência; mantenha os padrões para começar, depois experimente uma vez que você tenha uma aparência e som de base.

Decodificação e criação de vídeo#

O latente conjunto do sampler vai para VAEDecode (#122) para quadros e VAEDecodeAudio (#121) para som estéreo. CreateVideo (#130) mistura as imagens e áudio decodificados em um fluxo reproduzível, e SaveVideo (#92) grava o arquivo final em sua pasta de saída. Como o vídeo e o áudio foram gerados juntos, o tempo é consistente sem nenhum alinhamento pós-produção ou TTS externo.

Nós principais no fluxo de trabalho MiniMax H3 Reference to Video ComfyUI#

MiniMaxH3ReferenceToVideo (#136) Este nó compõe referências de texto, visuais e opcionais de áudio no condicionamento Ref2VA do MiniMax H3 e um latente inicial que já “sabe” sobre identidade, estilo, movimento e som. Use tags de referência exatas em seu prompt que correspondam à ordem de conexão e escolha ref_image_size com base em seu objetivo: iterações mais rápidas ao corresponder à resolução de geração, identidade mais forte ao manter tokens de referência maiores. Para tomadas mais longas, favoreça descrições claras de cena e ação para que o modelo possa manter a continuidade.

Resolution Selector (Size) (#115) Controla o aspecto alvo e a contagem de pixels que todo o gráfico honrará. Escolha uma forma que corresponda a como você apresentará o clipe e equilibre o detalhe com a taxa de transferência para que você possa iterar rapidamente. Resoluções mais altas aumentam o VRAM e o tempo, mas preservam melhor os detalhes finos de suas referências.

ComfyMathExpression (#131) Converte uma duração em segundos voltada para o usuário em uma contagem de quadros que o sampler e o decodificador gostam. A expressão limita a um mínimo sensato e ajusta para uma etapa amigável internamente, para que vídeo e áudio fiquem sincronizados. Ajuste apenas a entrada de segundos; o nó lida com a matemática.

KSamplerSelect (#123) e BasicScheduler (#124) Juntos, eles determinam o caminho de remoção de ruído. Comece com o sampler e cronograma fornecidos para aderência robusta à referência; se sua tomada desviar ou parecer pouco detalhada, teste um cronograma alternativo ou uma família de sampler ligeiramente diferente e compare os resultados lado a lado.

Extras opcionais#

  • Mantenha prompts concretos e com referências primeiro: comece com tags como <Picture 1> e <Picture 2>, depois descreva o tipo de tomada, movimento, iluminação e os sons que você espera.
  • Para uma identidade mais forte a partir de imagens, aumente a fidelidade da referência usando o modo de tamanho de referência maior; para desenvolvimento de visual mais rápido, use o modo de tamanho correspondente.
  • Se você não conectar nenhuma referência de áudio, o MiniMax H3 sintetizará áudio estéreo nativo apenas do prompt; descreva ambiente, foley e tom de voz para guiá-lo.
  • Adicione um vídeo de referência curto quando você se importar mais com cadência de movimento ou comportamento de câmera; adicione seu áudio emparelhado quando quiser que esse caráter sonoro seja transportado para a geração.
  • Itere em resolução e duração modestas primeiro, depois aumente uma vez que o tempo, identidade e composição estejam coesos.

Referências#

Agradecimentos#

Este fluxo de trabalho implementa e se baseia nos seguintes trabalhos e recursos. Agradecemos sinceramente ao Comfy-Org pelo modelo de fluxo de trabalho MiniMax H3 R2V ComfyUI e o tutorial MiniMax H3, MiniMax pelo modelo MiniMax H3 e anúncio oficial, e ao Comfy-Org pelos pesos do modelo MiniMax-H3 por suas contribuições e manutenção. Para detalhes autoritativos, consulte a documentação original e repositórios listados abaixo.

Recursos#

Nota: O uso dos modelos, conjuntos de dados e código referenciados está sujeito às respectivas licenças e termos fornecidos por seus autores e mantenedores.

RunComfy
Copyright 2026 RunComfy. Todos os Direitos Reservados.

RunComfy é a principal ComfyUI plataforma, oferecendo ComfyUI online ambiente e serviços, juntamente com fluxos de trabalho do ComfyUI apresentando visuais impressionantes. RunComfy também oferece AI Models, permitindo que artistas utilizem as mais recentes ferramentas de AI para criar arte incrível.