ComfyUI>Fluxos de Trabalho>MiniMax H3 Amostragem Dupla de Alta Qualidade R2V

MiniMax H3 Amostragem Dupla de Alta Qualidade R2V

Workflow Name: RunComfy/MiniMax-H3-Dual
Workflow ID: 0000...1503
Transforme várias imagens de referência em vídeos curtos e cinematográficos. Você mantém personagens e produtos consistentes em todas as cenas. A amostragem dupla equilibra detalhes e movimento suave. O áudio nativo permanece sincronizado. Um turbo LoRA de 4 etapas acelera a geração. O gráfico pronto MiniMax H3 economiza tempo de configuração.

ComfyUI MiniMax H3 High Quality Dual-Sampling workflow Fluxo de Trabalho

MiniMax H3 Dual-Sampling Workflow | Ref2VA + Turbo LoRA
Deseja executar este fluxo de trabalho?
  • Fluxos de trabalho totalmente operacionais
  • Sem nós ou modelos ausentes
  • Nenhuma configuração manual necessária
  • Apresenta visuais impressionantes

ComfyUI MiniMax H3 High Quality Dual-Sampling workflow Exemplos

MiniMax H3 Fluxo de Trabalho de Amostragem Dupla de Alta Qualidade: vídeo de múltiplas referências com áudio nativo sincronizado#

O fluxo de trabalho de Amostragem Dupla de Alta Qualidade MiniMax H3 é um gráfico de referência para vídeo pronto para RunComfy, que transforma múltiplas referências de imagem e pistas opcionais de vídeo ou áudio em clipes cinematográficos curtos com áudio nativo gerado na mesma passagem. Ele equilibra a retenção de identidade, movimento estável e detalhes nítidos combinando um cronograma de amostragem dupla, atenção H3 eficiente em memória, VAEs dedicados para vídeo e áudio, e um caminho turbo de 4 etapas LoRA.

Desenhado para criadores que precisam de continuidade entre produtos ou personagens, este fluxo de trabalho de Amostragem Dupla de Alta Qualidade MiniMax H3 permite que você defina assuntos, cenas e som em um único prompt, e então produz saídas de vídeo H3 polidas sem precisar reconstruir um gráfico. Forneça um conjunto de imagens estáticas, adicione uma referência de estilo de áudio e exporte um MP4 pronto para compartilhar.

Modelos principais no fluxo de trabalho de Amostragem Dupla de Alta Qualidade MiniMax H3 no Comfyui#

  • Modelo de difusão de Referência para Vídeo MiniMax H3 (Ref2VA). Gerador principal que converte referências mais texto em um latente audiovisual, alimentando tanto os quadros quanto o áudio nativo. Veja o pacote de modelos e pesos nos repositórios oficiais: MiniMaxAI/MiniMax-H3 e Comfy-Org/MiniMax-H3.
  • Codificador de texto Qwen3-VL 32B ajustado para MiniMax H3. Interpreta prompts estruturados que descrevem assuntos, cenas e sons, e então condiciona o H3 UNet via embeddings estilo CLIP incluídos no pacote de modelos Comfy-Org: Comfy-Org/MiniMax-H3.
  • VAE de Vídeo MiniMax H3. Comprime e decodifica latentes de vídeo para geração eficiente de quadros de alta qualidade, enviado com o lançamento do Comfy-Org: Comfy-Org/MiniMax-H3.
  • VAE de Áudio MiniMax H3. Codifica e decodifica latentes de áudio nativo para que fala e ambiente sejam produzidos e sincronizados dentro do mesmo pipeline: Comfy-Org/MiniMax-H3.
  • MiniMax H3 Turbo 4-step LoRA. Um caminho de refinamento leve que melhora o detalhe e a estabilidade temporal enquanto mantém a execução rápida. Ele se sobrepõe ao modelo base H3 Ref2VA neste fluxo de trabalho.

Como usar o fluxo de trabalho de Amostragem Dupla de Alta Qualidade MiniMax H3 no Comfyui#

Este gráfico é organizado em grupos claros que transferem o trabalho de referências e prompts, através da amostragem H3, para decodificação e exportação em MP4. A amostragem dupla primeiro estabelece movimento e estrutura, depois refina detalhes e áudio enquanto preserva identidades.

Área de Referência#

Carregue até nove referências estáticas para pessoas, objetos ou ambientes. Estas alimentam o nó de referência para vídeo H3, para que o modelo possa fixar-se em identidade, guarda-roupa e elementos de cena. Você também pode encaminhar um clipe curto como referência visual, se desejar. Use referências que já correspondem à perspectiva ou iluminação desejada para melhor retenção. Se você trouxer um lote ou folha de sprites, GetImageRangeFromBatch (#40) pode extrair os quadros que você deseja usar posteriormente.

Área de Referência de Vídeo#

Se preferir começar de um vídeo de referência, use o carregador de vídeo para puxar quadros e opcionalmente restringir a duração. GetImageRangeFromBatch (#40) seleciona uma faixa contígua para que o fluxo de trabalho permaneça leve. Esses quadros atuam como orientação estrutural ou de movimento para a primeira passagem H3. Você pode misturar vídeo com imagens estáticas; o codificador H3 os funde antes da amostragem.

Área de Referência de Áudio#

Carregue de um a três trechos curtos de áudio para guiar o timbre de voz, cadência ou ambiente. Estes não são copiados literalmente; em vez disso, moldam o latente de áudio para que a fala ou paisagem sonora final siga o mesmo estilo. Para falas, clipes de voz curtos e limpos com mínimo ruído de fundo funcionam melhor. Se você omitir o áudio, o fluxo de trabalho ainda gera um ambiente plausível a partir do prompt.

modelo#

Este grupo conecta o H3 UNet, codificador de texto baseado em Qwen, e ambos os VAEs, e então aplica um patch de atenção eficiente em memória. O Lora Loader Stack (rgthree) (#118) adiciona o turbo 4-step LoRA para que você obtenha maior detalhe sem cronogramas longos. O nó de patch de atenção reduz a pressão de VRAM, o que é útil em resoluções maiores. Juntos, eles preparam a pilha de condicionamento que os amostradores usarão.

Amostragem#

MiniMaxH3ReferenceToVideo (#56) é onde seu prompt, referências e resolução se juntam para produzir condicionamento e um latente audiovisual inicial. O nó lê as seções estruturadas do prompt, como subject_definitions, summary, retention_analysis, detailed_description, overall_soundscape, e non_diegetic_music. Um guia básico e uma escolha de amostrador são definidos aqui para manter a configuração simples, mas ainda permitindo forte controle. Pense nisso como a área de preparação antes dos refinadores de amostragem dupla assumirem.

Sigmas#

Um agendador curto produz o cronograma de sigma, que é então dividido para dirigir a estrutura de amostragem dupla. Um ramo enfatiza a estabilidade e o movimento grosseiro, enquanto o outro enfatiza detalhes de alta frequência e nitidez. Um pequeno interruptor booleano permite que você estenda ou ignore uma região intermediária quando precisar de mais limpeza em tomadas difíceis. Você não precisa ajustar números aqui; basta escolher se deseja ativar o alcance estendido quando rostos ou logotipos precisarem de fidelidade extra.

SamplerCustomAdvanced#

A primeira passagem SamplerCustomAdvanced (#108) ocorre em um intervalo de sigma mais baixo para estabelecer layout, identidades e ritmo de movimento. O latente é então separado em vídeo e áudio, e o latente de vídeo pode ser levemente ampliado no espaço latente para adicionar espaço para detalhes. A segunda passagem SamplerCustomAdvanced (#103) usa um intervalo de sigma mais alto para afiar bordas e texturas enquanto respeita o guia da primeira passagem. Uma passagem companheira SamplerCustomAdvanced (#106) pode denoizar ou preservar seletivamente regiões, e um nó de comutação decide o melhor latente final antes da decodificação. Esta dança de duas passagens é o que dá ao fluxo de trabalho de Amostragem Dupla de Alta Qualidade MiniMax H3 sua mistura confiável de estabilidade e detalhes nítidos.

Nós de Aceleração#

Para GPUs com VRAM mais apertado, UniBlockSwap ajuda trocando temporariamente blocos UNet para a memória do sistema, e VRAMReserver mantém espaço suficiente para decodificação e muxing final. Esses auxiliares de velocidade e memória têm impacto mínimo na qualidade e podem ser ativados quando você vê avisos de falta de memória. Mantenha-os próximos ao caminho UNet conforme conectado no gráfico.

Salvar Vídeo#

O latente final é decodificado pelos VAEs dedicados de vídeo e áudio, então PixaromaSaveMp4 (#115) muxa quadros e áudio em um MP4. Defina sua taxa de quadros alvo aqui e escolha se deseja cortar o vídeo para o comprimento do áudio gerado. O prefixo do nome do arquivo e a subpasta facilitam a organização das tomadas. Quando você executar novamente com uma nova semente ou referências, as saídas serão empilhadas na mesma pasta.

Nós principais no fluxo de trabalho de Amostragem Dupla de Alta Qualidade MiniMax H3 no Comfyui#

MiniMaxH3ReferenceToVideo (#56)#

Funde texto, imagem e referências opcionais de vídeo ou áudio em condicionamento e um latente audiovisual inicial para H3. Ajuste prompt para definir assuntos, continuidade de cena, tempo de tomada e design de som, e defina width, height, e length para o aspecto alvo e duração. Use múltiplas imagens de referência para fixar identidade e guarda-roupa quando a continuidade for importante.

Lora Loader Stack (rgthree) (#118)#

Aplica o MiniMax H3 turbo 4-step LoRA no modelo base para melhorar o detalhe em cronogramas curtos. Ajuste a força do LoRA se as bordas ficarem muito afiadas ou se o estilo do modelo base estiver sendo sobrescrito. Mantenha o empilhamento LoRA mínimo quando as referências já carregam forte textura.

MiniMaxH3MemoryEfficientSageAttentionPatch (#70)#

Permite atenção eficiente em memória para o H3 UNet para que você possa executar resoluções mais altas ou clipes mais longos em GPUs modestas. Ligue-o para placas de 8 a 12 GB ou quando você vir picos de VRAM. Desative apenas se você estiver testando o rendimento bruto em GPUs de alta memória.

SplitSigmas (#99)#

Divide o agendador em bandas de sigma complementares que alimentam as duas passagens do amostrador. Se sua cena estiver estável, mas faltar impacto, desloque mais peso para o ramo de alto sigma. Se o movimento estiver tremido ou as identidades estiverem se deslocando, favoreça o ramo de baixo sigma e mantenha o interruptor intermediário estendido desligado.

SamplerCustomAdvanced (#108)#

Primeira passagem do amostrador que estabelece estrutura, movimento e identidade. Mantenha o guia consistente com seu prompt e referências para que a segunda passagem tenha uma base limpa. Use esta passagem para testar sementes e enquadramento rapidamente antes de se comprometer com o refinamento.

SamplerCustomAdvanced (#103)#

Amostrador de refinamento que usa um intervalo de sigma mais alto para melhorar detalhes e corrigir bordas. Funciona melhor após uma sólida primeira passagem; evite sobrecarregá-lo quando rostos ou logotipos começarem a ficar muito nítidos. Emparelhe-o com ampliação latente apenas quando precisar de espaço extra para textura.

ComfySwitchNode (#107)#

Escolhe entre refinamentos latentes alternativos após a amostragem dupla. Alterne quando estiver comparando resultados do ramo auxiliar de denoising versus o ramo de refinamento direto. Mantenha uma nota de qual caminho mantém a identidade melhor para seu conjunto de assuntos.

PixaromaSaveMp4 (#115)#

Muxa quadros decodificados e áudio para MP4. Defina fps para corresponder à sensação do seu movimento e use trim_to_audio para uma sincronização audiovisual precisa. Atualize o filename_prefix para manter as tomadas organizadas por cena ou assunto.

Extras opcionais#

  • Comece com o modelo oficial H3 R2V para aprender o padrão básico antes de personalizar este gráfico: Comfy-Org workflow template.
  • Use ResolutionSelector (#73) para escolher um aspecto e alvo de megapixels que sua GPU pode lidar, e então aumente gradualmente uma vez que o enquadramento esteja correto.
  • Prompts em seções estruturadas que o modelo entende: subject_definitions, summary, retention_analysis, detailed_description, overall_soundscape, non_diegetic_music. Este estilo dá ao H3 restrições mais claras.
  • Para tomadas críticas de identidade, forneça de 3 a 5 imagens estáticas de alta qualidade do mesmo sujeito em iluminação e ângulo correspondentes. Evite filtros pesados em referências.
  • Forneça um clipe de estilo de voz limpo de 1 a 5 segundos como referência de áudio para timbre consistente entre personagens. Mantenha o ruído e a música baixos.
  • Se você atingir limites de VRAM, ative o patch de atenção e o grupo de Nós de Aceleração. Reduza a resolução primeiro, depois o comprimento.
  • Quando o movimento estiver correto, mas as texturas estiverem suaves, mantenha a primeira passagem como está e aumente a dependência do segundo ramo do amostrador em vez de estender as etapas gerais.
  • Salve versões frequentemente. Pequenas edições de prompt têm grandes efeitos porque o fluxo de trabalho de Amostragem Dupla de Alta Qualidade MiniMax H3 condiciona vídeo e áudio juntos.

Agradecimentos#

Este fluxo de trabalho implementa e se baseia nos seguintes trabalhos e recursos. Agradecemos sinceramente à MiniMaxAI pelo modelo MiniMax-H3, à Comfy-Org/Comfy.org pelos templates, pesos e tutorial do ComfyUI para MiniMax H3, e à RunningHub.ai pela referência de fluxo de trabalho por suas contribuições e manutenção. Para detalhes autoritativos, consulte a documentação original e os repositórios vinculados abaixo.

Recursos#

Nota: O uso dos modelos, conjuntos de dados e código referenciados está sujeito às respectivas licenças e termos fornecidos por seus autores e mantenedores.

RunComfy
Copyright 2026 RunComfy. Todos os Direitos Reservados.

RunComfy é a principal ComfyUI plataforma, oferecendo ComfyUI online ambiente e serviços, juntamente com fluxos de trabalho do ComfyUI apresentando visuais impressionantes. RunComfy também oferece AI Models, permitindo que artistas utilizem as mais recentes ferramentas de AI para criar arte incrível.