MiniMax H3 Substituição de Personagem ComfyUI#
MiniMax H3 Substituição de Personagem ComfyUI é um fluxo de trabalho de edição de vídeo guiado por referências para trocar uma pessoa ou personagem em um clipe de origem enquanto mantém o movimento original, tempo da câmera e layout da cena intactos. Ele combina a detecção e mascaramento de sujeitos SAM3 com MiniMax H3 Ref2VA para que a identidade de substituição permaneça consistente ao longo dos quadros sem repintura manual.
Desenvolvido para criadores que precisam de trocas de personagem confiáveis, substituições de identidade, variações de figurino ou edições guiadas por referência dentro do ComfyUI, este fluxo de trabalho aceita um vídeo de origem, uma ou mais imagens de referência e áudio de referência opcional. O resultado é uma substituição que preserva o movimento e que parece nativa ao vídeo, alimentada pela lógica do MiniMax H3 Substituição de Personagem ComfyUI de ponta a ponta.
Modelos principais no fluxo de trabalho ComfyUI MiniMax H3 Substituição de Personagem ComfyUI#
- Backbone de difusão MiniMax H3 Ref2VA. Fornece geração de referência-para-áudio-vídeo que transfere identidade e aparência enquanto respeita movimento e tempo. Veja o cartão de modelo oficial para capacidades e orientação de prompt aqui e os pesos e VAEs prontos para Comfy aqui.
- MiniMax H3 Video VAE e Audio VAE. Codificam e decodificam latentes de vídeo e áudio para amostragem eficiente e reconstrução fiel. Incluídos no pacote Comfy-Org MiniMax H3 acima.
- Codificador de texto Qwen3-VL 32B. Serve como o codificador de texto multimodal usado por MiniMax H3 para interpretar prompts e referências para transferência coerente de identidade.
- SAM 3.1 Multiplex. Um modelo de segmentação de alta qualidade usado para detectar e mascarar o sujeito na tela para que o fluxo de trabalho possa isolar pistas de movimento e preparar uma referência mais limpa para substituição de personagem. Checkpoint hospedado por Comfy-Org aqui.
Como usar o fluxo de trabalho ComfyUI MiniMax H3 Substituição de Personagem ComfyUI#
O fluxo de trabalho vai do mascaramento e preparação de referência ao condicionamento H3, amostragem e renderização final. Grupos executam em sequência para produzir uma troca que preserva o movimento, substituindo apenas o performer.
Mascaramento#
Este grupo carrega seu clipe de origem, opcionalmente o recorta e prepara máscaras por quadro. LoadVideo (#459) alimenta Video Slice (#483) para que você possa definir o tempo de início e duração. Quadros e áudio são descompactados com GetVideoComponents (#460, #505). SAM3_Detect (#503) usa um texto de categoria curto de CLIPTextEncode (#502), como "person", para encontrar o sujeito e produzir máscaras. A máscara é pré-visualizada via MaskToImage (#491), então ImageCompositeMasked (#454) e ImageScaleToTotalPixels (#456) preparam uma referência de movimento leve que destaca o performer para MiniMax H3.
Modelos#
Este grupo carrega os principais ativos MiniMax H3 usados na inferência. UNETLoader (#463) inicializa os pesos de difusão H3 Ref2VA, CLIPLoader (#465) configura o codificador de texto Qwen3-VL, e VAELoader (#470, #474) traz os VAEs de vídeo e áudio. Juntos, eles definem o contexto do modelo que o sampler usará para transferência de identidade e decodificação.
Condicionamento#
Este grupo transforma suas referências e prompt no condicionamento H3 e um latente inicial. MiniMaxH3ReferenceToVideo (#464) aceita uma imagem de identidade de substituição, a referência de movimento preparada do grupo Mascaramento, e áudio de referência opcional da fonte. Largura e altura vêm de ResolutionSelector (#501); comprimento em quadros é auto-computado por ComfyMathExpression (#481) a partir de uma duração amigável definida com Float (Duration) (#480), ajustando-se a uma contagem de quadros amigável ao modelo. Um prompt estruturado é gerado por DapaoH3VideoPromptNode (#517) e passado por easy showAnything (#515), ou você pode escrever o seu próprio de acordo com o guia oficial de referência-vídeo MiniMax H3 aqui.
Amostragem#
Este grupo realiza a remoção de ruído com seu sampler e cronograma selecionados. RandomNoise (#467) sementeia o processo para reprodutibilidade. BasicScheduler (#473) e KSamplerSelect (#468) definem o cronograma de passos e algoritmo, enquanto BasicGuider (#466) funde o modelo com o condicionamento positivo do nó H3. SamplerCustomAdvanced (#469) executa o refinamento iterativo para produzir os latentes de vídeo finais.
Decodificação e criação de vídeo#
Este grupo transforma latentes em um resultado reproduzível. VAEDecode (#472) reconstrói quadros, que são combinados com o áudio do seu clipe em CreateVideo (#476) para preservar tempo e ambiente. SaveVideo (#482) escreve um arquivo de saída com o formato e codec escolhidos para que seu render MiniMax H3 Substituição de Personagem ComfyUI esteja pronto para revisão ou publicação.
Testado com estas configurações#
Esta área de ajuda contém notas de prompt e metadados de exemplo usados durante a criação. Não é necessário para operação, mas pode inspirar sua própria estrutura de prompt e escolhas de tempo.
Nós principais no fluxo de trabalho ComfyUI MiniMax H3 Substituição de Personagem ComfyUI#
MiniMaxH3ReferenceToVideo (#464)#
Central para transferência de identidade. Aceita uma imagem de substituição, uma referência de vídeo que preserva o movimento, e áudio de referência opcional, então emite tanto o condicionamento positivo quanto um latente inicial. Parâmetros úteis a considerar são prompt, width, height, e length. Se você fornecer várias referências, mantenha-as visualmente consistentes para evitar desvio de identidade.
SAM3_Detect (#503)#
Encontra e segmenta o sujeito na tela que será substituído. Um prompt de categoria curto via CLIPTextEncode (#502) guia a detecção. Ajuste as opções de qualidade da máscara apenas quando a seleção padrão não encontrar o sujeito ou incluir o fundo; máscaras mais limpas geralmente produzem trocas mais estáveis.
ImageCompositeMasked (#454)#
Constrói uma referência focada no performer a partir dos quadros cortados e máscara SAM3. Use x, y, e resize_source apenas se você precisar alinhar sobreposições ou adaptar a escala do quadro antes de enviar imagens para a entrada de referência H3. O objetivo é uma pista de movimento que isola o ator enquanto deixa a geometria da cena intocada.
ResolutionSelector (#501)#
Controla o tamanho de renderização alvo em alguns cliques. Escolha um aspecto e orçamento de megapixels que se encaixem no seu hardware ou necessidades de entrega. Comece modesto, confirme a estabilidade da identidade, então aumente a resolução para sua passada final.
SamplerCustomAdvanced (#469)#
Executa a remoção de ruído usando o cronograma, sampler, guia, ruído, e latente inicial. Para desenvolvimento de visualização mais rápido, experimente um cronograma mais leve ou um sampler ajustado para velocidade, então mude para suas configurações de qualidade preferidas uma vez que identidade e tempo pareçam corretos.
Extras opcionais#
- Seleção de referência
- Use 1 a 3 imagens nítidas e bem iluminadas que mostrem claramente o rosto e figurino alvo. Evite identidades mistas ou poses extremas.
- Mantenha a idade, penteado e vestuário do sujeito de referência consistentes para minimizar desvio durante movimentos longos.
- Dicas de mascaramento
- Se SAM3 incluir o fundo, refine seu texto de categoria ou execute novamente com um limite diferente. Máscaras limpas reduzem halos e mantêm a iluminação da cena estável.
- Prompting
- Descreva apenas identidade e figurino na substituição enquanto diz ao H3 para preservar o movimento e cena originais. O guia oficial tem exemplos concisos aqui.
- Templates
- Se você quiser um ponto de partida mínimo, compare seu gráfico com o template oficial ComfyUI MiniMax H3 R2V aqui.
- Direitos e segurança
- Use apenas semelhanças, performances e áudio que você tenha o direito de transformar. MiniMax H3 Substituição de Personagem ComfyUI é poderoso, então aplique-o com responsabilidade.
Agradecimentos#
Este fluxo de trabalho implementa e se baseia nos seguintes trabalhos e recursos. Agradecemos imensamente ao MiniMaxAI pelo modelo MiniMax-H3 e o guia de prompts de referência-vídeo, à Comfy-Org pelo template oficial ComfyUI MiniMax H3 R2V, e à RunningHub.ai pela fonte do fluxo de trabalho e referência por suas contribuições e manutenção. Para detalhes autoritativos, consulte a documentação original e repositórios linkados abaixo.
Recursos#
- RunningHub.ai/Fonte e referência do fluxo de trabalho
- Docs / Notas de Lançamento: Fonte e referência do fluxo de trabalho
- MiniMaxAI/MiniMax H3 modelo oficial
- GitHub: MiniMax-AI/MiniMax-H3
- Hugging Face: MiniMaxAI/MiniMax-H3
- MiniMaxAI/MiniMax H3 guia de prompts de referência-vídeo
- GitHub: MiniMax-AI/MiniMax-H3
- Hugging Face: MiniMaxAI/MiniMax-H3
- Docs / Notas de Lançamento: MiniMax H3 guia de prompts de referência-vídeo
- Comfy-Org/Template oficial ComfyUI MiniMax H3 R2V
- GitHub: Comfy-Org/workflow_templates (video_minimax_h3_r2v.json)
- Hugging Face: Comfy-Org/MiniMax-H3
Nota: O uso dos modelos, conjuntos de dados e código referenciados está sujeito às respectivas licenças e termos fornecidos por seus autores e mantenedores.

