ComfyUI>Fluxos de Trabalho>ComfyUI MiniMax H3 | Avatares Falantes Realistas

ComfyUI MiniMax H3 | Avatares Falantes Realistas

Workflow Name: RunComfy/ComfyUI-MiniMax-H3
Workflow ID: 0000...1481
Transforme um retrato frontal em um avatar falante. Adicione uma amostra de voz curta para clonar sua fala. Você obterá lábios sincronizados e áudio gerado conjuntamente. A identidade e os fundos permanecem estáveis. QwenVL ancora a imagem para controle. Crie demos, apresentadores e porta-vozes digitais mais rapidamente.

ComfyUI MiniMax H3 Talking Digital Human Workflow

ComfyUI MiniMax H3 | Voice-Cloned Talking Avatars
Deseja executar este fluxo de trabalho?
  • Fluxos de trabalho totalmente operacionais
  • Sem nós ou modelos ausentes
  • Nenhuma configuração manual necessária
  • Apresenta visuais impressionantes

ComfyUI MiniMax H3 Talking Digital Human Examples

ComfyUI MiniMax H3 Talking Digital Human: retrato e voz para um vídeo de avatar com sincronização labial#

Este fluxo de trabalho transforma um único retrato frontal e uma referência de voz curta em um clipe de cabeça falante de alta qualidade com fala sincronizada no RunComfy. Construído em torno do MiniMax H3 referência para vídeo e áudio com ancoragem de imagem QwenVL, ele preserva a identidade e o fundo enquanto gera a voz falante a partir de sua amostra. ComfyUI MiniMax H3 Talking Digital Human é ideal para explicações de produtos, avatares apresentadores, postagens sociais e vídeos curtos de porta-vozes sem uma pilha separada de TTS ou sincronização labial.

Você fornece uma imagem e um clipe de voz. O fluxo de trabalho infere uma descrição compacta do rosto e da cena, condiciona o MiniMax H3 com essa orientação e co-genera quadros de vídeo e o áudio correspondente em um latente unificado para que lábios e voz permaneçam alinhados. O resultado é renderizado em um único arquivo de vídeo que você pode baixar e compartilhar.

Modelos principais no fluxo de trabalho Comfyui ComfyUI MiniMax H3 Talking Digital Human#

  • MiniMax H3 Reference-to-Video-and-Audio diffusion model. Gerador principal que usa um retrato e áudio opcional como referências para produzir uma cabeça falante sincronizada. Hospedado pela Comfy-Org para fácil uso no ComfyUI. Hugging Face: Comfy-Org/MiniMax-H3
  • MiniMax H3 Video VAE. Codifica e decodifica a parte de vídeo do espaço latente compartilhado usado pelo MiniMax H3, ajudando a manter a identidade e o fundo estáveis. Distribuído com o mesmo pacote de modelo. Hugging Face: Comfy-Org/MiniMax-H3
  • MiniMax H3 Audio VAE. Codifica e decodifica a parte de áudio do latente compartilhado para que a fala seja gerada em sincronia com o movimento da boca. Também disponível no pacote de modelo. Hugging Face: Comfy-Org/MiniMax-H3
  • Qwen3-VL 4B Instruct. Um modelo de visão-linguagem usado para ancorar prompts em detalhes visuais do retrato carregado, o que melhora a retenção de identidade e a consistência da cena. Hugging Face: Qwen/Qwen3-VL-4B-Instruct

Como usar o fluxo de trabalho Comfyui ComfyUI MiniMax H3 Talking Digital Human#

Este fluxo de trabalho é organizado em quatro áreas: uma seção de upload e edição, um assistente de duração, o núcleo de geração MiniMax H3 e a etapa de saída. Trabalhe da esquerda para a direita, começando com entradas de mídia, depois orientação de prompts, depois execute a geração e salve o vídeo.

Área de Upload / Edição: geralmente altere apenas aqui; deixe o resto padrão#

Use LoadImage (#137) para carregar um retrato de personagem frontal único. Enquadramento frontal ou quase frontal com olhos e boca visíveis funciona melhor para movimento labial natural. Use LoadAudio (#141) para carregar uma amostra de fala limpa cujo timbre você deseja imitar; pode ser alguns segundos de fala com ruído de fundo mínimo. Se necessário, corte a amostra de voz com AudioCrop (#142) definindo início e fim para o segmento falado que você deseja que o avatar corresponda. Adicione qualquer orientação de estilo ou conteúdo em Prompt (#138); o fluxo de trabalho irá anexar detalhes automáticos ancorados na imagem para melhor consistência.

Duração do Vídeo (segundos):#

Defina uma duração alvo usando o controle numérico no topo do grupo de duração. Um assistente ComfyMathExpression (#131) converte segundos em uma contagem de quadros válida para o modelo e alinha-a aos requisitos do sampler. Isso mantém o tempo estável e evita cortes no meio do fonema. Se você mudar a duração mais tarde, atualize o corte de áudio para que a fala final e o movimento labial se alinhem.

MiniMax-H3 Open Source - Imagem Falante Digital Human#

Este é o caminho de geração principal construído em torno de MiniMaxH3ReferenceToVideo (#136). O nó recebe seu retrato como imagem de referência e seu clipe de voz cortado como áudio de referência, além de largura, altura e comprimento dos seletores. Uma descrição baseada em QwenVL do retrato é unida ao seu prompt escrito para que o modelo receba tanto ancoragem visual quanto suas instruções. O modelo emite um único latente que contém tanto vídeo quanto áudio, assim como condicionamento usado pela pilha de samplers, razão pela qual a sincronização labial é robusta sem uma etapa separada de sincronização labial.

Ancoragem de Prompt com QwenVL#

AILab_QwenVL (#152) analisa o retrato carregado e retorna uma descrição concisa e factual. O fluxo de trabalho concatena essa descrição com seu texto diretivo via JoinStrings (#150, #148, #144), produzindo um prompt final que instrui o modelo a manter o fundo inalterado e a usar seu áudio para a voz falante. Esta ancoragem automática fortalece notavelmente a estabilidade de identidade e fundo. Você pode manter seu prompt escrito curto e deixar a ancoragem preencher detalhes faciais e de cena precisos.

Resolução / Proporção de Vídeo#

Escolha o aspecto e a resolução alvo com ResolutionSelector (#115). Ele emite largura e altura que são compatíveis com o modelo e sua GPU, que o nó principal usa diretamente. Para avatares de retrato, aspectos altos mantêm mais do sujeito enquanto deixam espaço para movimento natural da cabeça. Se você ajustar a proporção após o teste, mantenha o mesmo enquadramento em seu retrato de entrada para resultados consistentes.

Saída do Vídeo Gerado#

O caminho do sampler remove o ruído do latente conjunto, então VAEDecode (#122) o transforma em quadros enquanto VAEDecodeAudio (#121) o transforma em uma forma de onda. CreateVideo (#130) mescla quadros e áudio em um único clipe na taxa de quadros escolhida, e SaveVideo (#92) escreve o arquivo. O resultado salvo contém tanto a imagem quanto a voz sincronizada da mesma execução de geração. Baixe e revise; se o tempo parecer errado, ajuste o corte de áudio ou duração e execute novamente.

Nós principais no fluxo de trabalho Comfyui ComfyUI MiniMax H3 Talking Digital Human#

MiniMaxH3ReferenceToVideo (#136)#

O coração do pipeline que aceita um retrato de referência e uma amostra de voz para co-gerar vídeo e áudio. Os controles principais são prompt para conteúdo e estilo, width e height para enquadramento, e length para duração em quadros. Use um único retrato nítido como a primeira imagem de referência e mantenha ref_image_size compatível para que as proporções faciais sejam transferidas corretamente. Se você notar deriva ou mudanças de fundo, fortaleça seu texto diretivo para manter explicitamente o fundo inalterado.

ResolutionSelector (#115)#

Define a proporção e a contagem total de pixels, depois emite largura e altura alinhadas a múltiplos compatíveis com o modelo. Escolha um aspecto que corresponda à sua recorte de retrato para reduzir artefatos de reamostragem. Aumentar a resolução total pode melhorar o detalhe, mas também aumenta o VRAM e o tempo; teste em configurações menores antes de aumentar. Mantenha o enquadramento consistente em execuções para identidade reprodutível.

AudioCrop (#142)#

Corta a voz de referência carregada para o segmento que você deseja que o avatar fale. Defina início e fim para a porção falada, deixando uma pequena margem de silêncio nas extremidades para inícios e finais naturais. Fazer a duração do áudio cortado corresponder à duração do vídeo alvo ajuda o gerador a alinhar fonemas às formas da boca. Se plosivas ou sibilantes parecerem erradas, tente uma gravação mais limpa ou encurte o intervalo cortado.

AILab_QwenVL (#152)#

Gera uma descrição ancorada na imagem que é automaticamente anexada ao seu prompt. Isso adiciona detalhes concretos sobre rosto, cabelo, roupa e fundo, o que ajuda o modelo a preservar identidade e cena. Se a descrição ancorada restringir demais o estilo, mantenha seu prompt escrito mínimo e neutro para que a ancoragem possa fazer seu trabalho. Para imagens de múltiplos personagens, faça um recorte mais apertado para que a descrição se concentre em um único sujeito.

CreateVideo (#130)#

Combina quadros decodificados e áudio em um único arquivo reproduzível. Você pode alterar fps se precisar corresponder a uma linha do tempo a jusante, mas mantenha-o consistente com a conversão de duração para quadros anterior. Se você observar travamento em certas plataformas, reexporte em uma taxa de quadros comum para essa plataforma. O controle bit_depth pode ser deixado no padrão para entrega na web.

ComfyMathExpression (#131)#

Converte sua duração em segundos em uma contagem de quadros válida para o gerador e alinha-a ao passo do sampler. Isso evita etapas parciais que podem causar desvio de tempo. Se você mudar a taxa de quadros a jusante, reveja a duração para manter o movimento dos lábios alinhado aos sílabas. Considere este nó como a fonte de verdade do tempo para toda a execução.

Extras opcionais#

  • Use um retrato limpo e bem iluminado com olhos e boca desobstruídos para a articulação mais natural.
  • Grave de 5 a 10 segundos de fala clara em uma sala silenciosa; evite música ou compressão pesada no clipe de referência.
  • Para resultados reprodutíveis, fixe a semente RandomNoise em RandomNoise (#129) em vez de randomizar entre execuções.
  • Se você precisar de legendas, adicione-as na pós-produção em vez de incorporá-las no prompt, para que o modelo foque no rosto e na voz.
  • Respeite os direitos de semelhança e voz ao criar um ComfyUI MiniMax H3 Talking Digital Human para pessoas reais.

Agradecimentos#

Este fluxo de trabalho implementa e constrói sobre os seguintes trabalhos e recursos. Agradecemos ao MiniMax pelo modelo MiniMax H3, à Comfy-Org pelos pesos do modelo MiniMax-H3 e à Comfy.org pelo tutorial MiniMax H3 por suas contribuições e manutenção. Para detalhes autoritativos, consulte a documentação original e os repositórios vinculados abaixo.

Recursos#

Nota: O uso dos modelos, conjuntos de dados e código referenciados está sujeito às respectivas licenças e termos fornecidos por seus autores e mantenedores.

RunComfy
Copyright 2026 RunComfy. Todos os Direitos Reservados.

RunComfy é a principal ComfyUI plataforma, oferecendo ComfyUI online ambiente e serviços, juntamente com fluxos de trabalho do ComfyUI apresentando visuais impressionantes. RunComfy também oferece AI Models, permitindo que artistas utilizem as mais recentes ferramentas de AI para criar arte incrível.