ComfyUI>Fluxos de Trabalho>MiniMax H3 Conversa & Canto Duplo de Personagens | Aceleração em 4 Passos

MiniMax H3 Conversa & Canto Duplo de Personagens | Aceleração em 4 Passos

Workflow Name: RunComfy/MiniMax-H3-Talking-Singing-Dual-Character-4-step-Acceleration
Workflow ID: 0000...1486
Transforme duas imagens paradas em uma performance de conversa e canto frente a frente. Você conduz o diálogo ou vocais com um clipe de áudio. O Hailuo H3 mantém ambas as identidades estáveis. O bloqueio de áudio proporciona sincronização labial precisa. Turbo LoRA opera em quatro passos. Você obtém duetos rápidos sem uma pilha de sincronização labial separada.
Avoid using 2X Large or 2XL Plus for this workflow. These machine types may cause the generated video to contain only noise. Use Medium, Large, or X Large instead.

MiniMax H3 ComfyUI Talking and Singing Dual Character 4-step Acceleration Workflow

MiniMax H3 Talking & Singing Dual Character | 4-step Acceleration
Deseja executar este fluxo de trabalho?
  • Fluxos de trabalho totalmente operacionais
  • Sem nós ou modelos ausentes
  • Nenhuma configuração manual necessária
  • Apresenta visuais impressionantes

MiniMax H3 ComfyUI Talking and Singing Dual Character 4-step Acceleration Examples

MiniMax H3 ComfyUI Conversa e Canto Duplo de Personagens em Aceleração de 4 Passos#

Este fluxo de trabalho pronto para RunComfy transforma duas imagens de retrato e uma faixa curta de discurso ou canto em um único vídeo sincronizado com os lábios onde ambos os personagens compartilham a cena. Baseado no MiniMax H3 referência-para-vídeo com o Turbo LoRA oficial, ele oferece geração em poucos passos enquanto mantém ambas as identidades estáveis e o movimento da boca sincronizado com seu áudio de origem.

MiniMax H3 ComfyUI Conversa e Canto Duplo de Personagens com Aceleração em 4 Passos é ideal para duetos, diálogos de duas pessoas, trailers ou pré-visualizações rápidas de performances. Você traz duas imagens e um arquivo de áudio, adiciona um prompt curto, escolhe um tamanho, e o gráfico renderiza um mp4 com a trilha sonora original intacta.

Modelos principais no fluxo de trabalho Comfyui MiniMax H3 ComfyUI Conversa e Canto Duplo de Personagens com Aceleração em 4 Passos#

  • MiniMax-H3 referência-para-vídeo backbone do Comfy-Org — o modelo generativo que mapeia suas referências e texto em um latente áudio-visual para síntese de vídeo. Hugging Face: Comfy-Org/MiniMax-H3
  • MiniMax-H3 Video VAE FP16 — codifica e decodifica latentes de vídeo para que os quadros possam ser dessaturados eficientemente e reconstruídos com fidelidade. Incluído no pacote de modelos. Hugging Face: Comfy-Org/MiniMax-H3
  • MiniMax-H3 Audio VAE FP32 — representa o áudio de condução no espaço latente para que o movimento e o tempo labial sejam aprendidos com sua faixa. Incluído no pacote de modelos. Hugging Face: Comfy-Org/MiniMax-H3
  • Qwen3-VL 32B text encoder (variantes AWQ/NVFP embaladas para H3) — interpreta seu prompt para definir cena, estilo e intenção de filmagem para composição de personagens duplos. Incluído no pacote de modelos. Hugging Face: Comfy-Org/MiniMax-H3
  • MiniMax-H3 Turbo 4-step LoRA — acelera a amostragem para que você possa renderizar com apenas quatro passos de dessaturação enquanto preserva identidade e sincronização labial. Hugging Face: larryvrh/MiniMax-H3-Turbo-Lora

Como usar Comfyui MiniMax H3 ComfyUI Conversa e Canto Duplo de Personagens com Aceleração em 4 Passos#

Este gráfico flui da esquerda para a direita: você carrega duas imagens de personagens e um clipe de áudio, define o prompt e o tamanho, então o caminho central H3 funde referências e áudio em um latente AV. Uma breve etapa de bloqueio de áudio preserva sua trilha sonora original enquanto impulsiona o movimento labial, e o amostrador com Turbo LoRA realiza a dessaturação de poucos passos antes da montagem final do vídeo.

  • Carregar Imagem (Personagem A)
    • Solte uma imagem clara e de frente para o personagem A em LoadImage (#227). Prefira tamanho de cabeça e iluminação semelhantes ao personagem B para co-presença estável. O fundo pode ser simples; identidade e pose são a prioridade. O nó alimenta a pilha de referência H3 para que o modelo aprenda quem é o primeiro falante na cena compartilhada.
  • Carregar Imagem (Personagem B)
    • Forneça o personagem B em LoadImage (#137). Mantenha enquadramento, orientação e expressão aproximadamente comparáveis ao personagem A para reduzir desvio entre os disparos. Esta segunda referência permite que o H3 sintetize uma cena de dois disparos onde ambos os indivíduos permanecem consistentes enquanto conversam ou cantam um para o outro.
  • Carregar Áudio
    • Adicione seu diálogo ou vocais em LoadAudio (#171). Use AudioCrop (#177) para definir os tempos de início e fim para que o comprimento do clipe corresponda ao segmento desejado. Áudio limpo e centralizado melhora a articulação da boca e reduz oscilação de tempo.
  • Prompt
    • Descreva a cena em Input Text (Prompt) (#138). Frases curtas e cinematográficas funcionam bem, por exemplo, descrevendo distância da câmera, fundo e humor para os dois personagens. O prompt guia o layout e o estilo sem substituir a orientação de identidade das imagens e o tempo da sua faixa.
  • Seletor de Resolução (Tamanho)
    • Escolha aspecto e tamanho alvo em Resolution Selector (Size) (#115). O seletor fornece largura e altura já alinhadas a múltiplos amigáveis ao modelo para equilibrar detalhe e velocidade. Uma nota de tamanho embutida oferece predefinições 16:9 prontas para uso, para que você possa escolher um nível de megapixel que se encaixa no seu orçamento de GPU.
  • Resultado
    • Os quadros são decodificados e mixados com o áudio original em VHS_VideoCombine (#142) para produzir um mp4. Se sua renderização ficar um pouco longa ou curta, use o toggle fornecido nesta etapa para ajustar ao comprimento do áudio. Nomes de arquivo e formato são pré-configurados para iteração rápida.
  • Núcleo (Não Modificar)
    • Dentro desta área protegida, MiniMaxH3ReferenceToVideo (#136) funde ambas as imagens de referência, o prompt e o áudio cortado em um latente AV conjunto e condicionamento positivo. VRGDG_MiniMaxH3AudioDrive (#172) bloqueia o áudio de origem para que a sincronização labial siga sua faixa enquanto a trilha sonora é passada sem alterações. A UNet é adaptada para eficiência de memória, e LoraLoaderModelOnly (#234) aplica o Turbo 4-step LoRA antes que o amostrador dessature e VAEDecode reconstrua os quadros. Esses internos são ajustados para estabilidade e velocidade, então geralmente você não precisa ajustá-los.

Nós principais no fluxo de trabalho Comfyui MiniMax H3 ComfyUI Conversa e Canto Duplo de Personagens com Aceleração em 4 Passos#

  • MiniMaxH3ReferenceToVideo (#136)
    • O coração do gráfico que ingere ambas as imagens de personagens, seu prompt, largura, altura e um comprimento de clipe auto-computado. Ele também aceita o áudio cortado como referência para que o tempo dos fonemas e as formas dos visemas se alinhem à trilha sonora. Se você precisar de controle mais rígido, pode ajustar diretamente prompt, width, height, ou substituir length para tempos especiais.
  • VRGDG_MiniMaxH3AudioDrive (#172)
    • Bloqueia o movimento labial ao áudio de origem fornecido enquanto garante que o vídeo final use essa mesma trilha de áudio. Use isso quando quiser tempo exato de letras ou diálogos sem quaisquer mudanças de áudio generativas. Alimente-o com vocais ou diálogos limpos para melhores resultados.
  • LoraLoaderModelOnly (#234)
    • Carrega o MiniMax-H3 Turbo 4-step LoRA para que o amostrador possa convergir em muito poucos passos. Se preferir uma dessaturação mais lenta mas potencialmente mais conservadora, você pode reduzir a influência do LoRA; para máxima velocidade, mantenha a força padrão. Referência do modelo: MiniMax-H3 Turbo LoRA.
  • SamplerCustomAdvanced (#125)
    • Realiza a dessaturação real usando o agendador e amostrador selecionados a montante. Com o Turbo LoRA ativo, você pode renderizar rapidamente com passos mínimos; aumente os passos apenas se você vir instabilidade de movimento. O controle de semente vem de RandomNoise (#129) para tomadas reprodutíveis.
  • Resolution Selector (Size) (#115)
    • Fornece largura e altura alinhadas ao modelo para que você não precise lidar com múltiplos ou matemática de aspecto. Use para alternar entre pré-visualização, médio e tamanhos finais enquanto mantém a composição consistente. Tamanhos maiores aumentam o detalhe de identidade mas requerem mais VRAM e tempo.
  • AudioCrop (#177)
    • Corta o áudio de entrada para o segmento exato que você deseja animar. Use isso para cortar silêncio ou isolar um verso ou batida de diálogo. Pontos de entrada e saída limpos ajudam com o tempo de abertura/fechamento da boca.
  • VHS_VideoCombine (#142)
    • Monta quadros decodificados e o áudio de passagem em um mp4 compartilhável. Use as opções embutidas para alinhar a duração à trilha sonora e definir convenções de nome de arquivo. Esta é sua etapa final de entrega para saídas MiniMax H3 ComfyUI Conversa e Canto Duplo de Personagens com Aceleração em 4 Passos.

Extras opcionais#

  • Combine a escala do sujeito e o ângulo do rosto entre ambas as imagens para minimizar o desvio de identidade.
  • Mantenha os prompts concisos e visuais: distância da câmera, configuração, humor e dicas de iluminação.
  • Use sementes de ruído ao iterar para que você possa fazer mudanças A/B de forma confiável entre tomadas.
  • Se o clipe ultrapassar um pouco, ative o corte na etapa de combinação para sincronização precisa de quadros.
  • Comece com uma resolução de nível médio, depois aumente quando o bloqueio e o tempo parecerem certos.

Agradecimentos#

Este fluxo de trabalho implementa e se baseia nos seguintes trabalhos e recursos. Agradecemos MiniMax Research por MiniMax H3, Comfy.org pelo tutorial ComfyUI MiniMax H3, e Comfy-Org e larryvrh pelos pesos do modelo MiniMax-H3 e MiniMax-H3 Turbo LoRA por suas contribuições e manutenção. Para detalhes autoritativos, consulte a documentação original e os repositórios vinculados abaixo.

Recursos#

Nota: O uso dos modelos, conjuntos de dados e código referenciados está sujeito às respectivas licenças e termos fornecidos por seus autores e mantenedores.

RunComfy
Copyright 2026 RunComfy. Todos os Direitos Reservados.

RunComfy é a principal ComfyUI plataforma, oferecendo ComfyUI online ambiente e serviços, juntamente com fluxos de trabalho do ComfyUI apresentando visuais impressionantes. RunComfy também oferece AI Models, permitindo que artistas utilizem as mais recentes ferramentas de AI para criar arte incrível.