MiniMax H3 ComfyUI Conversa e Canto Duplo de Personagens em Aceleração de 4 Passos#
Este fluxo de trabalho pronto para RunComfy transforma duas imagens de retrato e uma faixa curta de discurso ou canto em um único vídeo sincronizado com os lábios onde ambos os personagens compartilham a cena. Baseado no MiniMax H3 referência-para-vídeo com o Turbo LoRA oficial, ele oferece geração em poucos passos enquanto mantém ambas as identidades estáveis e o movimento da boca sincronizado com seu áudio de origem.
MiniMax H3 ComfyUI Conversa e Canto Duplo de Personagens com Aceleração em 4 Passos é ideal para duetos, diálogos de duas pessoas, trailers ou pré-visualizações rápidas de performances. Você traz duas imagens e um arquivo de áudio, adiciona um prompt curto, escolhe um tamanho, e o gráfico renderiza um mp4 com a trilha sonora original intacta.
Modelos principais no fluxo de trabalho Comfyui MiniMax H3 ComfyUI Conversa e Canto Duplo de Personagens com Aceleração em 4 Passos#
- MiniMax-H3 referência-para-vídeo backbone do Comfy-Org — o modelo generativo que mapeia suas referências e texto em um latente áudio-visual para síntese de vídeo. Hugging Face: Comfy-Org/MiniMax-H3
- MiniMax-H3 Video VAE FP16 — codifica e decodifica latentes de vídeo para que os quadros possam ser dessaturados eficientemente e reconstruídos com fidelidade. Incluído no pacote de modelos. Hugging Face: Comfy-Org/MiniMax-H3
- MiniMax-H3 Audio VAE FP32 — representa o áudio de condução no espaço latente para que o movimento e o tempo labial sejam aprendidos com sua faixa. Incluído no pacote de modelos. Hugging Face: Comfy-Org/MiniMax-H3
- Qwen3-VL 32B text encoder (variantes AWQ/NVFP embaladas para H3) — interpreta seu prompt para definir cena, estilo e intenção de filmagem para composição de personagens duplos. Incluído no pacote de modelos. Hugging Face: Comfy-Org/MiniMax-H3
- MiniMax-H3 Turbo 4-step LoRA — acelera a amostragem para que você possa renderizar com apenas quatro passos de dessaturação enquanto preserva identidade e sincronização labial. Hugging Face: larryvrh/MiniMax-H3-Turbo-Lora
Como usar Comfyui MiniMax H3 ComfyUI Conversa e Canto Duplo de Personagens com Aceleração em 4 Passos#
Este gráfico flui da esquerda para a direita: você carrega duas imagens de personagens e um clipe de áudio, define o prompt e o tamanho, então o caminho central H3 funde referências e áudio em um latente AV. Uma breve etapa de bloqueio de áudio preserva sua trilha sonora original enquanto impulsiona o movimento labial, e o amostrador com Turbo LoRA realiza a dessaturação de poucos passos antes da montagem final do vídeo.
- Carregar Imagem (Personagem A)
- Solte uma imagem clara e de frente para o personagem A em
LoadImage(#227). Prefira tamanho de cabeça e iluminação semelhantes ao personagem B para co-presença estável. O fundo pode ser simples; identidade e pose são a prioridade. O nó alimenta a pilha de referência H3 para que o modelo aprenda quem é o primeiro falante na cena compartilhada.
- Solte uma imagem clara e de frente para o personagem A em
- Carregar Imagem (Personagem B)
- Forneça o personagem B em
LoadImage(#137). Mantenha enquadramento, orientação e expressão aproximadamente comparáveis ao personagem A para reduzir desvio entre os disparos. Esta segunda referência permite que o H3 sintetize uma cena de dois disparos onde ambos os indivíduos permanecem consistentes enquanto conversam ou cantam um para o outro.
- Forneça o personagem B em
- Carregar Áudio
- Adicione seu diálogo ou vocais em
LoadAudio(#171). UseAudioCrop(#177) para definir os tempos de início e fim para que o comprimento do clipe corresponda ao segmento desejado. Áudio limpo e centralizado melhora a articulação da boca e reduz oscilação de tempo.
- Adicione seu diálogo ou vocais em
- Prompt
- Descreva a cena em
Input Text (Prompt)(#138). Frases curtas e cinematográficas funcionam bem, por exemplo, descrevendo distância da câmera, fundo e humor para os dois personagens. O prompt guia o layout e o estilo sem substituir a orientação de identidade das imagens e o tempo da sua faixa.
- Descreva a cena em
- Seletor de Resolução (Tamanho)
- Escolha aspecto e tamanho alvo em
Resolution Selector (Size)(#115). O seletor fornece largura e altura já alinhadas a múltiplos amigáveis ao modelo para equilibrar detalhe e velocidade. Uma nota de tamanho embutida oferece predefinições 16:9 prontas para uso, para que você possa escolher um nível de megapixel que se encaixa no seu orçamento de GPU.
- Escolha aspecto e tamanho alvo em
- Resultado
- Os quadros são decodificados e mixados com o áudio original em
VHS_VideoCombine(#142) para produzir um mp4. Se sua renderização ficar um pouco longa ou curta, use o toggle fornecido nesta etapa para ajustar ao comprimento do áudio. Nomes de arquivo e formato são pré-configurados para iteração rápida.
- Os quadros são decodificados e mixados com o áudio original em
- Núcleo (Não Modificar)
- Dentro desta área protegida,
MiniMaxH3ReferenceToVideo(#136) funde ambas as imagens de referência, o prompt e o áudio cortado em um latente AV conjunto e condicionamento positivo.VRGDG_MiniMaxH3AudioDrive(#172) bloqueia o áudio de origem para que a sincronização labial siga sua faixa enquanto a trilha sonora é passada sem alterações. A UNet é adaptada para eficiência de memória, eLoraLoaderModelOnly(#234) aplica o Turbo 4-step LoRA antes que o amostrador dessature eVAEDecodereconstrua os quadros. Esses internos são ajustados para estabilidade e velocidade, então geralmente você não precisa ajustá-los.
- Dentro desta área protegida,
Nós principais no fluxo de trabalho Comfyui MiniMax H3 ComfyUI Conversa e Canto Duplo de Personagens com Aceleração em 4 Passos#
MiniMaxH3ReferenceToVideo(#136)- O coração do gráfico que ingere ambas as imagens de personagens, seu prompt, largura, altura e um comprimento de clipe auto-computado. Ele também aceita o áudio cortado como referência para que o tempo dos fonemas e as formas dos visemas se alinhem à trilha sonora. Se você precisar de controle mais rígido, pode ajustar diretamente
prompt,width,height, ou substituirlengthpara tempos especiais.
- O coração do gráfico que ingere ambas as imagens de personagens, seu prompt, largura, altura e um comprimento de clipe auto-computado. Ele também aceita o áudio cortado como referência para que o tempo dos fonemas e as formas dos visemas se alinhem à trilha sonora. Se você precisar de controle mais rígido, pode ajustar diretamente
VRGDG_MiniMaxH3AudioDrive(#172)- Bloqueia o movimento labial ao áudio de origem fornecido enquanto garante que o vídeo final use essa mesma trilha de áudio. Use isso quando quiser tempo exato de letras ou diálogos sem quaisquer mudanças de áudio generativas. Alimente-o com vocais ou diálogos limpos para melhores resultados.
LoraLoaderModelOnly(#234)- Carrega o MiniMax-H3 Turbo 4-step LoRA para que o amostrador possa convergir em muito poucos passos. Se preferir uma dessaturação mais lenta mas potencialmente mais conservadora, você pode reduzir a influência do LoRA; para máxima velocidade, mantenha a força padrão. Referência do modelo: MiniMax-H3 Turbo LoRA.
SamplerCustomAdvanced(#125)- Realiza a dessaturação real usando o agendador e amostrador selecionados a montante. Com o Turbo LoRA ativo, você pode renderizar rapidamente com passos mínimos; aumente os passos apenas se você vir instabilidade de movimento. O controle de semente vem de
RandomNoise(#129) para tomadas reprodutíveis.
- Realiza a dessaturação real usando o agendador e amostrador selecionados a montante. Com o Turbo LoRA ativo, você pode renderizar rapidamente com passos mínimos; aumente os passos apenas se você vir instabilidade de movimento. O controle de semente vem de
Resolution Selector (Size)(#115)- Fornece largura e altura alinhadas ao modelo para que você não precise lidar com múltiplos ou matemática de aspecto. Use para alternar entre pré-visualização, médio e tamanhos finais enquanto mantém a composição consistente. Tamanhos maiores aumentam o detalhe de identidade mas requerem mais VRAM e tempo.
AudioCrop(#177)- Corta o áudio de entrada para o segmento exato que você deseja animar. Use isso para cortar silêncio ou isolar um verso ou batida de diálogo. Pontos de entrada e saída limpos ajudam com o tempo de abertura/fechamento da boca.
VHS_VideoCombine(#142)- Monta quadros decodificados e o áudio de passagem em um mp4 compartilhável. Use as opções embutidas para alinhar a duração à trilha sonora e definir convenções de nome de arquivo. Esta é sua etapa final de entrega para saídas MiniMax H3 ComfyUI Conversa e Canto Duplo de Personagens com Aceleração em 4 Passos.
Extras opcionais#
- Combine a escala do sujeito e o ângulo do rosto entre ambas as imagens para minimizar o desvio de identidade.
- Mantenha os prompts concisos e visuais: distância da câmera, configuração, humor e dicas de iluminação.
- Use sementes de ruído ao iterar para que você possa fazer mudanças A/B de forma confiável entre tomadas.
- Se o clipe ultrapassar um pouco, ative o corte na etapa de combinação para sincronização precisa de quadros.
- Comece com uma resolução de nível médio, depois aumente quando o bloqueio e o tempo parecerem certos.
Agradecimentos#
Este fluxo de trabalho implementa e se baseia nos seguintes trabalhos e recursos. Agradecemos MiniMax Research por MiniMax H3, Comfy.org pelo tutorial ComfyUI MiniMax H3, e Comfy-Org e larryvrh pelos pesos do modelo MiniMax-H3 e MiniMax-H3 Turbo LoRA por suas contribuições e manutenção. Para detalhes autoritativos, consulte a documentação original e os repositórios vinculados abaixo.
Recursos#
- Anúncio oficial MiniMax Research/MiniMax H3
- Documentos / Notas de Lançamento: MiniMax H3 anúncio oficial
- Tutorial Comfy.org/MiniMax H3
- GitHub: Comfy-Org/docs
- Documentos / Notas de Lançamento: Comfy.org MiniMax H3 tutorial
- Pesos do modelo Comfy-Org/MiniMax-H3
- GitHub: Comfy-Org/workflow_templates
- Hugging Face: Comfy-Org/MiniMax-H3
- larryvrh/MiniMax-H3 Turbo LoRA
- GitHub: Larryvrh/ComfyUI-MiniMax-H3-Turbo
- Hugging Face: larryvrh/MiniMax-H3-Turbo-Lora
Nota: O uso dos modelos, conjuntos de dados e código referenciados está sujeito às respectivas licenças e termos fornecidos por seus autores e mantenedores.

