MiniMax H3 Performance Capture para ComfyUI#
MiniMax H3 Performance Capture transforma sua atuação em um novo personagem enquanto mantém seu áudio original. O fluxo de trabalho transfere expressão facial, formas da boca, direção dos olhos e movimento da cabeça de um clipe fonte para uma criatura alvo ou personagem de corpo inteiro, depois compõe o resultado de volta na placa. Construído em torno do vídeo condicionado por referência MiniMax-H3, mascaramento facial automático e orientação de pose opcional, foi testado em trocas criativas como um lobo, um robô e um alienígena, preservando a cena e a trilha sonora. Fluxo de trabalho por Mickmumpitz.
Este fluxo de trabalho ComfyUI MiniMax H3 Performance Capture é a edição simples “render”: uma câmera por padrão, head-cam opcional e máscara manual, controle de pose opcional e dois vídeos salvos (render final com áudio, além de um corte de comparação).
Modelos principais no fluxo de trabalho Comfyui MiniMax H3 Performance Capture#
- MiniMax-H3 Reference-to-Video diffusion UNet (minimax_h3_ref2va_pruned_int8_convrot). Gerador central que funde referências, prompt e áudio em latentes de vídeo. Model files
- Qwen3-VL 32B MiniMax-H3 text encoder (qwen3vl_32b_minimax_h3_nvfp4_awq). Codifica o prompt para orientar a identidade e o estilo de atuação. Model file
- MiniMax-H3 Video VAE FP16 e Audio VAE FP32. O Video VAE decodifica imagens latentes; o Audio VAE condiciona a sincronização labial e o tempo de performance. VAEs
- MiniMax-H3 Turbo 8-step 768p LoRA. Acelera a amostragem H3 para renders rápidos e de alta qualidade. Model card
- MiniMax-H3 Character Swap LoRA. Fortalece trocas robustas de cabeça e corpo para aparências estilizadas ou de criaturas. Model card
- FUN ControlNet Union 2.0 model patch for H3. Adiciona orientação de pose corporal opcional a partir de esqueletos. Model file
- Segment Anything Model 3.1 Multiplex. Produz máscaras automáticas para a área a ser regenerada. Checkpoint
- DWPose (via ControlNet Aux). Detecta esqueletos corporais e das mãos para orientação de pose e lógica de corte de cabeça. Repository
Como usar o fluxo de trabalho Comfyui MiniMax H3 Performance Capture#
O fluxo de trabalho corre da esquerda para a direita através de oito grupos rotulados. Comece carregando seu clipe de performance e, opcionalmente, uma máscara manual, um close-up de head-cam e uma folha de personagem. O pipeline então prepara uma placa e máscara, constrói uma referência de atuação a partir do seu rosto, opcionalmente guia a pose corporal, renderiza com MiniMax H3 e salva um corte de comparação.
1 CARREGAR MODELOS#
Este grupo carrega o UNet MiniMax-H3, codificador de texto e VAEs, depois aplica as LoRAs Turbo e Character-Swap. UNETLoader (#1001) e CLIPLoader (#1006) fornecem o gerador central e codificador de prompt. LoraLoaderModelOnly (#1003, #1004) anexa os adaptadores de velocidade e troca. BlockSparseAttention (#1009) e MiniMaxH3SigmaShift (#1002) estão conectados para acelerar a amostragem e equilibrar a orientação áudio-vídeo.
2 SUA CENA#
Use BODY CLIP (sua performance + voz) (#1012) para carregar a tomada principal com áudio mono ou estéreo embutido. Você pode adicionar uma CREATURE SHEET via LoadImage (#1016) para travar a aparência entre as tomadas, e definir o prompt em PROMPT (a troca, a criatura, sua atuação) (#1018). Entradas opcionais incluem um close-up de HEAD-CAM VHS_LoadVideo (#1013) para rostos pequenos em tomadas amplas e um vídeo de MANUAL MASK VHS_LoadVideo (#1014) se você quiser substituir o mascaramento automático. Controles rápidos vivem aqui: O QUE SERÁ SUBSTITUÍDO (cabeça / pessoa) (#1017), SEED (#1019), GROW MASK px (#1020), FACE CROP (#1021) e PERSON (#1022). Alternadores de nós (SEM HEAD-CAM #1227, SEM MÁSCARA MANUAL #1228, SEM FOLHA DE PERSONAGEM #1229, SEM CONTROLE DE POSE #1230) tornam configurações comuns em um clique.
3 PREPARAR#
WORKING SIZE (rascunho: 896x512) (#1028) normaliza a entrada para uma resolução estável, e comprimento: próximo 17k+5 up (#1030) limita a execução para um comprimento de pré-visualização curto e rápido. PREPARAR (placa + área regenerada) (#1231) constrói uma placa limpa, rastreia o que substituir com SAM 3 usando seu texto de O QUE SERÁ SUBSTITUÍDO, e, se presente, ingere sua máscara manual. O resultado é uma placa de vídeo mais uma ou duas máscaras prontas para regeneração controlada.
4 ÁREA REGENERADA#
ÁREA REGENERADA (crescer, blocos, segurar) (#1233) é a lógica de máscara que decide onde o MiniMax H3 pode pintar. Ele expande a máscara para que características como orelhas ou chifres tenham espaço, converte-a em blocos temporais para estabilizar o movimento, e mantém mudanças por alguns quadros para que os detalhes não pisquem. Se você forneceu uma máscara manual, os [MANUAL MASK] composites (#1074 a #1105) passam-na como desenhada.
5 REFERÊNCIA DE ATUAÇÃO#
REFERÊNCIA DE ATUAÇÃO (seu rosto em cinza | head-cam) (#1232) encontra a pessoa selecionada, recorta uma região de rosto com DWPose e produz o vídeo de referência que carrega suas expressões, linhas dos olhos e rotações da cabeça. Com head-cam habilitado, ele constrói uma tela dividida para que a direção da cabeça siga a câmera ampla enquanto o movimento facial fino segue o head-cam. A pré-visualização PREVIEW: referência de atuação (<Video 1>) (#1130) permite que você confirme o rastreamento antes de renderizar.
6 CONTROLE DE POSE (opcional)#
Para trocas de criaturas de corpo inteiro, [POSE] DWPose skeleton (#1131) extrai pontos chave do corpo e mãos da sua placa. MiniMaxH3FunControlNetApply (#1132) alimenta esse movimento em H3 como um patch para que os membros e o torso sigam sua performance enquanto o rosto permanece orientado pela referência. Use quando braços e pernas devem permanecer consistentes entre os quadros; deixe desligado para trocas apenas de cabeça e para animais de quatro patas.
7 RENDER#
H3 referências + prompt MiniMaxH3ReferenceToVideo (#1134) combina o prompt, folha de personagem, referência de atuação, áudio e tamanho de trabalho para produzir condicionamento H3 e um latente inicial. H3 RENDER (#1234) então injeta o latente da placa, aplica a máscara de regeneração para que apenas a área mascarada mude, e amostra com a programação Turbo. A saída é um render limpo e uma pré-visualização “regen shown”; SAVE: H3 render 1344x768 + voice (#1150) grava um MP4 com seu áudio original.
8 VÍDEO DE COMPARAÇÃO#
VÍDEO DE COMPARAÇÃO (#1235) empilha a placa, render, referência de atuação e (se usado) a folha de criatura em um único quadro para revisão. SAVE: vídeo de comparação + voz (#1158) exporta um MP4 com a mesma trilha sonora para que você possa comparar o resultado com sua performance.
Nós principais no fluxo de trabalho Comfyui MiniMax H3 Performance Capture#
BODY CLIP (sua performance + voz) (#1012)#
Carrega sua atuação e áudio, que conduzem a sincronização labial e o tempo. Mantenha o enquadramento paisagem para melhor composição e certifique-se de que o arquivo tem áudio. Se o rosto for pequeno no quadro, adicione a entrada de head-cam para um rastreamento de expressão mais nítido.
O QUE SERÁ SUBSTITUÍDO (cabeça / pessoa) (#1017)#
Este texto curto orienta o SAM 3.1 para a região que o H3 irá regenerar. Use cabeça para trocas de cabeça ou pessoa para substituições de corpo inteiro. Se um capacete ou equipamento na cabeça deve desaparecer, inclua palavras como cabeça, capacete ou equipamento de câmera; evite palavras genéricas como tela, monitor ou cabo, a menos que pretenda remover objetos semelhantes no fundo.
ÁREA REGENERADA (crescer, blocos, segurar) (#1233)#
Define quanto da imagem o H3 pode repintar e como essa área evolui ao longo do tempo. Aumente o crescimento para dar espaço para orelhas, chifres ou pelagem; diminua para tomadas amplas para evitar expandir para o fundo. As etapas de bloco e segurar estabilizam o movimento para que os detalhes não cintilem entre os quadros.
REFERÊNCIA DE ATUAÇÃO (seu rosto em cinza | head-cam) (#1232)#
Cria a trilha de performance que o MiniMax H3 irá imitar. FACE CROP controla quanto da cabeça e pescoço são analisados, e PERSON seleciona o ator quando várias pessoas estão visíveis. Ative head-cam apenas quando o rosto na tomada ampla for muito pequeno; uma câmera geralmente segue melhor as voltas de cabeça.
MiniMaxH3ReferenceToVideo (#1134)#
O hub que mescla o prompt, referências e áudio para produzir condicionamento e um latente inicial. Mantenha a largura e altura alinhadas com o tamanho de trabalho e deixe o fluxo de trabalho limitar automaticamente o comprimento para pré-visualizações. O prompt já inclui uma frase que diz ao H3 como usar a referência de atuação.
MiniMaxH3FunControlNetApply (#1132)#
Adiciona orientação de pose corporal opcional a partir de DWPose. Útil para criaturas de corpo inteiro para que o torso e membros acompanhem de forma convincente enquanto o rosto segue a referência de atuação. Deixe desligado para trocas apenas de cabeça ou movimento de quatro patas que não corresponde a esqueletos humanos.
H3 RENDER (#1234)#
Aplica a máscara para que apenas a região selecionada mude, então amostra o vídeo com a programação Turbo e decodifica com VAE em mosaico para eficiência de VRAM. Use SEED para ajustar aparência e micro-movimentos; mude quando a aparência do personagem se desviar da folha ou descrição.
Extras opcionais#
- Dicas de filmagem para MiniMax H3 Performance Capture: filme em paisagem, mantenha a exposição estável, inclua áudio de produção limpo; se você filmou HDR no iPhone, converta para SDR antes de executar.
- Orientação de folha de personagem: inclua vistas frontais e laterais, além de algumas pequenas cabeças de expressão; isso bloqueia a identidade entre as tomadas melhor do que apenas texto.
- Cenas com várias pessoas: defina
PERSONpara o índice correto e descreva o sujeito no texto SAM, depois verifique a pré-visualização da máscara antes de renderizar. - Máscara manual: forneça um vídeo preto e branco que corresponda ao tempo do clipe corporal; pinte-o ligeiramente maior que a criatura pretendida para que o H3 não recaia no rosto original.
- Quando habilitar o controle de pose: use para humanoides de corpo inteiro ou criaturas com braços e pernas; desligue para trocas apenas de cabeça e quadrúpedes.
- Notas de performance: atenção esparsa está ativada para acelerar os renders e reduzir a memória; se o VRAM estiver apertado, execute o codificador de texto na CPU em
CLIPLoader. Nós personalizados usados incluem ComfyUI-VideoHelperSuite, ComfyUI-KJNodes, comfyui_controlnet_aux, ComfyUI-H3-FaceRefine e ComfyUI-Mickmumpitz-Nodes.
Agradecimentos#
Este fluxo de trabalho implementa e constrói sobre os seguintes trabalhos e recursos. Agradecemos a Mickmumpitz pelo fluxo de trabalho de captura de performance ComfyUI e a Comfy-Org pelos modelos MiniMax H3 por suas contribuições e manutenção. Para detalhes autorizados, consulte a documentação original e os repositórios vinculados abaixo.
Recursos#
- Workflow by Mickmumpitz
- GitHub: mickmumpitz/ComfyUI-Mickmumpitz-Nodes
- Docs / Release Notes: NOVO VÍDEO & WORKFLOW GRATUITO — Transforme-se em QUALQUER criatura (MiniMax H3)
- MiniMax H3 models
- Hugging Face: Comfy-Org/MiniMax-H3
Nota: O uso dos modelos, conjuntos de dados e código referenciados está sujeito às respectivas licenças e termos fornecidos por seus autores e mantenedores.

