Captura de Rendimiento MiniMax H3 para ComfyUI#
La Captura de Rendimiento MiniMax H3 convierte tu actuación en un nuevo personaje mientras mantiene tu audio original. El flujo de trabajo transfiere la expresión facial, las formas de la boca, la dirección de los ojos y el movimiento de la cabeza de un clip fuente a una criatura objetivo o personaje de cuerpo completo, luego compone el resultado de nuevo en la placa. Construido alrededor de video condicionado por referencia MiniMax-H3, enmascaramiento facial automático y guía de poses opcional, ha sido probado en intercambios creativos como un lobo, un robot y un alienígena mientras preserva la escena y la banda sonora. Flujo de trabajo por Mickmumpitz.
Este flujo de trabajo de Captura de Rendimiento MiniMax H3 de ComfyUI es la edición simple “render”: una cámara por defecto, cámara de cabeza opcional y máscara manual, control de poses opcional, y dos videos guardados (render final con audio, más un corte de comparación).
Modelos clave en el flujo de trabajo de Captura de Rendimiento MiniMax H3 de Comfyui#
- MiniMax-H3 Reference-to-Video diffusion UNet (minimax_h3_ref2va_pruned_int8_convrot). Generador central que fusiona referencias, prompt y audio en latentes de video. Model files
- Qwen3‑VL 32B MiniMax‑H3 text encoder (qwen3vl_32b_minimax_h3_nvfp4_awq). Codifica el prompt para dirigir la identidad y el estilo de actuación. Model file
- MiniMax‑H3 Video VAE FP16 y Audio VAE FP32. El Video VAE decodifica latentes de imagen; el Audio VAE condiciona la sincronización de labios y el tiempo de actuación. VAEs
- MiniMax‑H3 Turbo 8‑step 768p LoRA. Acelera el muestreo H3 para renders rápidos y de alta calidad. Model card
- MiniMax‑H3 Character Swap LoRA. Fortalece intercambios robustos de cabeza y cuerpo para apariencias estilizadas o de criaturas. Model card
- FUN ControlNet Union 2.0 model patch for H3. Añade guía de poses de cuerpo opcional desde esqueletos. Model file
- Segment Anything Model 3.1 Multiplex. Produce máscaras automáticas para el área a regenerar. Checkpoint
- DWPose (via ControlNet Aux). Detecta esqueletos de cuerpo y manos para guía de poses y lógica de recorte de cabeza. Repository
Cómo usar el flujo de trabajo de Captura de Rendimiento MiniMax H3 de Comfyui#
El flujo de trabajo se ejecuta de izquierda a derecha a través de ocho grupos etiquetados. Comienza cargando tu clip de rendimiento y, opcionalmente, una máscara manual, un primer plano de cámara de cabeza y una hoja de personaje. Luego, la tubería prepara una placa y máscara, construye una referencia de actuación desde tu cara, guía opcionalmente la pose del cuerpo, renderiza con MiniMax H3 y guarda un corte de comparación.
1 CARGAR MODELOS#
Este grupo carga el MiniMax‑H3 UNet, codificador de texto y VAEs, luego aplica los LoRAs de Turbo y Cambio de Personaje. UNETLoader (#1001) y CLIPLoader (#1006) proporcionan el generador central y el codificador de prompt. LoraLoaderModelOnly (#1003, #1004) adjunta los adaptadores de velocidad e intercambio. BlockSparseAttention (#1009) y MiniMaxH3SigmaShift (#1002) están conectados para acelerar el muestreo y equilibrar la guía audio-video.
2 TU TOMA#
Usa BODY CLIP (tu actuación + voz) (#1012) para cargar la toma principal con audio mono o estéreo incrustado. Puedes añadir una CREATURE SHEET a través de LoadImage (#1016) para bloquear la apariencia a través de tomas, y establecer el prompt en PROMPT (el intercambio, la criatura, su actuación) (#1018). Las entradas opcionales incluyen un primer plano de HEAD‑CAM VHS_LoadVideo (#1013) para caras diminutas en tomas amplias y un video de MANUAL MASK VHS_LoadVideo (#1014) si deseas anular el enmascaramiento automático. Los controles rápidos viven aquí: QUÉ SE REEMPLAZA (cabeza / persona) (#1017), SEED (#1019), GROW MASK px (#1020), FACE CROP (#1021) y PERSON (#1022). Los nodos de alternancia (NO HEAD‑CAM #1227, NO MANUAL MASK #1228, NO CHARACTER SHEET #1229, NO POSE CONTROL #1230) hacen configuraciones comunes con un solo clic.
3 PREPARAR#
WORKING SIZE (draft: 896x512) (#1028) normaliza la entrada a una resolución estable, y length: next 17k+5 up (#1030) limita la ejecución a una longitud de vista previa corta y rápida. PREPARE (plate + regenerated area) (#1231) construye una placa limpia, rastrea qué reemplazar con SAM 3 usando tu texto de QUÉ SE REEMPLAZA, y, si está presente, ingiere tu máscara manual. El resultado es una placa de video más una o dos máscaras listas para regeneración controlada.
4 ÁREA REGENERADA#
ÁREA REGENERADA (grow, blocks, hold) (#1233) es la lógica de máscara que decide dónde puede pintar MiniMax H3. Expande la máscara para que características como orejas o cuernos tengan espacio, la convierte en bloques temporales para estabilizar el movimiento, y mantiene los cambios unos pocos cuadros para que los detalles no parpadeen. Si proporcionaste una máscara manual, los composites [MANUAL MASK] (#1074 a #1105) la pasan tal como fue dibujada.
5 REFERENCIA DE ACTUACIÓN#
REFERENCIA DE ACTUACIÓN (tu cara en gris | head‑cam) (#1232) encuentra a la persona seleccionada, recorta una región de cara con DWPose y produce el video de referencia que lleva tus expresiones, líneas de ojos y rotaciones de cabeza. Con la cámara de cabeza habilitada, construye una pantalla dividida para que la dirección de la cabeza siga la cámara amplia mientras el movimiento facial fino sigue la cámara de cabeza. La vista previa PREVIEW: acting reference (<Video 1>) (#1130) te permite confirmar el seguimiento antes de renderizar.
6 CONTROL DE POSES (opcional)#
Para intercambios de criaturas de cuerpo completo, [POSE] DWPose skeleton (#1131) extrae puntos clave de cuerpo y manos de tu placa. MiniMaxH3FunControlNetApply (#1132) alimenta ese movimiento en H3 como un parche para que las extremidades y el torso sigan tu actuación mientras el rostro permanece impulsado por la referencia. Úsalo cuando los brazos y las piernas deben permanecer consistentes entre cuadros; déjalo apagado para intercambios de solo cabeza y para animales de cuatro patas.
7 RENDERIZAR#
H3 references + prompt MiniMaxH3ReferenceToVideo (#1134) combina el prompt, hoja de personaje, referencia de actuación, audio y tamaño de trabajo para producir el acondicionamiento H3 y un latente inicial. H3 RENDER (#1234) luego inyecta el latente de la placa, aplica la máscara de regeneración para que solo el área enmascarada cambie, y muestrea con el cronograma Turbo. La salida es un render limpio y una vista previa de “regeneración mostrada”; SAVE: H3 render 1344x768 + voice (#1150) escribe un MP4 con tu audio original.
8 VIDEO DE COMPARACIÓN#
VIDEO DE COMPARACIÓN (#1235) apila la placa, el render, la referencia de actuación y (si se usó) la hoja de criatura en un solo cuadro para revisión. SAVE: comparison video + voice (#1158) exporta un MP4 con la misma banda sonora para que puedas A/B el resultado contra tu actuación.
Nodos clave en el flujo de trabajo de Captura de Rendimiento MiniMax H3 de Comfyui#
BODY CLIP (tu actuación + voz) (#1012)#
Carga tu actuación y audio, que dirigen la sincronización de labios y el tiempo. Mantén el encuadre en formato horizontal para la mejor composición y asegúrate de que el archivo tenga audio. Si la cara es diminuta en el cuadro, añade la entrada de cámara de cabeza para un seguimiento de expresión más nítido.
QUÉ SE REEMPLAZA (cabeza / persona) (#1017)#
Este texto corto dirige SAM 3.1 a la región que H3 regenerará. Usa cabeza para intercambios de cabeza o persona para reemplazos de cuerpo completo. Si un casco o un equipo en la cabeza deben desaparecer, incluye palabras como cabeza, casco o equipo de cámara; evita palabras genéricas como pantalla, monitor o cable a menos que desees eliminar objetos similares en el fondo.
ÁREA REGENERADA (grow, blocks, hold) (#1233)#
Define cuánto de la imagen puede repintar H3 y cómo evoluciona esa área con el tiempo. Aumenta el crecimiento para dar espacio a orejas, cuernos o pelaje; redúcelo para tomas amplias para evitar expandirse hacia el fondo. Las etapas de bloque y retención estabilizan el movimiento para que los detalles no titilen entre cuadros.
REFERENCIA DE ACTUACIÓN (tu cara en gris | head‑cam) (#1232)#
Crea la pista de rendimiento que MiniMax H3 imitará. FACE CROP controla cuánto de la cabeza y el cuello se analizan, y PERSON selecciona al actor cuando hay varias personas visibles. Habilita la cámara de cabeza solo cuando la cara en la toma amplia es muy pequeña; una cámara generalmente sigue mejor los giros de cabeza.
MiniMaxH3ReferenceToVideo (#1134)#
El centro que fusiona el prompt, las referencias y el audio para producir el acondicionamiento y un latente inicial. Mantén el ancho y la altura alineados con el tamaño de trabajo y deja que el flujo de trabajo limite automáticamente la longitud para las vistas previas. El prompt ya incluye una oración que le dice a H3 cómo usar la referencia de actuación.
MiniMaxH3FunControlNetApply (#1132)#
Añade guía de poses de cuerpo opcional desde DWPose. Útil para criaturas de cuerpo completo para que el torso y las extremidades sigan de manera convincente mientras el rostro sigue la referencia de actuación. Déjalo apagado para intercambios de solo cabeza o movimiento de cuatro patas que no coincide con esqueletos humanos.
H3 RENDER (#1234)#
Aplica la máscara para que solo cambie la región seleccionada, luego muestrea el video con el cronograma Turbo y decodifica con VAE en mosaico para eficiencia de VRAM. Usa SEED para ajustar la apariencia y los micro-movimientos; cámbialo cuando la apariencia del personaje se desvíe de la hoja o descripción.
Extras opcionales#
- Consejos de filmación para Captura de Rendimiento MiniMax H3: filma en paisaje, mantén la exposición estable, incluye audio de producción limpio; si grabaste HDR en iPhone, conviértelo a SDR antes de ejecutarlo.
- Guía de hoja de personaje: incluye vistas frontales y laterales más algunas pequeñas cabezas de expresión; esto bloquea la identidad a través de las tomas mejor que solo texto.
- Escenas de varias personas: establece
PERSONal índice correcto y describe al sujeto en el texto de SAM, luego verifica la vista previa de la máscara antes de renderizar. - Máscara manual: proporciona un video en blanco y negro que coincida con el tiempo del clip corporal; píntalo ligeramente más grande que la criatura prevista para que H3 no vuelva a la cara original.
- Cuándo habilitar el control de poses: úsalo para humanoides de cuerpo completo o criaturas con brazos y piernas; apágalo para intercambios de solo cabeza y cuadrúpedos.
- Notas de rendimiento: se habilitó atención dispersa para acelerar renders y reducir memoria; si el VRAM es limitado, ejecuta el codificador de texto en CPU en
CLIPLoader. Los nodos personalizados utilizados incluyen ComfyUI‑VideoHelperSuite, ComfyUI‑KJNodes, comfyui_controlnet_aux, ComfyUI‑H3‑FaceRefine y ComfyUI‑Mickmumpitz‑Nodes.
Agradecimientos#
Este flujo de trabajo implementa y se basa en los siguientes trabajos y recursos. Agradecemos sinceramente a Mickmumpitz por el flujo de trabajo de captura de rendimiento de ComfyUI y a Comfy-Org por los modelos MiniMax H3 por sus contribuciones y mantenimiento. Para obtener detalles autorizados, consulta la documentación y los repositorios originales enlazados a continuación.
Recursos#
- Flujo de trabajo por Mickmumpitz
- GitHub: mickmumpitz/ComfyUI-Mickmumpitz-Nodes
- Docs / Notas de Lanzamiento: NEW VIDEO & FREE WORKFLOW — Turn yourself into ANY creature (MiniMax H3)
- Modelos MiniMax H3
- Hugging Face: Comfy-Org/MiniMax-H3
Nota: El uso de los modelos, conjuntos de datos y código referenciados está sujeto a las respectivas licencias y términos proporcionados por sus autores y mantenedores.

