ComfyUI MiniMax H3 Talking Digital Human: retrato y voz a video de avatar sincronizado por labios#
Este flujo de trabajo convierte un solo retrato de frente y una referencia de voz corta en un clip de alta calidad de cabeza parlante con habla sincronizada en RunComfy. Construido alrededor de MiniMax H3 de referencia a video y audio con QwenVL fundamentación de imagen, preserva la identidad y el fondo mientras genera la voz hablante a partir de tu muestra. ComfyUI MiniMax H3 Talking Digital Human es ideal para explicadores de productos, avatares presentadores, publicaciones sociales y videos cortos de portavoces sin una pila de TTS o sincronización de labios separada.
Proporcionas una imagen y un clip de voz. El flujo de trabajo infiere una descripción compacta del rostro y la escena, condiciona MiniMax H3 con esa guía y co-genera fotogramas de video y el audio correspondiente en un único latente unificado para que los labios y la voz permanezcan alineados. El resultado se renderiza en un solo archivo de video que puedes descargar y compartir.
Modelos clave en el flujo de trabajo de Comfyui ComfyUI MiniMax H3 Talking Digital Human#
- Modelo de difusión de referencia a video y audio MiniMax H3. Generador central que utiliza un retrato y audio opcional como referencias para producir una cabeza parlante sincronizada. Alojado por Comfy-Org para uso fácil en ComfyUI. Hugging Face: Comfy-Org/MiniMax-H3
- MiniMax H3 Video VAE. Codifica y decodifica la parte de video del espacio latente compartido utilizado por MiniMax H3, ayudando a mantener la identidad y el fondo estables. Distribuido con el mismo paquete de modelos. Hugging Face: Comfy-Org/MiniMax-H3
- MiniMax H3 Audio VAE. Codifica y decodifica la parte de audio del latente compartido para que el habla se genere al unísono con el movimiento de la boca. También disponible en el paquete de modelos. Hugging Face: Comfy-Org/MiniMax-H3
- Qwen3-VL 4B Instruct. Un modelo de visión-lenguaje utilizado para fundamentar las indicaciones en detalles visuales del retrato subido, lo que mejora la retención de la identidad y la consistencia de la escena. Hugging Face: Qwen/Qwen3-VL-4B-Instruct
Cómo usar el flujo de trabajo de Comfyui ComfyUI MiniMax H3 Talking Digital Human#
Este flujo de trabajo está organizado en cuatro áreas: una sección de carga y edición, un asistente de duración, el núcleo de generación MiniMax H3 y la etapa de salida. Trabaja de izquierda a derecha, comenzando con las entradas de medios, luego la guía de indicaciones, luego ejecuta la generación y guarda el video.
Área de Carga / Edición: usualmente cambia aquí solamente; deja el resto por defecto#
Usa LoadImage (#137) para cargar un retrato de personaje de frente. El encuadre frontal o casi frontal con ojos y boca visibles funciona mejor para el movimiento natural de los labios. Usa LoadAudio (#141) para cargar una muestra de habla limpia cuyo timbre quieras imitar; puede ser unos segundos de habla con mínimo ruido de fondo. Si es necesario, recorta la muestra de voz con AudioCrop (#142) estableciendo inicio y fin en el segmento hablado que quieres que el avatar coincida. Añade cualquier guía de estilo o contenido en Prompt (#138); el flujo de trabajo anexará detalles automáticos fundamentados en la imagen para una mejor consistencia.
Duración del Video (segundos):#
Establece una duración objetivo usando el control numérico en la parte superior del grupo de duración. Un asistente ComfyMathExpression (#131) convierte segundos a un conteo de fotogramas válido para el modelo y lo alinea con los requisitos del muestreador. Esto mantiene la sincronización estable y evita cortes a mitad de fonema. Si cambias la duración después, actualiza el recorte de audio para que el habla final y el movimiento de labios se alineen.
MiniMax-H3 Open Source - Imagen Humana Digital Parlante#
Esta es la ruta de generación central construida alrededor de MiniMaxH3ReferenceToVideo (#136). El nodo recibe tu retrato como imagen de referencia y tu clip de voz recortado como audio de referencia, más ancho, alto y longitud de los selectores. Una descripción basada en QwenVL del retrato se une con tu indicación escrita para que el modelo obtenga tanto la fundamentación visual como tus instrucciones. El modelo emite un único latente que contiene tanto el video como el audio, así como la condicionante utilizada por la pila de muestreador, por lo que la sincronización de labios es robusta sin una etapa de sincronización de labios separada.
Fundamentación de Indicaciones con QwenVL#
AILab_QwenVL (#152) analiza el retrato subido y devuelve una descripción concisa y factual. El flujo de trabajo concatena esa descripción con tu texto directivo a través de JoinStrings (#150, #148, #144), produciendo una indicación final que le dice al modelo que mantenga el fondo sin cambios y use tu audio para la voz hablante. Esta fundamentación automática fortalece notablemente la estabilidad de la identidad y el fondo. Puedes mantener tu indicación escrita corta y dejar que la fundamentación llene detalles precisos de rostro y escena.
Resolución / Relación de Aspecto de Video#
Elige aspecto y resolución objetivo con ResolutionSelector (#115). Emite ancho y alto que son amigables para el modelo y tu GPU, que el nodo central utiliza directamente. Para avatares de retrato, los aspectos altos mantienen más del sujeto mientras dejan espacio para el movimiento natural de la cabeza. Si ajustas la relación de aspecto después de probar, mantén el mismo encuadre en tu retrato de entrada para resultados consistentes.
Video Generado de Salida#
La ruta del muestreador desruide el latente conjunto, luego VAEDecode (#122) lo convierte en fotogramas mientras que VAEDecodeAudio (#121) lo convierte en una forma de onda. CreateVideo (#130) fusiona fotogramas y audio en un solo clip a tu tasa de fotogramas elegida, y SaveVideo (#92) escribe el archivo. El resultado guardado contiene tanto la imagen como la voz sincronizada de la misma ejecución de generación. Descarga y revisa; si la sincronización parece desincronizada, ajusta el recorte de audio o la duración y ejecuta de nuevo.
Nodos clave en el flujo de trabajo de Comfyui ComfyUI MiniMax H3 Talking Digital Human#
MiniMaxH3ReferenceToVideo (#136)#
El núcleo de la canalización que acepta un retrato de referencia y una muestra de voz para co-generar video y audio. Los controles clave son prompt para contenido y estilo, width y height para encuadre, y length para duración en fotogramas. Usa un retrato único y nítido como la primera imagen de referencia y mantén ref_image_size emparejado para que las proporciones faciales se transfieran correctamente. Si ves deslizamiento o cambios de fondo, refuerza tu texto directivo para mantener explícitamente el fondo sin cambios.
ResolutionSelector (#115)#
Establece la relación de aspecto y el conteo total de píxeles, luego emite ancho y alto alineados a múltiplos amigables para el modelo. Elige un aspecto que coincida con el recorte de tu retrato para reducir artefactos de remuestreo. Aumentar la resolución total puede mejorar el detalle pero también aumenta el VRAM y el tiempo; prueba en configuraciones más pequeñas antes de escalar. Mantén el encuadre consistente a lo largo de las ejecuciones para una identidad reproducible.
AudioCrop (#142)#
Recorta la voz de referencia cargada al segmento que quieres que el avatar hable. Establece inicio y final en la parte hablada, dejando un pequeño margen de silencio en los extremos para inicios y finales naturales. Hacer coincidir la longitud del audio recortado con tu duración de video objetivo ayuda al generador a alinear fonemas con formas de la boca. Si las plosivas o sibilantes parecen incorrectas, prueba una grabación más limpia o acorta el rango recortado.
AILab_QwenVL (#152)#
Genera una descripción fundamentada en la imagen que se agrega automáticamente a tu indicación. Esto añade detalles concretos sobre el rostro, cabello, vestimenta y fondo, lo que ayuda al modelo a preservar la identidad y la escena. Si la descripción fundamentada sobreconstriñe el estilo, mantén tu indicación escrita mínima y neutral para que la fundamentación pueda hacer su trabajo. Para imágenes de varios personajes, sube un recorte más ajustado para que la descripción se centre en un solo sujeto.
CreateVideo (#130)#
Combina fotogramas decodificados y audio en un solo archivo reproducible. Puedes cambiar fps si necesitas coincidir con una línea de tiempo posterior, pero mantenlo consistente con la conversión de duración a fotogramas anterior. Si ves tartamudeo en ciertas plataformas, vuelve a exportar a una tasa de fotogramas común para esa plataforma. El control bit_depth puede dejarse en su valor predeterminado para entrega web.
ComfyMathExpression (#131)#
Convierte tu duración en segundos a un conteo de fotogramas válido para el generador y lo alinea con el paso del muestreador. Esto previene pasos parciales que pueden causar deslizamiento de sincronización. Si cambias la tasa de fotogramas posteriormente, revisa la duración para mantener el movimiento de la boca alineado con las sílabas. Trata este nodo como la fuente de verdad del tiempo para toda la ejecución.
Extras opcionales#
- Usa un retrato limpio, uniformemente iluminado con ojos y boca despejados para la articulación más natural.
- Graba de 5 a 10 segundos de habla clara en una habitación silenciosa; evita música o compresión fuerte en el clip de referencia.
- Para resultados reproducibles, fija la semilla de
RandomNoiseenRandomNoise(#129) en lugar de aleatorizar entre ejecuciones. - Si necesitas subtítulos, añádelos en postproducción en lugar de integrarlos en la indicación, para que el modelo se enfoque en el rostro y la voz.
- Respeta los derechos de imagen y voz al crear un ComfyUI MiniMax H3 Talking Digital Human para personas reales.
Agradecimientos#
Este flujo de trabajo implementa y se basa en los siguientes trabajos y recursos. Agradecemos a MiniMax por el modelo MiniMax H3, a Comfy-Org por los pesos del modelo MiniMax-H3, y a Comfy.org por el tutorial MiniMax H3 por sus contribuciones y mantenimiento. Para detalles autorizados, por favor consulta la documentación original y los repositorios enlazados a continuación.
Recursos#
- Anuncio oficial de MiniMax/MiniMax H3
- Documentos / Notas de lanzamiento: Anuncio oficial de MiniMax H3
- Pesos del modelo Comfy-Org/MiniMax-H3
- Hugging Face: Comfy-Org/MiniMax-H3
- Tutorial de Comfy.org/MiniMax H3
- GitHub: comfy-org/docs
- Hugging Face: Comfy-Org/MiniMax-H3
- Documentos / Notas de lanzamiento: Tutorial de Comfy.org MiniMax H3
Nota: El uso de los modelos, conjuntos de datos y código referenciados está sujeto a las respectivas licencias y términos proporcionados por sus autores y mantenedores.
