ComfyUI>Flujos de trabajo>MiniMax H3 Hablar & Cantar Personaje Dual | Aceleración de 4 pasos

MiniMax H3 Hablar & Cantar Personaje Dual | Aceleración de 4 pasos

Workflow Name: RunComfy/MiniMax-H3-Talking-Singing-Dual-Character-4-step-Acceleration
Workflow ID: 0000...1486
Convierte dos imágenes fijas en una actuación cara a cara de hablar y cantar. Diriges el diálogo o las voces con un clip de audio. Hailuo H3 mantiene ambas identidades estables. El bloqueo de audio ofrece sincronización labial precisa. Turbo LoRA se ejecuta en cuatro pasos. Obtienes duetos rápidos sin una pila de sincronización labial separada.
Avoid using 2X Large or 2XL Plus for this workflow. These machine types may cause the generated video to contain only noise. Use Medium, Large, or X Large instead.

MiniMax H3 ComfyUI Talking and Singing Dual Character 4-step Acceleration Workflow

MiniMax H3 Talking & Singing Dual Character | 4-step Acceleration
¿Quiere ejecutar este flujo de trabajo?
  • Flujos de trabajo completamente operativos
  • Sin nodos ni modelos faltantes
  • No se requiere configuración manual
  • Presenta visuales impresionantes

MiniMax H3 ComfyUI Talking and Singing Dual Character 4-step Acceleration Examples

MiniMax H3 ComfyUI Hablar y Cantar Personaje Dual Aceleración de 4 pasos#

Este flujo de trabajo listo para RunComfy convierte dos retratos y una pista corta de discurso o canto en un solo video sincronizado con los labios donde ambos personajes comparten la escena. Construido sobre MiniMax H3 referencia-a-video con el Turbo LoRA oficial, ofrece generación de pocos pasos manteniendo ambas identidades estables y el movimiento de la boca bloqueado a tu audio fuente.

MiniMax H3 ComfyUI Hablar y Cantar Personaje Dual Aceleración de 4 pasos es ideal para duetos, diálogos de dos personas, tráilers o vistas previas rápidas de actuaciones. Traes dos imágenes y un archivo de audio, agregas un breve aviso, eliges un tamaño y el gráfico renderiza un mp4 con la banda sonora original intacta.

Modelos clave en el flujo de trabajo Comfyui MiniMax H3 ComfyUI Hablar y Cantar Personaje Dual Aceleración de 4 pasos#

  • MiniMax-H3 referencia-a-video backbone de Comfy-Org — el modelo generativo que mapea tus referencias y texto en un latente audiovisual para la síntesis de video. Hugging Face: Comfy-Org/MiniMax-H3
  • MiniMax-H3 Video VAE FP16 — codifica y decodifica latentes de video para que los cuadros puedan ser desruidos eficientemente y reconstruidos con fidelidad. Incluido en el paquete de modelos. Hugging Face: Comfy-Org/MiniMax-H3
  • MiniMax-H3 Audio VAE FP32 — representa el audio conductor en espacio latente para que el movimiento labial y el tiempo se aprendan de tu pista. Incluido en el paquete de modelos. Hugging Face: Comfy-Org/MiniMax-H3
  • Qwen3-VL 32B codificador de texto (variantes AWQ/NVFP empaquetadas para H3) — interpreta tu aviso para establecer la escena, estilo e intención de toma para la composición de personaje dual. Incluido en el paquete de modelos. Hugging Face: Comfy-Org/MiniMax-H3
  • MiniMax-H3 Turbo 4-step LoRA — acelera el muestreo para que puedas renderizar con tan solo cuatro pasos de desruido mientras preservas la identidad y la sincronización labial. Hugging Face: larryvrh/MiniMax-H3-Turbo-Lora

Cómo usar Comfyui MiniMax H3 ComfyUI Hablar y Cantar Personaje Dual Aceleración de 4 pasos#

Este gráfico fluye de izquierda a derecha: cargas dos imágenes de personajes y un clip de audio, configuras el aviso y el tamaño, luego el núcleo del camino H3 fusiona las referencias y el audio en un latente AV. Una breve etapa de bloqueo de audio preserva tu banda sonora original mientras conduce el movimiento labial, y el muestreador con Turbo LoRA realiza el desruido de pocos pasos antes del ensamblaje final del video.

  • Cargar Imagen (Personaje A)
    • Deja una imagen fija clara y frontal para el personaje A en LoadImage (#227). Favorece un tamaño de cabeza y una iluminación similar al personaje B para una copresencia estable. El fondo puede ser simple; la identidad y la pose son la prioridad. El nodo alimenta la pila de referencia H3 para que el modelo aprenda quién es el primer hablante en la escena compartida.
  • Cargar Imagen (Personaje B)
    • Proporciona el personaje B en LoadImage (#137). Mantén el encuadre, la orientación y la expresión aproximadamente comparables al personaje A para reducir el desvío entre las tomas. Esta segunda referencia permite que H3 sintetice una toma de dos donde ambos individuos permanecen consistentes mientras hablan o cantan entre sí.
  • Cargar Audio
    • Agrega tu diálogo o voces en LoadAudio (#171). Usa AudioCrop (#177) para establecer los tiempos de inicio y fin para que la longitud del clip coincida con el segmento que deseas. El audio limpio y centrado mejora la articulación de la boca y reduce el temblor del tiempo.
  • Aviso
    • Describe la toma en Input Text (Prompt) (#138). Frases cortas y cinematográficas funcionan bien, por ejemplo, describiendo la distancia de la cámara, el fondo y el ambiente para los dos personajes. El aviso dirige el diseño y el estilo sin reemplazar la guía de identidad de las imágenes fijas y el tiempo de tu pista.
  • Selector de Resolución (Tamaño)
    • Elige el aspecto y el tamaño objetivo en Resolution Selector (Size) (#115). El selector emite el ancho y la altura ya alineados a múltiplos amigables para el modelo para equilibrar el detalle y la velocidad. Una nota de tamaño incorporada ofrece preajustes de 16:9 listos para usar, para que puedas elegir un nivel de megapíxeles que se ajuste a tu presupuesto de GPU.
  • Resultado
    • Los cuadros se decodifican y se combinan con el audio original en VHS_VideoCombine (#142) para producir un mp4. Si tu renderizado es ligeramente largo o corto, usa el interruptor proporcionado en este paso para recortar a la longitud del audio. Los nombres de archivo y el formato están preconfigurados para una iteración rápida.
  • Núcleo (No Modificar)
    • Dentro de esta área protegida, MiniMaxH3ReferenceToVideo (#136) fusiona ambas imágenes de referencia, el aviso y el audio recortado en un latente AV conjunto y condicionamiento positivo. VRGDG_MiniMaxH3AudioDrive (#172) bloquea el audio fuente para que la sincronización labial siga tu pista mientras la banda sonora se pasa sin cambios. El UNet está parcheado para la eficiencia de memoria, y LoraLoaderModelOnly (#234) aplica el Turbo 4-step LoRA antes de que el muestreador desruide y VAEDecode reconstruya los cuadros. Estos internos están ajustados para la estabilidad y la velocidad, por lo que generalmente no necesitas ajustarlos.

Nodos clave en el flujo de trabajo Comfyui MiniMax H3 ComfyUI Hablar y Cantar Personaje Dual Aceleración de 4 pasos#

  • MiniMaxH3ReferenceToVideo (#136)
    • El corazón del gráfico que ingiere ambas imágenes de personajes, tu aviso, ancho, altura y una longitud de clip calculada automáticamente. También acepta el audio recortado como referencia para que el tiempo de los fonemas y las formas visemas se alineen con la banda sonora. Si necesitas un control más ajustado, puedes ajustar directamente prompt, width, height o anular length para tiempos especiales.
  • VRGDG_MiniMaxH3AudioDrive (#172)
    • Bloquea el movimiento labial al audio fuente proporcionado mientras asegura que el video final use esa misma pista de audio. Úsalo cuando quieras un tiempo exacto de letras o diálogos sin cambios de audio generativos. Aliméntalo con voces o diálogos limpios para obtener los mejores resultados.
  • LoraLoaderModelOnly (#234)
    • Carga el MiniMax-H3 Turbo 4-step LoRA para que el muestreador pueda convergir en muy pocos pasos. Si prefieres un desruido más lento pero potencialmente más conservador, puedes reducir la influencia de LoRA; para la máxima velocidad, mantén la fuerza predeterminada. Referencia del modelo: MiniMax-H3 Turbo LoRA.
  • SamplerCustomAdvanced (#125)
    • Realiza el desruido real usando el programador y muestreador seleccionado aguas arriba. Con el Turbo LoRA activo, puedes renderizar rápidamente con pasos mínimos; aumenta los pasos solo si ves inestabilidad en el movimiento. El control de semillas proviene de RandomNoise (#129) para tomas reproducibles.
  • Resolution Selector (Size) (#115)
    • Emite el ancho y la altura alineados al modelo para que no necesites lidiar con múltiplos o matemáticas de aspecto. Úsalo para saltar entre tamaños de vista previa, medios y finales mientras mantienes la composición consistente. Los tamaños más grandes aumentan el detalle de la identidad pero requieren más VRAM y tiempo.
  • AudioCrop (#177)
    • Recorta el audio de entrada al segmento exacto que deseas animar. Usa esto para cortar silencios o aislar un verso o un golpe de diálogo. Los puntos de entrada y salida limpios ayudan con el tiempo de apertura/cierre de la boca.
  • VHS_VideoCombine (#142)
    • Ensambla los cuadros decodificados y el audio pasante en un mp4 compartible. Usa las opciones integradas para alinear la duración con la banda sonora y para establecer convenciones de nombres de archivo. Este es tu paso de entrega final para las salidas de MiniMax H3 ComfyUI Hablar y Cantar Personaje Dual Aceleración de 4 pasos.

Extras opcionales#

  • Haz coincidir la escala y el ángulo de la cara del sujeto en ambas imágenes para minimizar la deriva de identidad.
  • Mantén los avisos concisos y visuales: distancia de la cámara, configuración, ambiente y pistas de iluminación.
  • Usa semillas de ruido al iterar para que puedas A/B cambios de manera confiable a través de tomas.
  • Si el clip se pasa un poco, habilita el recorte en el paso de combinación para una sincronización precisa de cuadros.
  • Comienza con una resolución de nivel medio, luego escala una vez que el bloqueo y el tiempo se vean bien.

Agradecimientos#

Este flujo de trabajo implementa y se basa en los siguientes trabajos y recursos. Agradecemos sinceramente a MiniMax Research por MiniMax H3, Comfy.org por el tutorial ComfyUI MiniMax H3 y a Comfy-Org y larryvrh por los pesos del modelo MiniMax-H3 y MiniMax-H3 Turbo LoRA por sus contribuciones y mantenimiento. Para obtener detalles autorizados, consulta la documentación y los repositorios originales vinculados a continuación.

Recursos#

Nota: El uso de los modelos, conjuntos de datos y código referenciados está sujeto a las licencias y términos respectivos proporcionados por sus autores y mantenedores.

RunComfy
Derechos de autor 2026 RunComfy. Todos los derechos reservados.

RunComfy es la principal ComfyUI plataforma, ofreciendo ComfyUI en línea entorno y servicios, junto con flujos de trabajo de ComfyUI con impresionantes imágenes. RunComfy también ofrece AI Models, permitiendo a los artistas aprovechar las últimas herramientas de AI para crear arte increíble.