MiniMax H3 ComfyUI Hablar y Cantar Personaje Dual Aceleración de 4 pasos#
Este flujo de trabajo listo para RunComfy convierte dos retratos y una pista corta de discurso o canto en un solo video sincronizado con los labios donde ambos personajes comparten la escena. Construido sobre MiniMax H3 referencia-a-video con el Turbo LoRA oficial, ofrece generación de pocos pasos manteniendo ambas identidades estables y el movimiento de la boca bloqueado a tu audio fuente.
MiniMax H3 ComfyUI Hablar y Cantar Personaje Dual Aceleración de 4 pasos es ideal para duetos, diálogos de dos personas, tráilers o vistas previas rápidas de actuaciones. Traes dos imágenes y un archivo de audio, agregas un breve aviso, eliges un tamaño y el gráfico renderiza un mp4 con la banda sonora original intacta.
Modelos clave en el flujo de trabajo Comfyui MiniMax H3 ComfyUI Hablar y Cantar Personaje Dual Aceleración de 4 pasos#
- MiniMax-H3 referencia-a-video backbone de Comfy-Org — el modelo generativo que mapea tus referencias y texto en un latente audiovisual para la síntesis de video. Hugging Face: Comfy-Org/MiniMax-H3
- MiniMax-H3 Video VAE FP16 — codifica y decodifica latentes de video para que los cuadros puedan ser desruidos eficientemente y reconstruidos con fidelidad. Incluido en el paquete de modelos. Hugging Face: Comfy-Org/MiniMax-H3
- MiniMax-H3 Audio VAE FP32 — representa el audio conductor en espacio latente para que el movimiento labial y el tiempo se aprendan de tu pista. Incluido en el paquete de modelos. Hugging Face: Comfy-Org/MiniMax-H3
- Qwen3-VL 32B codificador de texto (variantes AWQ/NVFP empaquetadas para H3) — interpreta tu aviso para establecer la escena, estilo e intención de toma para la composición de personaje dual. Incluido en el paquete de modelos. Hugging Face: Comfy-Org/MiniMax-H3
- MiniMax-H3 Turbo 4-step LoRA — acelera el muestreo para que puedas renderizar con tan solo cuatro pasos de desruido mientras preservas la identidad y la sincronización labial. Hugging Face: larryvrh/MiniMax-H3-Turbo-Lora
Cómo usar Comfyui MiniMax H3 ComfyUI Hablar y Cantar Personaje Dual Aceleración de 4 pasos#
Este gráfico fluye de izquierda a derecha: cargas dos imágenes de personajes y un clip de audio, configuras el aviso y el tamaño, luego el núcleo del camino H3 fusiona las referencias y el audio en un latente AV. Una breve etapa de bloqueo de audio preserva tu banda sonora original mientras conduce el movimiento labial, y el muestreador con Turbo LoRA realiza el desruido de pocos pasos antes del ensamblaje final del video.
- Cargar Imagen (Personaje A)
- Deja una imagen fija clara y frontal para el personaje A en
LoadImage(#227). Favorece un tamaño de cabeza y una iluminación similar al personaje B para una copresencia estable. El fondo puede ser simple; la identidad y la pose son la prioridad. El nodo alimenta la pila de referencia H3 para que el modelo aprenda quién es el primer hablante en la escena compartida.
- Deja una imagen fija clara y frontal para el personaje A en
- Cargar Imagen (Personaje B)
- Proporciona el personaje B en
LoadImage(#137). Mantén el encuadre, la orientación y la expresión aproximadamente comparables al personaje A para reducir el desvío entre las tomas. Esta segunda referencia permite que H3 sintetice una toma de dos donde ambos individuos permanecen consistentes mientras hablan o cantan entre sí.
- Proporciona el personaje B en
- Cargar Audio
- Agrega tu diálogo o voces en
LoadAudio(#171). UsaAudioCrop(#177) para establecer los tiempos de inicio y fin para que la longitud del clip coincida con el segmento que deseas. El audio limpio y centrado mejora la articulación de la boca y reduce el temblor del tiempo.
- Agrega tu diálogo o voces en
- Aviso
- Describe la toma en
Input Text (Prompt)(#138). Frases cortas y cinematográficas funcionan bien, por ejemplo, describiendo la distancia de la cámara, el fondo y el ambiente para los dos personajes. El aviso dirige el diseño y el estilo sin reemplazar la guía de identidad de las imágenes fijas y el tiempo de tu pista.
- Describe la toma en
- Selector de Resolución (Tamaño)
- Elige el aspecto y el tamaño objetivo en
Resolution Selector (Size)(#115). El selector emite el ancho y la altura ya alineados a múltiplos amigables para el modelo para equilibrar el detalle y la velocidad. Una nota de tamaño incorporada ofrece preajustes de 16:9 listos para usar, para que puedas elegir un nivel de megapíxeles que se ajuste a tu presupuesto de GPU.
- Elige el aspecto y el tamaño objetivo en
- Resultado
- Los cuadros se decodifican y se combinan con el audio original en
VHS_VideoCombine(#142) para producir un mp4. Si tu renderizado es ligeramente largo o corto, usa el interruptor proporcionado en este paso para recortar a la longitud del audio. Los nombres de archivo y el formato están preconfigurados para una iteración rápida.
- Los cuadros se decodifican y se combinan con el audio original en
- Núcleo (No Modificar)
- Dentro de esta área protegida,
MiniMaxH3ReferenceToVideo(#136) fusiona ambas imágenes de referencia, el aviso y el audio recortado en un latente AV conjunto y condicionamiento positivo.VRGDG_MiniMaxH3AudioDrive(#172) bloquea el audio fuente para que la sincronización labial siga tu pista mientras la banda sonora se pasa sin cambios. El UNet está parcheado para la eficiencia de memoria, yLoraLoaderModelOnly(#234) aplica el Turbo 4-step LoRA antes de que el muestreador desruide yVAEDecodereconstruya los cuadros. Estos internos están ajustados para la estabilidad y la velocidad, por lo que generalmente no necesitas ajustarlos.
- Dentro de esta área protegida,
Nodos clave en el flujo de trabajo Comfyui MiniMax H3 ComfyUI Hablar y Cantar Personaje Dual Aceleración de 4 pasos#
MiniMaxH3ReferenceToVideo(#136)- El corazón del gráfico que ingiere ambas imágenes de personajes, tu aviso, ancho, altura y una longitud de clip calculada automáticamente. También acepta el audio recortado como referencia para que el tiempo de los fonemas y las formas visemas se alineen con la banda sonora. Si necesitas un control más ajustado, puedes ajustar directamente
prompt,width,heighto anularlengthpara tiempos especiales.
- El corazón del gráfico que ingiere ambas imágenes de personajes, tu aviso, ancho, altura y una longitud de clip calculada automáticamente. También acepta el audio recortado como referencia para que el tiempo de los fonemas y las formas visemas se alineen con la banda sonora. Si necesitas un control más ajustado, puedes ajustar directamente
VRGDG_MiniMaxH3AudioDrive(#172)- Bloquea el movimiento labial al audio fuente proporcionado mientras asegura que el video final use esa misma pista de audio. Úsalo cuando quieras un tiempo exacto de letras o diálogos sin cambios de audio generativos. Aliméntalo con voces o diálogos limpios para obtener los mejores resultados.
LoraLoaderModelOnly(#234)- Carga el MiniMax-H3 Turbo 4-step LoRA para que el muestreador pueda convergir en muy pocos pasos. Si prefieres un desruido más lento pero potencialmente más conservador, puedes reducir la influencia de LoRA; para la máxima velocidad, mantén la fuerza predeterminada. Referencia del modelo: MiniMax-H3 Turbo LoRA.
SamplerCustomAdvanced(#125)- Realiza el desruido real usando el programador y muestreador seleccionado aguas arriba. Con el Turbo LoRA activo, puedes renderizar rápidamente con pasos mínimos; aumenta los pasos solo si ves inestabilidad en el movimiento. El control de semillas proviene de
RandomNoise(#129) para tomas reproducibles.
- Realiza el desruido real usando el programador y muestreador seleccionado aguas arriba. Con el Turbo LoRA activo, puedes renderizar rápidamente con pasos mínimos; aumenta los pasos solo si ves inestabilidad en el movimiento. El control de semillas proviene de
Resolution Selector (Size)(#115)- Emite el ancho y la altura alineados al modelo para que no necesites lidiar con múltiplos o matemáticas de aspecto. Úsalo para saltar entre tamaños de vista previa, medios y finales mientras mantienes la composición consistente. Los tamaños más grandes aumentan el detalle de la identidad pero requieren más VRAM y tiempo.
AudioCrop(#177)- Recorta el audio de entrada al segmento exacto que deseas animar. Usa esto para cortar silencios o aislar un verso o un golpe de diálogo. Los puntos de entrada y salida limpios ayudan con el tiempo de apertura/cierre de la boca.
VHS_VideoCombine(#142)- Ensambla los cuadros decodificados y el audio pasante en un mp4 compartible. Usa las opciones integradas para alinear la duración con la banda sonora y para establecer convenciones de nombres de archivo. Este es tu paso de entrega final para las salidas de MiniMax H3 ComfyUI Hablar y Cantar Personaje Dual Aceleración de 4 pasos.
Extras opcionales#
- Haz coincidir la escala y el ángulo de la cara del sujeto en ambas imágenes para minimizar la deriva de identidad.
- Mantén los avisos concisos y visuales: distancia de la cámara, configuración, ambiente y pistas de iluminación.
- Usa semillas de ruido al iterar para que puedas A/B cambios de manera confiable a través de tomas.
- Si el clip se pasa un poco, habilita el recorte en el paso de combinación para una sincronización precisa de cuadros.
- Comienza con una resolución de nivel medio, luego escala una vez que el bloqueo y el tiempo se vean bien.
Agradecimientos#
Este flujo de trabajo implementa y se basa en los siguientes trabajos y recursos. Agradecemos sinceramente a MiniMax Research por MiniMax H3, Comfy.org por el tutorial ComfyUI MiniMax H3 y a Comfy-Org y larryvrh por los pesos del modelo MiniMax-H3 y MiniMax-H3 Turbo LoRA por sus contribuciones y mantenimiento. Para obtener detalles autorizados, consulta la documentación y los repositorios originales vinculados a continuación.
Recursos#
- Anuncio oficial de MiniMax Research/MiniMax H3
- Documentos / Notas de lanzamiento: MiniMax H3 anuncio oficial
- Tutorial de Comfy.org/MiniMax H3
- GitHub: Comfy-Org/docs
- Documentos / Notas de lanzamiento: Comfy.org tutorial MiniMax H3
- Pesos del modelo Comfy-Org/MiniMax-H3
- GitHub: Comfy-Org/workflow_templates
- Hugging Face: Comfy-Org/MiniMax-H3
- larryvrh/MiniMax-H3 Turbo LoRA
- GitHub: Larryvrh/ComfyUI-MiniMax-H3-Turbo
- Hugging Face: larryvrh/MiniMax-H3-Turbo-Lora
Nota: El uso de los modelos, conjuntos de datos y código referenciados está sujeto a las licencias y términos respectivos proporcionados por sus autores y mantenedores.


