ComfyUI>Flujos de trabajo>MiniMax H3 Muestreo Dual de Alta Calidad R2V

MiniMax H3 Muestreo Dual de Alta Calidad R2V

Workflow Name: RunComfy/MiniMax-H3-Dual
Workflow ID: 0000...1503
Convierte múltiples imágenes de referencia en videos cinematográficos cortos. Mantienes personajes y productos consistentes en todos los planos. El muestreo dual equilibra el detalle y el movimiento suave. El audio nativo permanece sincronizado. Un LoRA turbo de 4 pasos acelera la generación. El gráfico MiniMax H3 preconfigurado ahorra tiempo de configuración.

ComfyUI MiniMax H3 High Quality Dual-Sampling workflow Workflow

MiniMax H3 Dual-Sampling Workflow | Ref2VA + Turbo LoRA
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

ComfyUI MiniMax H3 High Quality Dual-Sampling workflow Examples

MiniMax H3 Flujo de Trabajo de Muestreo Dual de Alta Calidad: video de múltiples referencias con audio nativo sincronizado#

El flujo de trabajo de muestreo dual de alta calidad MiniMax H3 es un gráfico de referencia a video listo para RunComfy que convierte múltiples referencias de imagen y señales opcionales de video o audio en clips cinematográficos cortos con audio nativo generado en la misma pasada. Equilibra la retención de identidad, el movimiento estable y el detalle nítido combinando un programa de muestreo dual, atención H3 eficiente en memoria, VAEs dedicados para video y audio, y un camino turbo LoRA de 4 pasos.

Diseñado para creadores que necesitan continuidad entre productos o personajes, este flujo de trabajo de muestreo dual de alta calidad MiniMax H3 te permite definir sujetos, escenas y sonido en un solo aviso, luego produce salidas de video H3 pulidas sin reconstruir un gráfico. Alimenta un conjunto de imágenes fijas, inserta una referencia de estilo de audio y exporta un MP4 listo para compartir.

Modelos clave en el flujo de trabajo de muestreo dual de alta calidad MiniMax H3 de ComfyUI#

  • Modelo de difusión de referencia a video MiniMax H3 (Ref2VA). Generador principal que convierte referencias más texto en un latente audiovisual, impulsando tanto los fotogramas como el audio nativo. Consulta el paquete de modelos y pesos en los repositorios oficiales: MiniMaxAI/MiniMax-H3 y Comfy-Org/MiniMax-H3.
  • Codificador de texto Qwen3-VL 32B ajustado para MiniMax H3. Interpreta avisos estructurados que describen sujetos, tomas y sonido, luego condiciona el H3 UNet a través de incrustaciones de estilo CLIP incluidas en el paquete de modelos de Comfy-Org: Comfy-Org/MiniMax-H3.
  • VAE de video MiniMax H3. Comprime y decodifica latentes de video para una generación de fotogramas de alta calidad eficiente, enviado con la versión de Comfy-Org: Comfy-Org/MiniMax-H3.
  • VAE de audio MiniMax H3. Codifica y decodifica latentes de audio nativos para que el habla y el ambiente se produzcan y sincronicen dentro de la misma canalización: Comfy-Org/MiniMax-H3.
  • LoRA Turbo de 4 pasos MiniMax H3. Un camino de refinamiento ligero que mejora el detalle y la estabilidad temporal manteniendo un tiempo de ejecución rápido. Se apila sobre el modelo base H3 Ref2VA en este flujo de trabajo.

Cómo usar el flujo de trabajo de muestreo dual de alta calidad MiniMax H3 de ComfyUI#

Este gráfico está organizado en grupos claros que transfieren el trabajo desde referencias y avisos, a través del muestreo H3, hasta la decodificación y exportación MP4. El muestreo dual primero establece movimiento y estructura, luego refina el detalle y el audio mientras preserva las identidades.

Área de Referencia#

Carga hasta nueve referencias fijas para personas, objetos o entornos. Estas alimentan el nodo de referencia a video H3 para que el modelo pueda fijarse en la identidad, vestuario y elementos de escena. También puedes enrutar un clip corto como referencia visual si lo deseas. Usa referencias que ya coincidan con la perspectiva o iluminación objetivo para mejor retención. Si traes un lote o hoja de sprites, GetImageRangeFromBatch (#40) puede extraer los fotogramas que deseas usar aguas abajo.

Área de Referencia de Video#

Si prefieres comenzar desde un video de referencia, usa el cargador de video para extraer fotogramas y opcionalmente limitar la duración. GetImageRangeFromBatch (#40) selecciona una porción continua para que el flujo de trabajo permanezca ligero. Estos fotogramas actúan como guía estructural o de movimiento para la primera pasada de H3. Puedes mezclar video con imágenes fijas; el codificador H3 los fusiona antes del muestreo.

Área de Referencia de Audio#

Carga de uno a tres fragmentos de audio cortos para guiar el timbre de voz, cadencia o ambiente. Estos no se copian literalmente; en cambio, dan forma al latente de audio para que el discurso o el paisaje sonoro final sigan el mismo estilo. Para líneas habladas, funcionan mejor clips de voz cortos y limpios con mínimo fondo. Si omites el audio, el flujo de trabajo aún genera un ambiente plausible a partir del aviso.

modelo#

Este grupo conecta el H3 UNet, el codificador de texto basado en Qwen, y ambos VAEs, luego aplica un parche de atención eficiente en memoria. El Lora Loader Stack (rgthree) (#118) agrega el LoRA turbo de 4 pasos para que obtengas mayor detalle sin largos horarios. El nodo de parche de atención reduce la presión de VRAM, lo que es útil en resoluciones más grandes. Juntos preparan la pila de condicionamiento que utilizarán los muestreadores.

Muestreo#

MiniMaxH3ReferenceToVideo (#56) es donde tu aviso, referencias y resolución se combinan para producir el condicionamiento y un latente audiovisual inicial. El nodo lee las secciones de aviso estructuradas como subject_definitions, summary, retention_analysis, detailed_description, overall_soundscape, y non_diegetic_music. Aquí se establece una guía básica y una elección de muestreador para mantener la configuración simple mientras se permite un control fuerte. Piensa en esto como el área de preparación antes de que los refinadores de muestreo dual tomen el control.

Sigmas#

Un programador corto produce el programa sigma, que luego se divide para impulsar la estructura de muestreo dual. Una rama enfatiza la estabilidad y el movimiento grueso, mientras que la otra enfatiza el detalle de alta frecuencia y la nitidez. Un pequeño interruptor booleano te permite extender o evitar una región intermedia cuando necesitas más limpieza en tomas difíciles. No necesitas ajustar números aquí; solo elige si habilitar el rango extendido cuando caras o logotipos necesiten más fidelidad.

SamplerCustomAdvanced#

La primera pasada de SamplerCustomAdvanced (#108) se ejecuta en un rango sigma más bajo para establecer el diseño, identidades, y ritmo de movimiento. Luego, el latente se separa en video y audio, y el latente de video se puede escalar ligeramente en el espacio latente para agregar margen para detalles. La segunda pasada de SamplerCustomAdvanced (#103) utiliza una porción sigma más alta para afilar bordes y texturas respetando la guía de la primera pasada. Una pasada complementaria SamplerCustomAdvanced (#106) puede descomponer o preservar regiones selectivamente, y un nodo de interruptor decide el mejor latente final antes de la decodificación. Esta danza de dos pasadas es lo que da al flujo de trabajo de muestreo dual de alta calidad MiniMax H3 su mezcla confiable de estabilidad y detalle nítido.

Nodos de Aceleración#

Para GPUs con VRAM ajustada, UniBlockSwap ayuda intercambiando temporalmente bloques UNet a la memoria del sistema, y VRAMReserver mantiene suficiente espacio para la decodificación y el multiplexado final. Estos ayudantes de velocidad y memoria tienen un impacto mínimo en la calidad y se pueden activar cuando ves advertencias de falta de memoria. Manténlos cerca de la ruta del UNet como se cablea en el gráfico.

Guardar Video#

El latente final es decodificado por los VAEs dedicados de video y audio, luego PixaromaSaveMp4 (#115) mezcla fotogramas y audio en un MP4. Establece tu tasa de fotogramas objetivo aquí y elige si recortar el video a la longitud del audio generado. El prefijo del nombre de archivo y la subcarpeta facilitan mantener las tomas organizadas. Cuando vuelvas a ejecutar con una nueva semilla o referencias, las salidas se apilarán en la misma carpeta.

Nodos clave en el flujo de trabajo de muestreo dual de alta calidad MiniMax H3 de ComfyUI#

MiniMaxH3ReferenceToVideo (#56)#

Fusiona texto, imagen, y referencias opcionales de video o audio en un condicionamiento y un latente audiovisual inicial para H3. Ajusta prompt para definir sujetos, continuidad de escena, sincronización de tomas, y diseño de sonido, y establece width, height, y length para el aspecto y la duración objetivo. Usa múltiples imágenes de referencia para fijar identidad y vestuario cuando la continuidad importa.

Lora Loader Stack (rgthree) (#118)#

Aplica el LoRA turbo de 4 pasos MiniMax H3 sobre el modelo base para mejorar el detalle en horarios cortos. Ajusta la fuerza de LoRA si los bordes se vuelven demasiado afilados o si el estilo del modelo base está siendo anulado. Mantén el apilamiento de LoRA mínimo cuando las referencias ya llevan una textura fuerte.

MiniMaxH3MemoryEfficientSageAttentionPatch (#70)#

Habilita la atención eficiente en memoria para el H3 UNet para que puedas ejecutar resoluciones más altas o clips más largos en GPUs modestas. Actívalo para tarjetas de 8 a 12 GB o cuando veas picos de VRAM. Desactívalo solo si estás evaluando el rendimiento bruto en GPUs de alta memoria.

SplitSigmas (#99)#

Divide el programador en bandas sigma complementarias que alimentan las dos pasadas de muestreador. Si tu escena es estable pero carece de mordida, cambia más peso a la rama de alta sigma. Si el movimiento tiembla o las identidades se desplazan, favorece la rama de baja sigma y mantén el interruptor intermedio extendido apagado.

SamplerCustomAdvanced (#108)#

Muestreador de primera pasada que establece estructura, movimiento, e identidad. Mantén la guía consistente con tu aviso y referencias para que la segunda pasada tenga una base limpia. Usa esta pasada para probar semillas y encuadres rápidamente antes de comprometerte con el refinamiento.

SamplerCustomAdvanced (#103)#

Muestreador de refinamiento que usa una porción sigma más alta para mejorar el detalle y corregir bordes. Funciona mejor después de una sólida primera pasada; evita sobrecargarlo cuando las caras o logotipos comienzan a sobresalir demasiado. Combínalo con escalado latente solo cuando necesites margen adicional de textura.

ComfySwitchNode (#107)#

Elige entre refinamientos latentes alternativos después del muestreo dual. Actívalo al comparar resultados de la rama auxiliar de descomposición vs la rama de refinamiento directo. Mantén una nota de qué camino retiene mejor la identidad para tu conjunto de sujetos.

PixaromaSaveMp4 (#115)#

Mezcla fotogramas decodificados y audio a MP4. Establece fps para coincidir con la sensación de tu movimiento y usa trim_to_audio para una sincronización audiovisual ajustada. Actualiza el filename_prefix para mantener las tomas organizadas por plano o sujeto.

Extras opcionales#

  • Comienza desde la plantilla oficial H3 R2V para aprender el patrón básico antes de personalizar este gráfico: Comfy-Org workflow template.
  • Usa ResolutionSelector (#73) para elegir un aspecto y un objetivo de megapíxeles que tu GPU pueda manejar, luego aumenta gradualmente una vez que el encuadre se vea bien.
  • Aviso en secciones estructuradas que el modelo entiende: subject_definitions, summary, retention_analysis, detailed_description, overall_soundscape, non_diegetic_music. Este estilo le da a H3 restricciones más claras.
  • Para tomas críticas de identidad, proporciona de 3 a 5 imágenes fijas de alta calidad del mismo sujeto con iluminación y ángulo coincidentes. Evita filtros pesados en las referencias.
  • Proporciona un clip de estilo de voz limpio de 1 a 5 segundos como referencia de audio para un timbre consistente entre personajes. Mantén el ruido y la música bajos.
  • Si alcanzas los límites de VRAM, habilita el parche de atención y el grupo de nodos de aceleración. Baja la resolución primero, luego la longitud.
  • Cuando el movimiento está bien pero las texturas son suaves, mantén la primera pasada tal cual y aumenta la dependencia de la segunda rama de muestreador en lugar de extender los pasos generales.
  • Guarda versiones a menudo. Los pequeños cambios en el aviso tienen grandes efectos porque el flujo de trabajo de muestreo dual de alta calidad MiniMax H3 condiciona tanto el video como el audio juntos.

Agradecimientos#

Este flujo de trabajo implementa y se basa en los siguientes trabajos y recursos. Agradecemos sinceramente a MiniMaxAI por el modelo MiniMax-H3, Comfy-Org/Comfy.org por las plantillas, pesos, y tutorial de ComfyUI para MiniMax H3, y RunningHub.ai por la referencia de flujo de trabajo por sus contribuciones y mantenimiento. Para obtener detalles autorizados, consulte la documentación original y los repositorios enlazados a continuación.

Recursos#

Nota: El uso de los modelos, conjuntos de datos y código referenciados está sujeto a las respectivas licencias y términos proporcionados por sus autores y mantenedores.

RunComfy
Derechos de autor 2026 RunComfy. Todos los derechos reservados.

RunComfy es la principal ComfyUI plataforma, ofreciendo ComfyUI en línea entorno y servicios, junto con flujos de trabajo de ComfyUI con impresionantes imágenes. RunComfy también ofrece AI Models, permitiendo a los artistas aprovechar las últimas herramientas de AI para crear arte increíble.