ComfyUI>Flujos de trabajo>MiniMax H3 Todo-en-Uno | Video Rápido de Múltiples Referencias

MiniMax H3 Todo-en-Uno | Video Rápido de Múltiples Referencias

Workflow Name: RunComfy/MiniMax-H3-ComfyUI
Workflow ID: 0000...1480
Utiliza MiniMax H3 Ref2VA para convertir nueve imágenes en una toma cinematográfica. Agrega video o audio opcional para orientación. Mantienes los personajes y detalles consistentes. El sonido estéreo nativo llega con el clip. SageAttention acelera el muestreo en GPU compatibles. Las etiquetas de imagen hacen que el control sea simple. Nota: Para máquinas 2XL o más grandes, por favor configura sage_attention a deshabilitado; de lo contrario, el video generado puede aparecer borroso.

All-in-One MiniMax H3 ComfyUI Multi References Accelerated Workflow

MiniMax H3 ComfyUI Workflow | Fast Multi-Reference Video
¿Quiere ejecutar este flujo de trabajo?
  • Flujos de trabajo completamente operativos
  • Sin nodos ni modelos faltantes
  • No se requiere configuración manual
  • Presenta visuales impresionantes

All-in-One MiniMax H3 ComfyUI Multi References Accelerated Examples

Acelerado de Referencias Múltiples ComfyUI Todo-en-Uno MiniMax H3: video Ref2VA de múltiples referencias con audio estéreo sincronizado#

Este flujo de trabajo acelerado de referencias múltiples de MiniMax H3 ComfyUI todo-en-uno convierte hasta nueve referencias visuales más señales de video y audio opcionales en un clip cinematográfico corto con una banda sonora estéreo nativa. Está diseñado para creadores que desean tomas consistentes en personajes que fusionen múltiples identidades, accesorios o ubicaciones mientras mantienen etiquetas de aviso como <Picture 1> alineadas con la referencia correcta.

Construido alrededor de la pila abierta Comfy‑Org MiniMax‑H3 Ref2VA, el gráfico permite la aceleración de SageAttention para un muestreo más rápido en GPU compatibles y utiliza un modelo int8‑pruned para mantener el VRAM bajo control sin sacrificar la coherencia. El resultado es un solo lienzo listo para RunComfy para MiniMax H3 donde la guía de múltiples referencias, el tiempo, la resolución y la exportación están conectados de extremo a extremo.

Modelos clave en el flujo de trabajo acelerado de referencias múltiples ComfyUI Todo-en-Uno MiniMax H3#

  • Modelo de difusión MiniMax‑H3 Ref2VA (pruned int8 convrot). Generador central que fusiona tus referencias y aviso en latentes de video y audio conjuntos. Pesos: Comfy‑Org/MiniMax‑H3.
  • Codificador de texto-imagen-lenguaje Qwen3‑VL 32B (AWQ, empaquetado con el lanzamiento de MiniMax‑H3). Interpreta tu aviso, incluyendo etiquetas como <Picture 1>, y condiciona el generador. Los pesos están incluidos en Comfy‑Org/MiniMax‑H3.
  • VAE de Video MiniMax H3 (FP16). Decodifica latentes de video a cuadros con alta fidelidad. Pesos: Comfy‑Org/MiniMax‑H3.
  • VAE de Audio MiniMax H3 (FP32). Decodifica latentes de audio a una forma de onda estéreo limpia lista para multiplexar. Pesos: Comfy‑Org/MiniMax‑H3.

Cómo usar el flujo de trabajo acelerado de referencias múltiples ComfyUI Todo-en-Uno MiniMax H3#

A un nivel alto, cargas modelos, suministras referencias y un aviso, el flujo de trabajo construye la acondicionamiento de MiniMax‑H3, ejecuta un muestreador acelerado, luego decodifica y combina cuadros de video con el audio estéreo generado. Los grupos trabajan en secuencia: las entradas del usuario alimentan la acondicionamiento, que impulsa el muestreo; los resultados decodificados van a Exportar.

Entradas del Usuario#

Utiliza los nodos LoadImage para conectar hasta nueve referencias. Mantén un orden consistente para que las etiquetas de aviso como <Picture 1>, <Picture 2>, y así sucesivamente coincidan con las imágenes deseadas. Escribe tu escena y diálogo en el campo Input Text (Prompt), mapeando explícitamente identidades o activos a las etiquetas numeradas en la parte superior del aviso. Elige el aspecto y tamaño en Resolution Selector (Size); emite ancho y alto ajustados a un múltiplo de 32 píxeles para estabilidad. Establece la duración del clip en segundos; una expresión interna lo convierte en un conteo de cuadros cercano a 24 fps y lo alinea a un múltiplo amigable con el modelo para un muestreo suave.

Modelos#

Este grupo carga el UNet de MiniMax‑H3, el codificador de texto Qwen3‑VL 32B y ambos VAEs. El modelo Ref2VA int8‑pruned reduce la memoria mientras preserva la calidad de movimiento y sincronización labial. El codificador de texto se inicializa para MiniMax‑H3 para que las etiquetas visuales en tu aviso se vinculen a las referencias correctas. Los VAEs separados para video y audio mantienen la decodificación precisa y eficiente. Los modelos son de la misma familia utilizada por la plantilla oficial Ref2VA, adaptada aquí para control de múltiples referencias y audio conjunto. Referencia: MiniMax‑H3 R2V template.

Acondicionamiento#

MiniMaxH3ReferenceToVideo construye la acondicionamiento H3 real y un clip latente inicial. Ingresa tu CLIP, VAEs, todas las imágenes de referencia conectadas, el aviso y el ancho, alto y longitud elegidos. El nodo respeta las etiquetas de marcador de posición para que las identidades, ubicaciones y accesorios permanezcan adjuntos a las referencias correctas. Usa el modo de tamaño de referencia para mantener la composición a escala relativa a tu salida. El nodo emite una corriente de acondicionamiento positiva y un clip latente que juntos impulsan el muestreador.

Muestreo#

Antes del muestreo, el gráfico envuelve el modelo con PathchSageAttentionKJ para habilitar la aceleración de SageAttention, luego se enruta a través de un administrador de VRAM para que los clips grandes puedan caber más cómodamente. BasicGuider, BasicScheduler, y KSamplerSelect definen la estrategia de guía, el programa de pasos, y el algoritmo del muestreador. RandomNoise inicia el proceso y SamplerCustomAdvanced realiza las pasadas de eliminación de ruido contra el modelo y la acondicionamiento, produciendo latentes de video y audio refinados. El diseño equilibra la velocidad y la calidad para MiniMax‑H3 mientras mantiene las configuraciones accesibles.

Exportar#

VAEDecode y VAEDecodeAudio convierten los latentes finales en cuadros y una forma de onda estéreo. VHS_VideoCombine luego multiplexa cuadros y audio en un solo MP4 a la tasa de cuadros elegida, con un control de calidad a través de CRF y un prefijo de nombre de archivo simple para la organización. Puedes previsualizar el resultado de inmediato y guardarlo en tu carpeta de salida. Si más tarde alimentas un audio de referencia externo, el exportador puede recortar a esa longitud de pista para una alineación perfecta. El exportador proviene de la ampliamente utilizada Video Helper Suite para ComfyUI: ComfyUI‑VideoHelperSuite.

Nodos clave en el flujo de trabajo acelerado de referencias múltiples ComfyUI Todo-en-Uno MiniMax H3#

MiniMaxH3ReferenceToVideo (#136) Este es el corazón del flujo de trabajo donde las referencias, el aviso, el tamaño y la longitud se fusionan en la acondicionamiento MiniMax‑H3 y un clip latente. Ajusta el texto del prompt con asignaciones de etiquetas explícitas como <Picture 1> = character A para bloquear identidades. Ajusta width, height, y length para establecer la composición y el tiempo de ejecución; el selector ascendente y el control de duración se encargan de los múltiplos seguros. Usa el modo de tamaño de referencia para equilibrar la escala del sujeto contra el cuadro de salida. El nodo sustenta la ruta oficial de Ref2VA y está adaptado aquí para el control de múltiples referencias.

PathchSageAttentionKJ (#144) Envuelve el modelo con SageAttention para acelerar las capas de atención y reducir la presión de memoria en GPU compatibles. Deja el modo de aceleración en auto para la mayoría de las tarjetas; habilita la compilación del modelo solo si tu entorno se beneficia de ello. Si observas inestabilidad, cambia el modo a apagado para comparar el rendimiento. Fuente: ComfyUI‑KJNodes.

BasicScheduler (#124) Define el programa de sigma y los pasos totales utilizados durante la eliminación de ruido. Aumentar los pasos puede agregar detalle pero incrementa el tiempo de renderizado; empareja cualquier cambio aquí con un tipo de muestreador compatible. Mantén denoise cerca del máximo para generación pura, y considera reducirlo solo cuando realices refinamiento limitado por fuerza.

SamplerCustomAdvanced (#125) Ejecuta el bucle de difusión con el muestreador, programa y guía elegidos. El muestreador predeterminado equilibra la estabilidad temporal y la suavidad del movimiento para MiniMax‑H3. Si cambias la familia de programadores, elige un muestreador diseñado para ello para evitar artefactos.

Resolution Selector (Size) (#115) Emite ancho y alto ajustados a un múltiplo de 32 píxeles para formas amigables con la GPU. Establece megapixels para un intercambio rápido entre calidad y velocidad, y elige un aspecto como 16:9 para tomas panorámicas. Usa tamaños modestos para previsualizaciones de borrador, luego escala una vez que el tiempo y el encuadre estén bloqueados.

ComfyMathExpression (#131) Transforma los segundos solicitados en un conteo de cuadros cercano a 24 fps y lo alinea a un múltiplo que coopera con el muestreador y el modelo. Esto ayuda a evitar el parpadeo temporal y problemas de tiempo fuera de lugar. Rara vez necesitas tocarlo; controla el tiempo desde la entrada de segundos.

VHS_VideoCombine (#143) Multiplexa cuadros y el audio estéreo generado en un producto final. Establece frame_rate para que coincida con tu línea de tiempo objetivo y ajusta crf para calidad. Usa trim_to_audio cuando suministres una pista externa y quieras un corte perfecto a la longitud.

Extras opcionales#

  • Tamaños rápidos 16:9 que se renderizan rápidamente y se ven limpios: 1056×608 (0.6 MP), 1216×672 (0.8 MP), 1344×768 (0.98 MP), 1664×928 (1.5 MP), 1920×1088 (2.0 MP).
  • Mantén los avisos explícitos: comienza con un bloque de asignación que vincule <Picture 1..9> a identidades, vestuarios, accesorios o ubicaciones antes de describir la toma.
  • Para caras consistentes, utiliza imágenes nítidas, de frente, y varía solo la iluminación o el ángulo ligeramente en las referencias.
  • El diálogo y el foley funcionan bien cuando se escriben como oraciones cortas y naturales; el VAE de audio sintetizará una pista estéreo limpia a partir del latente de Ref2VA.
  • Si el VRAM es limitado, renderiza un clip más corto primero o reduce megapíxeles, luego escala o extiende una vez que estés satisfecho con el movimiento y el encuadre.
  • Este diseño sigue la línea de plantillas oficial de Ref2VA, adaptado para control de múltiples referencias y aceleración. Consulta la plantilla base para contexto: MiniMax‑H3 R2V template.

Agradecimientos#

Este flujo de trabajo implementa y se basa en los siguientes trabajos y recursos. Agradecemos a MiniMax por MiniMax H3, a Comfy-Org por los pesos del modelo MiniMax-H3 y la plantilla de flujo de trabajo MiniMax H3 R2V, y a Comfy.org por el tutorial de MiniMax H3 por sus contribuciones y mantenimiento. Para obtener detalles autorizados, consulta la documentación y los repositorios originales enlazados a continuación.

Recursos#

Nota: El uso de los modelos, conjuntos de datos y código referenciados está sujeto a las respectivas licencias y términos proporcionados por sus autores y mantenedores.

RunComfy
Derechos de autor 2026 RunComfy. Todos los derechos reservados.

RunComfy es la principal ComfyUI plataforma, ofreciendo ComfyUI en línea entorno y servicios, junto con flujos de trabajo de ComfyUI con impresionantes imágenes. RunComfy también ofrece AI Models, permitiendo a los artistas aprovechar las últimas herramientas de AI para crear arte increíble.