ComfyUI>Flujos de trabajo>MiniMax H3 Fun Control | Preciso de Imagen a Video

MiniMax H3 Fun Control | Preciso de Imagen a Video

Workflow Name: RunComfy/MiniMax-H3-Control
Workflow ID: 0000...1506
Convierte una imagen de referencia en un video controlado. Mantén la identidad, el atuendo y la escena de tu sujeto consistentes. Guía el movimiento con H3 Fun ControlNet. Elige ramas de control único o profundidad más pose. Usa SolAttn opcional para ejecuciones más rápidas. Crea caminatas limpias, giros, saludos y movimiento de cuerpo completo.

ComfyUI MiniMax H3 Fun Control Workflow

MiniMax H3 Fun Control in ComfyUI | Depth and Pose Video
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

ComfyUI MiniMax H3 Fun Control Examples

MiniMax H3 Fun Control: generación de video controlable de imagen de referencia en ComfyUI#

Este lienzo listo para RunComfy lleva MiniMax H3 Fun Control a ComfyUI para video de imagen a video preciso y prompteable. Sigue tu pase de estructura (profundidad, canny, pose, HED o MLSD) mientras respeta una referencia de primer cuadro o referencias completas de personaje/estilo. El diseño predeterminado se envía con tres ramas listas para ejecutar para que puedas comenzar de manera simple y escalar el control según sea necesario.

El Gráfico 1 ejecuta un flujo de control único y está habilitado por defecto. El Gráfico 2 añade una configuración de profundidad más pose encadenada con referencias de personaje/estilo y un prompting negativo verdadero. El Gráfico 3 refleja el Gráfico 2 pero incluye un parche opcional de aceleración SolAttn. Puedes habilitar o omitir cualquier rama preparada después de cargar el flujo de trabajo.

Modelos clave en el flujo de trabajo Comfyui MiniMax H3 Fun Control#

  • MiniMax H3 base UNet (fl2va) y UNet de referencia a video (ref2va). Estos son los pilares de video que sintetizan el movimiento ya sea desde un prompt y primer cuadro (fl2va) o desde referencias de imagen persistentes (ref2va). Los pesos empaquetados por la comunidad para ComfyUI están disponibles en el conjunto experimental MiniMax H3 en Hugging Face: MiniMax-H3-experimental.
  • MiniMax H3 Video VAE y Audio VAE. Estos codifican y decodifican los flujos de video y audio latentes utilizados por H3 para que la tubería pueda muestrear eficientemente y luego convertir los resultados de nuevo en píxeles y sonido. Consulta el mismo paquete de modelos: MiniMax-H3-experimental.
  • Codificador de texto familia Qwen-VL. El flujo de trabajo utiliza una variante ajustada por MiniMax de la serie Qwen-VL para analizar prompts y alimentar el acondicionamiento de texto en H3. Para información de fondo sobre esta familia de modelos, consulta el repositorio oficial: Qwen2-VL.
  • MiniMax H3 Fun ControlNet Union (forma de curva). Este ControlNet único admite múltiples pases de control (profundidad, canny, HED, pose, MLSD) y te permite dirigir la estructura de la escena a través de los cuadros. Utiliza el checkpoint de forma de curva de la versión oficial: MiniMax-H3-Fun-Controlnet-Union.

Cómo usar el flujo de trabajo Comfyui MiniMax H3 Fun Control#

El lienzo contiene tres ramas preparadas. El Gráfico 1 (control único) está habilitado, el Gráfico 2 (profundidad+pose con referencias) y el Gráfico 3 (aceleración SolAttn) están omitidos. Activa una rama cuando estés listo; solo la rama habilitada se ejecutará.

01 · Control Único · HABILITADO POR DEFECTO#

01 · Modelos Este grupo carga el MiniMax H3 base UNet, el codificador de texto Qwen-VL y los H3 VAEs para video y audio. También carga el MiniMax H3 Fun ControlNet Union en forma de curva para que un flujo de control único pueda guiar la estructura. No necesitas cambiar nada aquí a menos que quieras intercambiar pesos de un conjunto de checkpoints diferente.

01 · CONTROL: este es el nodo Carga un video de control que coincida con el ancho, la altura y el conteo de cuadros de salida deseados; el nodo verifica y aumentará ambos números si no están de acuerdo. Elige cualquiera de los pases compatibles (profundidad, canny, pose, HED, MLSD) según lo que mejor capture tu movimiento y siluetas. La fuerza actúa como un presupuesto de adherencia; 1.0 es el punto de partida correcto para un control único, y empujar más alto tiende a saturar el detalle. La ventana de programación de control define cuándo el control está activo durante el muestreo; terminar la ventana alrededor de 0.6 a menudo bloquea la estructura temprano mientras libera los pasos tardíos para agregar textura fina. Usa el checkpoint ControlNet en forma de curva; la variante de ancho completo no se cargará en este nodo.

01 · Acondicionamiento Escribe tu prompt y opcionalmente proporciona un primer cuadro. Con un primer cuadro, el modelo se inicializa desde esa imagen y tiende a preservar la composición; sin él, solo el prompt dirige el aspecto. Establece ancho, altura y longitud aquí; MiniMax H3 ajusta la longitud a su cuadrícula válida a 24 fps (17n + 5), así que planifica tu edición alrededor de esos conteos. Dejar los primeros y últimos cuadros sin establecer utiliza el inicio y fin naturales del modelo; no se requiere agregar un último cuadro para esta rama.

01 · Muestreo El muestreador se ejecuta con un guía básico que no tiene CFG y sin entrada negativa, lo que significa que los negativos en tu texto se ignoran aquí; usa el Gráfico 2 o cambia a un guía CFG si necesitas negativos. Se aplica un cambio de sigma para equilibrar los horarios de difusión de video y audio para una decodificación estable más adelante. La elección de horario y muestreador en esta rama está ajustada para compensaciones sensatas de calidad a velocidad; una vez que tengas una línea base, siéntete libre de experimentar.

01 · Salida Los latentes muestreados se decodifican con el H3 Video VAE y, si está presente, el Audio VAE. Los cuadros y el audio se multiplexan en un video y se guardan en tus salidas. Usa el resultado guardado como una verificación de estilo y vuelve a la fuerza de control, ventana de programación o prompt según sea necesario.

02 · Referencia de Profundidad + Pose · OMITIDO POR DEFECTO#

02 · Modelos Esta rama carga el H3 UNet de referencia a video, que está diseñado para mantener la identidad y el estilo de imágenes fijas a través de cada cuadro. Comparte el codificador de texto Qwen-VL y los H3 VAEs. El MiniMax H3 Fun ControlNet Union en forma de curva se reutiliza aquí para dirigir la estructura.

02 · CONTROL: encadenado, las fuerzas SUMAN alrededor de 1.0 Dos nodos Apply están encadenados para que cada flujo de control añada su propia contribución, primero profundidad y luego pose. Trata la fuerza como un presupuesto: las dos fuerzas se suman, y empujar el total muy por encima de 1.0 lavará el detalle y manchará el sujeto. La profundidad es excelente para geometría gruesa y colocación de cámara; la pose bloquea las extremidades y la articulación. Ajusta configurando una fuerza a cero y escuchando a la otra, luego júntalas cerca de un total de 1.0.

02 · Acondicionamiento y referencias Usa MiniMaxH3ReferenceToVideo para alimentar imágenes de referencia reales junto con tu prompt para que la identidad y el estilo persistan a través de todos los cuadros. ref_image_size de max da la identidad más fuerte (tokens de referencia más grandes) a un costo de cómputo; match es más rápido y a menudo suficiente para un control de estilo más suelto. Añade una rama negativa con las mismas referencias y tu texto negativo para que el guía CFG pueda restar lo que no deseas. La longitud, tamaño y conteo de cuadros siguen las mismas reglas que el Gráfico 1.

02 · Muestreo Cambia a un CFGGuider para que el acondicionamiento negativo realmente se aplique; la guía añade costo porque el modelo evalúa tanto positivo como negativo en cada paso. Los pasos se establecen más altos aquí para dar espacio a los controles encadenados y referencias para resolver; puedes recortar para velocidad una vez que te guste el aspecto. El control de semilla permite la reproducibilidad; mantenlo fijo mientras equilibras el presupuesto de profundidad y pose.

02 · Salida La decodificación y ensamblaje de video reflejan el Gráfico 1. Si la salida coincide con la estructura pero parece demasiado suavizada, reduce el final de la ventana de control hacia 0.6 o baja ligeramente la fuerza total de control. Si la identidad se desliza, aumenta ref_image_size o añade una segunda imagen de referencia.

03 · Aceleración Sol-Attn Opcional · OMITIDO POR DEFECTO#

03 · Modelos Esta rama refleja los modelos y controles del Gráfico 2 pero añade un parche de aceleración de atención dispersa. Requiere la extensión SolAttn Triton. Si no tienes Triton o el paquete de nodos instalado, deja esta rama omitida.

03 · CONTROL: encadenado, las fuerzas SUMAN alrededor de 1.0 Se aplica la misma cadena de profundidad más pose; mantén la fuerza combinada cerca de 1.0 para resultados nítidos. Usa el mismo enfoque de ajuste que el Gráfico 2 para encontrar la división que mejor se adapte a tu toma y tamaño del sujeto.

03 · Acondicionamiento y referencias Idéntico al Gráfico 2. Mantén las referencias consistentes en las ramas positiva y negativa para que CFG reste las características correctas. Si deseas la máxima identidad, combina ref_image_size: max con un conteo de pasos ligeramente más alto.

03 · OPCIONAL: atención dispersa SolAttnPatch acelera los bloques pesados en atención mientras preserva la calidad donde más importa. Deja morton desactivado, porque reordenar tokens de video en orden Z desalinearía donde ControlNet aplica sus desplazamientos por filas y efectivamente eliminaría el control. Mantener los primeros y últimos bloques de transformadores exactos es un valor seguro cuando quieres velocidad sin perder adherencia. Espera ejecuciones más rápidas después de que Triton compile sus kernels; el primer pase mide principalmente el tiempo de compilación.

03 · Muestreo y Salida El muestreo, decodificación y guardado siguen el Gráfico 2. Compara SolAttn activado versus desactivado con una semilla fija para juzgar calidad y adherencia para tu contenido. Si el control parece más débil con SolAttn, verifica que morton esté desactivado antes de ajustar las fuerzas.

Nodos clave en el flujo de trabajo Comfyui MiniMax H3 Fun Control#

Apply H3 Fun ControlNet (#23) Añade un flujo de control al modelo actual y toma un lote de cuadros de control extraídos de tu video de control. Usa strength como un presupuesto de adherencia: para un control único comienza en 1.0; cuando encadenes controles mantén la suma cerca de 1.0 para evitar detalles deslavados. La ventana de programación (start_percent, end_percent) determina cuándo el control está activo; terminar cerca de 0.6 a menudo preserva texturas que el control no puede describir.

Prompt + primer cuadro -> acondicionamiento (#31) Construye el acondicionamiento desde tu prompt de texto y un primer cuadro opcional para que el modelo respete la composición inicial. Si omites el primer cuadro, solo el prompt guía el contenido. Ancho, altura y longitud viven aquí; H3 acepta longitudes en su cuadrícula 17n + 5 a 24 fps, así que planifica ediciones para esas duraciones.

Positivo: referencias + prompt (#1031) Alimenta referencias de imagen persistentes y texto de prompt en H3 para que la identidad y el estilo se mantengan a través de cada cuadro. ref_image_size de max utiliza tokens más grandes para una identidad más fuerte a mayor costo; match es más rápido con una presión de identidad más ligera. Empareja esto con una rama negativa y CFGGuider si necesitas exclusiones fuertes.

CFGGuider: el negativo solo funciona aquí (#1040) Habilita la guía sin clasificador para que el acondicionamiento negativo tenga efecto. Una guía más alta fortalece la adherencia al prompt y referencia pero aumenta el cómputo porque cada paso ejecuta tanto positivo como negativo. Para guiones de estilo largos y específicos, un cfg moderado puede mejorar significativamente la adherencia; prueba lado a lado con una semilla fija.

Cambio de sigma (video 12 / audio 3) (#24) Ajusta los horarios de difusión para dar al camino de video y al camino de audio perfiles sigma apropiados antes del muestreo. Mantén esto en la cadena cuando planees decodificar audio para que el Audio VAE reciba una distribución latente compatible.

Sol-Attn (OPCIONAL, necesita el paquete de nodos SolAttn + Triton) (#2060) Aplica kernels de atención dispersa para acelerar H3 sin cambiar el gráfico. Deja morton desactivado; habilitarlo reordena los tokens y hace que la contribución del ControlNet no alcance las filas previstas, lo que parece una salida perfecta que simplemente ignora el control. Para aceleraciones conservadoras, mantén los primeros y últimos bloques de transformadores exactos y perfila después de la compilación de Triton.

BasicScheduler (#42) Proporciona el horario de sigma y el conteo de pasos para el muestreo. Para tomas controladas de cerca, unos pasos más pueden ayudar a estabilizar la estructura antes de que el control se desvanezca; para pases de estilo rápidos, recorta pasos para ahorrar tiempo. Combina ajustes de programador con la ventana de control para equilibrar adherencia y textura.

Extras opcionales#

  • El video de control debe coincidir exactamente con el ancho, altura y conteo de cuadros de generación; el nodo verifica y aumenta ambos números si difieren.
  • Usa el checkpoint ControlNet en forma de curva; la versión de ancho completo original no se cargará en H3FunControlLoader.
  • Si tu pase de control tiene áreas grandes sin rasgos, termina la ventana de control cerca de 0.6 para que los pasos tardíos puedan agregar textura del prompt.
  • Para clips críticos de identidad, prefiere el Gráfico 2 o el Gráfico 3 con MiniMaxH3ReferenceToVideo y considera ref_image_size: max.
  • ¿Necesitas negativos en el Gráfico 1? Cambia a un CFGGuider o muévete al Gráfico 2/3 donde la rama negativa ya está conectada.
  • Recursos del proyecto: nodo personalizado ComfyUI-H3-FunControl, ControlNet en forma de curva MiniMax-H3-Fun-Controlnet-Union, pesos H3 de la comunidad MiniMax-H3-experimental, aceleración opcional ComfyUI-SolAttn_triton.

Agradecimientos#

Este flujo de trabajo implementa y se basa en los siguientes trabajos y recursos. Agradecemos profundamente a wyzborrero por el nodo personalizado ComfyUI-H3-FunControl, alibaba-pai por el modelo MiniMax H3 Fun ControlNet Union, Kijai por los archivos de modelo experimental MiniMax H3, kijai por el nodo opcional de aceleración SolAttn Triton, y RunComfy por el flujo de trabajo Cloud Save por sus contribuciones y mantenimiento. Para obtener detalles autorizados, consulta la documentación y los repositorios originales vinculados a continuación.

Recursos#

696516e3a4e5)

Nota: El uso de los modelos, conjuntos de datos y código referenciados está sujeto a las licencias y términos respectivos proporcionados por sus autores y mantenedores.

RunComfy
Derechos de autor 2026 RunComfy. Todos los derechos reservados.

RunComfy es la principal ComfyUI plataforma, ofreciendo ComfyUI en línea entorno y servicios, junto con flujos de trabajo de ComfyUI con impresionantes imágenes. RunComfy también ofrece AI Models, permitiendo a los artistas aprovechar las últimas herramientas de AI para crear arte increíble.