ComfyUI>Flujos de trabajo>MiniMax H3 Escenas de Acción | Video de Acción Guiado

MiniMax H3 Escenas de Acción | Video de Acción Guiado

Workflow Name: RunComfy/MiniMax-H3-Action
Workflow ID: 0000...1527
Convierte dos imágenes de personajes y una referencia de escena en un video de acción. Obtienes audio nativo y personajes guiados por identidad. Estructura las indicaciones para controlar la coreografía. El muestreo en dos etapas refina el movimiento. Crea clips de combate de espadas, boxeo o ciencia ficción. Revisa el contacto rápido de manos y armas para detectar artefactos.

ComfyUI MiniMax H3 Action Scenes Workflow

MiniMax H3 Action Scenes | Reference Video + Native Audio
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

ComfyUI MiniMax H3 Action Scenes Examples

MiniMax H3 Escenas de Acción: Generador de videos de acción guiados por referencia con audio nativo#

MiniMax H3 Escenas de Acción es un flujo de trabajo de ComfyUI para crear videos de acción dirigidos y guiados por referencia con audio nativo sincronizado. Proporcionas dos imágenes de personajes, una referencia de escena y una indicación estructurada. El flujo de trabajo organiza el movimiento con MiniMax H3 Turbo, luego refina la composición y la legibilidad del combate con LMS y Combat LoRAs mientras preserva el audio original. Las salidas incluyen un video "base" de primera pasada rápida y un video "refinado" de mayor fidelidad.

Este flujo de trabajo de ComfyUI MiniMax H3 Escenas de Acción está diseñado para previz, diseño de acrobacias y combates, cinematografía de juegos y efectos visuales, y clips sociales cortos. Los ejemplos probados incluyen esgrima en castillos, trabajo de guantes de boxeo en gimnasios y un ejercicio de bastón en una nave espacial. Mantén la identidad del personaje y la coreografía explícitas en la indicación, y revisa el contacto rápido de manos o armas para posibles artefactos.

Modelos clave en el flujo de trabajo de ComfyUI MiniMax H3 Escenas de Acción#

  • Comfy-Org MiniMax H3 núcleo suite. Proporciona el codificador de texto más los VAEs de video y audio utilizados para construir, separar y decodificar el latente conjunto de audio-video. Ver modelos y LoRAs en la colección oficial. Modelos MiniMax-H3
  • Minimax-h3 Singularity (UNet). Sirve como el generador base de ref-a-video que fusiona referencias e indicación en un latente de audio-video para escenas de acción. Minimax-h3_Singularity
  • MiniMax-H3 Turbo LoRA. Acelera la primera pasada para que puedas iterar rápidamente en los ritmos de movimiento antes de refinarlos. Incluido en la colección oficial MiniMax H3. MiniMax-H3 LoRAs
  • MiniMax-H3 LMS LoRA. Añade disposición, materiales y nitidez estructural adecuada para salidas de estilo de acción en vivo; utilizado durante la segunda pasada. LMS LoRA r64
  • H3 Combat LoRA. Mejora la claridad de las siluetas de combate, los contactos de espada y el trabajo de pies en escenarios de acción. Incluido en la colección MiniMax H3. Modelos MiniMax-H3
  • H3 Latent Upscaler LMS. Un escalador temporal 3D que amplía el latente de video entre pasadas mientras mantiene la continuidad del movimiento. Comfyui Minimax H3 Latent Upscaler

Cómo usar el flujo de trabajo de ComfyUI MiniMax H3 Escenas de Acción#

La tubería se ejecuta en dos pasadas coordinadas. La Pasada 1 establece el movimiento y el tiempo con Turbo para la velocidad. El latente de video luego se escala y refina en la Pasada 2 con LMS y Combat LoRAs mientras se retiene el audio nativo. Recibes tanto una "base" rápida de vista previa como una exportación "refinada" pulida.

Configuración#

Usa el grupo de Configuración para elegir la relación de aspecto, resolución de trabajo, duración del clip y tasa de fotogramas. El control de duración convierte los segundos en un conteo de fotogramas que se alinea con el troceado del muestreador, lo que ayuda a la estabilidad. Comienza más bajo para vistas previas rápidas, luego escala una vez que el encuadre y los ritmos se vean bien. Las resoluciones más altas y los clips más largos aumentan VRAM y el tiempo de renderizado.

Referencias#

Carga tres referencias: una imagen por personaje y una imagen que define el entorno. Las imágenes de los personajes actúan como guías de identidad y vestuario, no como fondos, así que elige retratos limpios con rostros legibles y elementos clave del vestuario. La referencia de escena establece la iluminación, paleta y arquitectura; elige una vista que coincida con la altura de cámara deseada. Puedes intercambiar libremente las referencias para explorar diferentes enfrentamientos y ubicaciones.

Condiciones#

El nodo MiniMaxH3ReferenceToVideo (#56) fusiona la indicación estructurada con las referencias y los codificadores MiniMax H3 para producir un latente conjunto de audio-video y condicionamiento positivo. La indicación funciona mejor cuando se divide en secciones etiquetadas como definiciones_de_sujeto, resumen, análisis_de_retención, descripción_detallada, paisaje_sonoro_general y música_no_diegetica. Sé explícito sobre el número de luchadores, armas, movimiento de cámara y el conteo exacto de contactos limpios. Evita personajes adicionales, teletransportes, movimientos sobrehumanos o efectos si deseas resultados realistas.

LoRAs#

Las LoRAs se aplican en dos etapas. Turbo se inyecta para la primera pasada para acelerar la exploración del movimiento sin sacrificar la retención de identidad. La LMS LoRA fluye a través de una corrección de compatibilidad AdaLN, luego se aplica Combat para que el refinador enfatice siluetas legibles e intercambios de golpe-parada. Puedes ajustar las fortalezas de LoRA para equilibrar realismo versus estilización para tu género.

Parches#

Este grupo configura el rendimiento y la forma del cronograma. PathchSageAttentionKJ (#199) optimiza la atención para la memoria y la velocidad para que las escenas de alto movimiento permanezcan receptivas. MiniMaxH3SigmaShift (#297) alinea los cronogramas de sigma de video y audio, mejorando la sincronización de labios y efectos de sonido en relación con el movimiento. Úsalos cuando veas un desfase de tiempo o una pequeña inestabilidad de identidad.

1ra Muestreo#

La primera pasada inicializa el ruido, establece un cronograma compacto y muestrea con SamplerCustomAdvanced (#238) guiado por tu condicionamiento positivo. La salida se guarda como un latente base y se puede decodificar en un video de vista previa rápida con audio nativo para una revisión rápida. Esta pasada es donde juzgas el bloqueo, el recorrido de la cámara y la cadencia de los impactos. Si el mapa de ritmos está desviado, revisa la indicación y las referencias aquí antes de refinar.

2da Muestreo + Refinador#

Antes del refinamiento, el audio y el video se separan de la primera pasada, el latente de video se amplía con MinimaxH3LatentUpscaler3D (#124), y el latente de audio se mantiene intacto. Luego, el refinador muestrea con sigmas de bajo ruido usando LMS y Combat LoRAs para agregar detalle material, fidelidad de borde y legibilidad de combate. Finalmente, las imágenes y el audio preservado se decodifican y combinan en la exportación refinada. Espera bordes más nítidos, manos y espadas más limpias, e identidades más estables en comparación con la pasada base.

Nodos clave en el flujo de trabajo de ComfyUI MiniMax H3 Escenas de Acción#

MiniMaxH3ReferenceToVideo (#56)#

Construye un latente conjunto de audio-video sincronizado a partir de tu indicación estructurada e imágenes de referencia usando el codificador de texto MiniMax H3 y VAEs. Ajusta la indicación, ancho, alto y longitud para controlar el contenido, encuadre y duración. Para obtener los mejores resultados, mantén las definiciones de sujeto y las restricciones de escena sin ambigüedades. Referencia: Comfy-Org MiniMax-H3.

MinimaxH3LatentUpscaler3D (#124)#

Escalador latente 3D temporalmente consistente que amplía el latente de video entre pasadas antes del refinamiento. Aumenta modo.escala modestamente para ganar detalle sin desestabilizar el movimiento. Útil cuando te gusta el tiempo de la pasada-1 pero quieres bordes y texturas más nítidos. Referencia: Comfyui Minimax H3 Latent Upscaler.

MiniMaxH3SigmaShift (#297)#

Desplaza los cronogramas de sigma de audio y video utilizados por MiniMax H3 para que el movimiento, las señales de labios y los efectos de sonido se mantengan alineados. Ajustar desplazar_video y desplazar_audio puede reducir el desfase de tiempo en los diálogos o impactos. Deja pequeños desfasajes a menos que notes desincronización al inicio o fin. Referencia: Colección MiniMax-H3.

VHS_VideoCombine (#264)#

Combina fotogramas decodificados y audio en el MP4 final con la tasa de fotogramas y configuraciones de calidad elegidas por ti. Habilita el guardado de metadatos para retener la procedencia y detalles del flujo de trabajo en las exportaciones. Usa recortar_a_audio cuando tu video refinado se extienda más allá del audio preservado. Referencia: ComfyUI-VideoHelperSuite.

PathchSageAttentionKJ (#199)#

Optimización de atención que puede mejorar el rendimiento y la estabilidad para escenas de alto detalle y resoluciones más grandes. Mantenlo habilitado para tomas más largas o entornos complejos. Si encuentras regresiones de rendimiento en clips más pequeños, prueba su modo automático. Referencia: ComfyUI-KJNodes.

Extras opcionales#

  • Patrón de indicación. Usa el formato seccionado proporcionado y escribe un mapa de ritmos para la acción. Especifica el número exacto de luchadores y armas, movimiento de cámara y el conteo y tiempo de contactos legibles.
  • Curación de referencias. Elige fotos de identidad con rostros claros y vestuario, y una imagen de ubicación que coincida con la perspectiva y la iluminación previstas. Evita fondos ocupados en las referencias de personajes para reducir conflictos.
  • Revisión de pasada. Mira el video base para validar el bloqueo y el tiempo antes de refinar. Si los contactos se ven borrosos, aumenta la claridad en la indicación y reduce la velocidad frenética de manos o espadas.
  • Problemas típicos y soluciones. Los contactos rápidos de manos o armas pueden causar pequeñas distorsiones; simplifica la coreografía alrededor de los impactos, acorta el intercambio o aumenta la distancia de la cámara para ayudar al modelo a renderizar el momento de manera limpia.
  • Entregables. El flujo de trabajo escribe una vista previa base rápida y una exportación refinada para que puedas comparar movimiento versus apariencia final. Usa el clip refinado para compartir una vez que las identidades, el entorno y los ritmos cumplan tu objetivo.

Con MiniMax H3 Escenas de Acción puedes convertir dos imágenes de personajes, una referencia de escena y un breve preciso en clips de acción fundamentados y fieles a la referencia con audio nativo sincronizado, listos para edición, previs o publicación.

Agradecimientos#

Este flujo de trabajo implementa y se basa en los siguientes trabajos y recursos. Agradecemos a Innovate Futures @ Benji por la guía del flujo de trabajo de AI Video MiniMax H3 ComfyUI, a WarmBloodAban por Minimax-h3_Singularity, y a Comfy-Org y RunningHubAI por los modelos base MiniMax-H3 y LMS LoRA por sus contribuciones y mantenimiento. Para obtener detalles autorizados, por favor consulta la documentación original y los repositorios enlazados a continuación.

Recursos#

Nota: El uso de los modelos, conjuntos de datos y código referenciados está sujeto a las respectivas licencias y términos proporcionados por sus autores y mantenedores.

RunComfy
Derechos de autor 2026 RunComfy. Todos los derechos reservados.

RunComfy es la principal ComfyUI plataforma, ofreciendo ComfyUI en línea entorno y servicios, junto con flujos de trabajo de ComfyUI con impresionantes imágenes. RunComfy también ofrece AI Models, permitiendo a los artistas aprovechar las últimas herramientas de AI para crear arte increíble.