ComfyUI>Flujos de trabajo>MiniMax H3 8-Step Acceleration | Flujo de Trabajo de Video Todo en Uno

MiniMax H3 8-Step Acceleration | Flujo de Trabajo de Video Todo en Uno

Workflow Name: RunComfy/MiniMax-H3-8-Step
Workflow ID: 0000...1505
MiniMax H3 8-Step Acceleration es un flujo de trabajo todo en uno de ComfyUI para crear video cinematográfico con audio nativo sincronizado. Su nodo de referencia unificada admite imágenes, videos, video-audio emparejados y audio independiente, mientras que el valor predeterminado listo para ejecutar utiliza una imagen y una sugerencia de movimiento. Un Turbo LoRA y un muestreo de 8 pasos aceleran la generación, con configuraciones probadas diseñadas para funcionar de manera confiable en una GPU de 48 GB.

ComfyUI MiniMax H3 8-Step Acceleration Workflow

MiniMax H3 8-Step Acceleration All-in-One Video Workflow in ComfyUI
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

ComfyUI MiniMax H3 8-Step Acceleration Examples

MiniMax H3 8-Step Acceleration: Generación de video multimodal todo en uno con audio nativo#

MiniMax H3 8-Step Acceleration es un flujo de trabajo todo en uno de ComfyUI para crear video cinematográfico con audio nativo sincronizado. A través del nodo unificado MiniMaxH3Unified, admite referencias de imagen, referencias de video, videos con audio acompañante y referencias de audio independientes dentro de un flujo de trabajo simplificado.

El ejemplo listo para ejecutar utiliza una sola imagen y una sugerencia de texto orientada al movimiento, pero la referencia a video es solo una forma de usar el flujo de trabajo. Su diseño multimodal unificado admite diferentes combinaciones de orientación visual y de audio sin requerir gráficos de flujo de trabajo separados para cada tipo de entrada.

El flujo de trabajo combina la columna vertebral MiniMax H3 FL2VA con el LightX2V Turbo LoRA y un programa de muestreo compacto de 8 pasos y dos pasadas. Está diseñado para tomas de personajes cinematográficos, escenas de diálogo, microhistorias atmosféricas y otras tareas de video multimodal que se benefician de iteraciones más rápidas y audio nativo sincronizado.

Modelos clave en el flujo de trabajo ComfyUI MiniMax H3 8-Step Acceleration#

  • Pesos oficiales de MiniMax-H3. La columna vertebral de difusión audiovisual que genera video y audio nativo a partir de sugerencias y referencias multimodales. MiniMaxAI/MiniMax-H3
  • MiniMax H3 Video VAE y Audio VAE. Codificadores y decodificadores emparejados utilizados para moverse entre el espacio de píxeles, las formas de onda de audio y los latentes H3. Incluido en la distribución de Comfy-Org. Comfy-Org/MiniMax-H3
  • Codificador de texto Qwen3-VL 32B (AWQ, afinado por MiniMax). Proporciona base lingüística y visual para sugerencias y referencias al impulsar MiniMax H3. Distribuido con el paquete Comfy-Org MiniMax H3. Comfy-Org/MiniMax-H3
  • LightX2V MiniMax H3 Turbo LoRA. Un LoRA orientado a la velocidad que ajusta las trayectorias para que H3 pueda converger efectivamente bajo un programa de 8 pasos. lightx2v/Minimax-h3-Turbo
  • MiniMax H3 Latent Upscaler 3D. Un escalador latente nativo de H3 utilizado entre pasadas para aumentar el detalle espacial sin romper la alineación de audio.

Cómo usar el flujo de trabajo ComfyUI MiniMax H3 8-Step Acceleration#

A un nivel alto, el flujo de trabajo recopila sugerencias y referencias multimodales a través de un nodo de entrada unificado, construye un programa compacto de 8 pasos y ejecuta una pasada rápida de sigma alto para establecer la estructura del movimiento y la escena. Luego puede escalar el latente del video en 3D antes de ejecutar una pasada de refinamiento de sigma bajo, decodificando el audio y video sincronizados y exportando el resultado como un MP4.

Entradas y dimensionamiento#

Usa Resolution Selector (Size) (#115) para elegir tu ancho y alto objetivo. Ingresa la descripción de tu escena en Input Text (Prompt) (#217); puedes incluir diálogos entre comillas si deseas palabras habladas en el clip generado.

El nodo todo en uno MiniMaxH3Unified (#212) actúa como el centro de referencia multimodal del flujo de trabajo. Soporta referencias de imagen, referencias de video, videos con audio y referencias de audio independientes, junto con controles de sugerencias, dimensionamiento y duración.

El ejemplo incluido está configurado con una imagen de referencia y una sugerencia de movimiento para uso inmediato. Puedes reemplazar esa imagen o configurar otro tipo de referencia admitido dentro del mismo nodo unificado sin reconstruir las etapas de muestreo, escalado, decodificación o exportación.

Puedes establecer la duración en MiniMaxH3Unified, o activar auto_length_from_audio al usar una referencia de audio externa para guiar el tiempo.

Configuración del modelo y parches de aceleración#

UNETLoader (#127) trae el punto de control MiniMax H3 FL2VA. MiniMaxH3MemoryEfficientSageAttentionPatch (#160) y ModelAttentionBackend (#168) luego activan un backend de atención amigable con VRAM.

MiniMaxH3SigmaShift (#207) alinea los horizontes de desruido de video y audio para programas cortos. LoraLoaderModelOnly (#167) aplica el LightX2V Turbo LoRA que permite la aceleración MiniMax H3 8-Step sin requerir un gráfico de aceleración separado.

Constructor de programa de 8 pasos#

BasicScheduler (#163) construye una trayectoria compacta, que es ajustada por ExtendIntermediateSigmas (#220) y H3SigmaRefiner (#209) para las dinámicas audiovisuales de H3.

SplitSigmas (#197) divide el programa en un bloque de sigma alto para estructura y un bloque de sigma bajo para detalle. Una sola semilla de RandomNoise (#129) alimenta ambas pasadas para ayudar a mantener el movimiento y el audio coherentes.

Muestreador de primera pasada: sigmas altos#

El bloque de sigma alto fluye hacia SamplerCustomAdvanced (#125), guiado por BasicGuider (#126) con el acondicionamiento positivo de MiniMaxH3Unified (#212).

Esta pasada establece la composición, cadencia de movimiento y una base de audio gruesa dentro de un latente audiovisual unificado. Su salida desruida se prepara luego para la mejora a mitad de canalización.

Escalado en el espacio latente#

LTXVSeparateAVLatent (#199) divide el latente audiovisual para que solo los canales de video sean escalados por MinimaxH3LatentUpscaler3D (#226). El latente de audio permanece intacto para preservar la sincronización.

LTXVConcatAVLatent (#198) luego recombina el latente de video mejorado con el latente de audio original, creando un latente audiovisual más nítido pero aún sincronizado para el refinamiento.

Muestreador de segunda pasada: sigmas bajos#

El latente recombinado se refina en SamplerCustomAdvanced (#177) usando el bloque de sigma bajo y BasicGuider (#178).

Esta pasada agrega detalle superficial, limpia rasgos faciales y pule texturas de audio mientras mantiene el movimiento y el tiempo establecidos durante la primera pasada.

Decodificación y exportación#

VAEDecode (#186) convierte los latentes de video en cuadros, mientras que VAEDecodeAudio (#185) reconstruye la pista de audio nativa.

VHS_VideoCombine (#189) mezcla los resultados en un MP4 a la velocidad de fotogramas seleccionada—24 fps por defecto—produciendo un clip audiovisual listo para compartir.

Nodos clave en el flujo de trabajo ComfyUI MiniMax H3 8-Step Acceleration#

  • MiniMaxH3Unified (#212). El centro de referencia multimodal todo en uno para MiniMax H3. Trae imágenes, videos, video-audio, audio independiente, sugerencias, dimensionamiento y controles de duración en un solo nodo, permitiendo que diferentes tareas de referencia H3 usen la misma tubería de generación acelerada.
  • H3SigmaRefiner (#209). Ajusta el programa para favorecer las partes de la trayectoria donde H3 se beneficia más. Si necesitas detalles más nítidos a la misma velocidad, agrega un poco de refinamiento; si priorizas el máximo rendimiento, mantenlo ligero.
  • SplitSigmas (#197). Divide el programa compacto en un plan de dos pasadas. Con un programa de 8 pasos, la división en el punto medio equilibra velocidad y calidad; mover la división asigna más pasos a estructura o detalle.
  • MiniMaxH3SigmaShift (#207). Compensa los rangos de sigma para video y audio para que converjan limpiamente bajo programas cortos. Deja los desplazamientos proporcionados sin cambios a menos que comprendas su efecto en la sincronización y estabilidad.
  • LoraLoaderModelOnly (#167). Aplica el LightX2V Turbo LoRA. La menor fuerza suaviza el efecto Turbo para un movimiento más suave; la mayor fuerza puede aumentar el impacto pero puede acentuar en exceso las texturas.
  • MinimaxH3LatentUpscaler3D (#226). Aumenta el detalle espacial entre pasadas manteniendo intacto el latente de audio. Usa un mode.scale modesto para salidas tipo 720p o un multiplicador mayor para 1080p cuando lo permita el VRAM.
  • VHS_VideoCombine (#189). Maneja la mezcla final y exportación. Ajusta frame_rate, establece un prefijo de nombre de archivo y opcionalmente usa recorte o bucle de ida y vuelta para previsualizaciones.

Extras opcionales#

  • Referencias multimodales. Usa el nodo H3 unificado para trabajar con referencias de imagen, referencias de video, videos con audio o referencias de audio independientes sin cambiar a un gráfico de generación separado.
  • Sugerencias de inicio rápido. MiniMax H3 responde bien a verbos cinematográficos y lenguaje de cámara. Indicaciones cortas y específicas como "acercamiento lento", "movimiento oscilante a mano" o una línea de diálogo entre comillas generalmente producen un movimiento más fuerte y un discurso más limpio.
  • Atajos de resolución. 0.4 MP con un escalado latente de 1.6x aterriza cerca de 720p. Una primera pasada de 0.5 MP con escalado 2x aterriza cerca de 1080p. Si alcanzas límites de VRAM, reduce megapíxeles antes de cambiar el programa de pasos.
  • Consejos de estabilidad. Mantén la misma semilla para tomas reproducibles. Cambia solo la semilla para variaciones rápidas mientras preservas el resto del tiempo y la dirección de la escena.
  • Cuándo evitar el escalador. Si priorizas velocidad o memoria, establece el multiplicador del escalador latente en 1 para omitir efectivamente la etapa de mejora.
  • Escenarios adecuados. Este flujo de trabajo MiniMax H3 8-Step Acceleration funciona bien para tomas de personajes a media distancia, diálogos con sonido ambiental, referencias de escenas audiovisuales, ritmos atmosféricos cortos y tareas de video multimodal donde la iteración rápida importa.

Agradecimientos#

Este flujo de trabajo implementa y se basa en los siguientes trabajos y recursos. Agradecemos sinceramente a RunningHub por la referencia del flujo de trabajo, a MiniMaxAI por el modelo oficial MiniMax-H3, a Comfy-Org por los pesos del modelo MiniMax-H3 y a lightx2v por el MiniMax H3 Turbo LoRA.

Para detalles autorizados, información de licencias y términos de uso del modelo, consulta la documentación original y los repositorios enlazados a continuación.

Recursos#

Nota: El uso de los modelos, conjuntos de datos y código referenciados está sujeto a las respectivas licencias y términos proporcionados por sus autores y mantenedores.

RunComfy
Derechos de autor 2026 RunComfy. Todos los derechos reservados.

RunComfy es la principal ComfyUI plataforma, ofreciendo ComfyUI en línea entorno y servicios, junto con flujos de trabajo de ComfyUI con impresionantes imágenes. RunComfy también ofrece AI Models, permitiendo a los artistas aprovechar las últimas herramientas de AI para crear arte increíble.