ComfyUI>Flujos de trabajo>MiniMax H3 Múltiples Referencias a Video 4 Pasos Turbo

MiniMax H3 Múltiples Referencias a Video 4 Pasos Turbo

Workflow Name: RunComfy/MiniMax-H3-Turbo
Workflow ID: 0000...1485
Convierta imágenes de referencia en un video corto de Hailuo H3. Mantenga consistentes las caras y el vestuario en múltiples sujetos. Dirija movimientos de cámara y diálogo en un solo aviso. Genere audio estéreo nativo con el clip. El Turbo LoRA de 4 pasos reduce el tiempo de renderizado. Haga duetos, escenas de productos y ritmos de personajes más rápido.

MiniMax H3 ComfyUI Reference to Video 4-step Turbo Workflow

MiniMax H3 ComfyUI - 4-Step Reference-to-Video Audio
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

MiniMax H3 ComfyUI Reference to Video 4-step Turbo Examples

MiniMax H3 ComfyUI Referencia a Video Turbo de 4 pasos#

El Turbo de 4 pasos de MiniMax H3 ComfyUI Referencia a Video es un flujo de trabajo listo para RunComfy que bloquea una o más identidades de personajes a partir de imágenes fijas y genera un clip corto con audio estéreo nativo en una sola pasada acelerada. Está diseñado para creadores que necesitan caras, vestuario y puesta en escena consistentes a lo largo de una escena, manteniendo el movimiento de cámara, diálogo y sincronización labial coherentes.

Este gráfico utiliza la canalización ref2va de MiniMax H3 más un Turbo LoRA para que la identidad, el movimiento y el habla de múltiples sujetos se mantengan unificados sin el programa predeterminado más largo. Etiquete sus imágenes fijas con <Picture N> dentro del aviso, opcionalmente traiga video y audio de referencia, y renderice un clip limpio directamente en ComfyUI en RunComfy.

Modelos clave en el flujo de trabajo Turbo de 4 pasos de MiniMax H3 ComfyUI Referencia a Video#

  • Modelo de difusión MiniMax-H3 Referencia a Video (ref2va). Proporciona la columna vertebral generativa principal para acondicionar imágenes fijas, video opcional y texto para sintetizar tomas coherentes. Los pesos están disponibles en el empaquetado Comfy-Org de MiniMax-H3 en Hugging Face. Comfy-Org/MiniMax-H3
  • MiniMax-H3 Video VAE. Codifica y decodifica latentes de video sobre los que opera el muestreador, preservando la suavidad temporal y el detalle. Distribuido con el mismo paquete. Comfy-Org/MiniMax-H3
  • MiniMax-H3 Audio VAE. Maneja la pista de audio estéreo nativa junto con el video, de modo que el habla y el ambiente se autoren con la toma. Incluido junto con los componentes de video. Comfy-Org/MiniMax-H3
  • Codificador de texto Qwen-VL 32B ajustado para MiniMax-H3. Traduce el aviso, incluidos los marcadores <Picture N> y las direcciones de escena, en señales de acondicionamiento utilizadas por H3. Empaquetado en el lanzamiento de Comfy-Org. Comfy-Org/MiniMax-H3
  • MiniMax-H3 Turbo 4-step LoRA. Un LoRA de aceleración que comprime el programa para que la toma pueda generarse en una pasada rápida manteniendo la consistencia de identidad y movimiento. larryvrh/MiniMax-H3-Turbo-Lora

Cómo usar el flujo de trabajo Turbo de 4 pasos de MiniMax H3 ComfyUI Referencia a Video#

El flujo de trabajo pasa de referencias y temporización a configuración de modelo, acondicionamiento, muestreo y multiplexado final. Puede ejecutarlo solo con imágenes fijas o combinar imágenes fijas con video y audio de referencia opcionales.

Etapa 1 — Referencias, aviso y temporización#

Cargue una o más imágenes fijas a través de los nodos LoadImage y planee referenciarlas como <Picture 1>, <Picture 2>, y así sucesivamente en su aviso. Si tiene un clip guía, páselo a través de los nodos VHS_LoadVideo; su audio también puede pasarse para guiar el ritmo y la energía. Para proporcionar diálogo o ambiente a medida, use los nodos LoadAudio además de o en lugar de audio de video de referencia. Ingrese su descripción completa de la toma en Input Text (Prompt) con cualquier bloqueo de personajes, movimientos de cámara y diálogo. El flujo de trabajo convierte la duración deseada en un recuento de fotogramas estable automáticamente, alineando la línea de tiempo con el paso interno de MiniMax H3.

Etapa 2 — Configuración del modelo y aceleración turbo#

El núcleo UNet H3 ref2va, el codificador de texto y los VAE de video y audio se cargan en el "Core Workspace". El parche de atención eficiente en memoria habilita tomas más grandes o mayor resolución en GPUs típicas sin cambiar su uso. El Turbo LoRA de 4 pasos se aplica mediante LoraLoaderModelOnly (#164) para que pueda mantener bajos los recuentos de pasos mientras preserva el bloqueo de identidad y movimiento. No se requiere cableado manual; el gráfico está preconectado para RunComfy. Si no está utilizando algunas entradas, desactive los nodos Load Image / Load Video / Load Audio no utilizados con Ctrl+B para mantener la ejecución ligera.

Etapa 3 — Acondicionamiento y ensamblaje latente#

MiniMaxH3ReferenceToVideo (#136) ingiere su aviso, imágenes fijas y cualquier video o audio de referencia opcional para construir el acondicionamiento y una línea de tiempo latente inicial. Use etiquetas <Picture N> para vincular claramente a cada persona u objeto a una imagen fija específica; el orden sigue las ranuras de referencia que llenó. Puede dirigir el comportamiento de la cámara, la sincronización labial y el ambiente en lenguaje natural. Anchura, altura y duración fluyen hacia este nodo para que el encuadre y el tiempo coincidan con su intención. Si tiene muchas imágenes fijas, mantenga solo las que realmente definen la identidad y el vestuario para el ritmo actual.

Etapa 4 — Muestreo#

El gráfico dirige el latente a través de un programa mínimo y un muestreador rápido seleccionado por KSamplerSelect (#123), guiado por BasicGuider (#126). BasicScheduler (#124) proporciona el patrón de pasos que el Turbo LoRA espera, equilibrando velocidad y fidelidad. SamplerCustomAdvanced (#125) resuelve la línea de tiempo en una pasada eficiente utilizando ruido sembrado para reproducibilidad. En la mayoría de los casos, puede dejar estos componentes como están configurados y centrarse en el aviso, las referencias y el encuadre.

Etapa 5 — Decodificación, multiplexado y guardado#

Después del muestreo, VAEDecode restaura los fotogramas de video y VAEDecodeAudio restaura la pista estéreo. CreateVideo (#130) multiplexa las imágenes y el audio en un archivo reproducible con su tasa y profundidad de bits elegidas. Finalmente, SaveVideo (#92) escribe el resultado en disco utilizando el contenedor y códec seleccionados. La salida es un clip corto con personajes bloqueados en identidad, movimiento de cámara y audio estéreo nativo autorado por MiniMax H3 ComfyUI Referencia a Video Turbo de 4 pasos.

Nodos clave en el flujo de trabajo Turbo de 4 pasos de MiniMax H3 ComfyUI Referencia a Video#

MiniMaxH3ReferenceToVideo (#136)#

Este es el corazón del flujo de trabajo que fusiona texto de aviso, referencias fijas y video/audio opcional en acondicionamiento y un latente inicializado. Ajuste prompt para incluir marcadores <Picture N> y direcciones de escena claras para cámara, diálogo y ambiente. Ajuste width, height y length para establecer encuadre y duración para la toma. Si necesita equilibrar detalle versus velocidad en imágenes fijas, cambie ref_image_size entre modos como coincidir con el tamaño de renderizado versus cambiar de tamaño para ejecuciones más ligeras. Mantenga su conjunto de referencias enfocado a las identidades que realmente necesita en la escena.

LoraLoaderModelOnly (#164)#

Aplica el MiniMax-H3 Turbo de 4 pasos LoRA al modelo ref2va para que el programa pueda comprimirse para inferencia rápida. El strength controla cuán fuertemente el LoRA influye en la columna vertebral; los valores más altos favorecen la velocidad y el aspecto turbo, mientras que los más bajos se mezclan de nuevo hacia la base H3. Si nota pérdida de detalle fino con aceleración extrema, reduzca ligeramente la fuerza del LoRA o alargue el programa en el scheduler para recuperar fidelidad. Consulte la tarjeta del modelo LoRA para notas de versión y uso previsto. MiniMax-H3 Turbo LoRA

MiniMaxH3MemoryEfficientSageAttentionPatch (#163)#

Habilita una implementación de atención eficiente en memoria compatible con MiniMax H3 para que pueda ejecutar resoluciones más altas o tomas más largas con VRAM limitada. Es sin parámetros en este gráfico; simplemente manténgalo habilitado para la mejor capacidad. El nodo es parte de KJNodes para ComfyUI. kijai/ComfyUI-KJNodes

BasicScheduler (#124)#

Define el programa de difusión utilizado durante el muestreo. Con el Turbo LoRA activo, mantenga el conteo de pasos compacto para la velocidad, ajustándolo solo cuando necesite nitidez o estabilidad adicionales. denoise le permite impulsar una reinterpretación más fuerte de las referencias si su aviso requiere cambios mayores. Los cambios aquí interactúan con la fuerza del LoRA y el muestreador elegido, así que ajuste en pequeños incrementos.

KSamplerSelect (#123)#

Selecciona el algoritmo de muestreo para la pasada. Un muestreador simple y estable se empareja bien con programas turbo y ayuda a preservar la identidad a través de los fotogramas. Si enfatiza la estilización o un movimiento de cámara muy rápido, pruebe muestreadores alternativos que pueden agregar textura de movimiento a costa de una ligera variabilidad.

CreateVideo (#130) y SaveVideo (#92)#

CreateVideo ensambla fotogramas decodificados y audio en un flujo final, donde puede configurar fps y bit_depth para que coincidan con sus necesidades de entrega. SaveVideo selecciona el contenedor y el códec para exportar; use una combinación ampliamente compatible para compartir en general o una variante de alta calidad para trabajo posterior. Si está iterando rápidamente, mantenga los ajustes ligeros y luego cambie a configuraciones de producción para el renderizado final.

Extras opcionales#

  • Para múltiples personajes, coloque primero las imágenes fijas más claras de frente y refiérase a ellas como <Picture 1>, <Picture 2>, etc. Use una o dos imágenes fijas adicionales por sujeto para cobertura de ángulo o vestuario.
  • Si lleva un video de referencia, incluya una breve descripción del comportamiento de cámara deseado en el aviso para que H3 sepa qué preservar y qué reinterpretar.
  • El control de duración se ajusta internamente a un recuento de fotogramas seguro para H3; si cambia su tasa de fotogramas objetivo en CreateVideo, vuelva a verificar las notas de temporización en su aviso.
  • Los nodos auxiliares de video y audio provienen del Video Helper Suite; proporcionan E/S de medios robusta dentro de ComfyUI. Kosinkadink/ComfyUI-VideoHelperSuite
  • ¿Busca un flujo de trabajo de comparación base para MiniMax H3 referencia a video en ComfyUI? Revise la plantilla oficial y adapte ideas según sea necesario. Comfy-Org workflow template

Agradecimientos#

Este flujo de trabajo implementa y se basa en los siguientes trabajos y recursos. Agradecemos a MiniMax Research por el modelo MiniMax H3, a Comfy.org por los ejemplos de flujo de trabajo de ComfyUI MiniMax H3, a Comfy-Org por los pesos del modelo MiniMax-H3, y a larryvrh por el MiniMax-H3 Turbo LoRA por sus contribuciones y mantenimiento. Para obtener detalles autorizados, consulte la documentación original y los repositorios enlazados a continuación.

Recursos#

Nota: El uso de los modelos, conjuntos de datos y código referenciados está sujeto a las respectivas licencias y términos proporcionados por sus autores y mantenedores.

RunComfy
Derechos de autor 2026 RunComfy. Todos los derechos reservados.

RunComfy es la principal ComfyUI plataforma, ofreciendo ComfyUI en línea entorno y servicios, junto con flujos de trabajo de ComfyUI con impresionantes imágenes. RunComfy también ofrece AI Models, permitiendo a los artistas aprovechar las últimas herramientas de AI para crear arte increíble.