MiniMax H3 ComfyUI Image to Video Turbo de 4 Pasos#
MiniMax H3 ComfyUI Image to Video Turbo de 4 Pasos es un flujo de trabajo listo para RunComfy que convierte una sola imagen fija en un corto video con audio estéreo nativo, directamente en ComfyUI. Ejecuta la tubería de imagen a video de MiniMax H3 (Hailuo) y aplica un Turbo LoRA para que puedas previsualizar movimiento y diálogo en mucho menos pasos de muestreo que el programa predeterminado.
Este gráfico está diseñado para creadores que desean borradores rápidos de I2V sin salir del lienzo de ComfyUI: personajes hablando, giros rápidos de productos o escenas ambientales con sonido sincronizado. Proporciona un cuadro inicial y un aviso de movimiento/diálogo; el flujo de trabajo genera cuadros de video y audio estéreo juntos, luego los combina en un clip terminado que puedes descargar.
Modelos clave en el flujo de trabajo Turbo de 4 pasos de MiniMax H3 ComfyUI Image to Video#
- MiniMaxAI/MiniMax-H3 modelo de video multimodal. El modelo oficial H3 produce video con audio estéreo sincronizado y admite I2V de primer cuadro; este flujo de trabajo utiliza el repack de Comfy-Org para ComfyUI. MiniMaxAI/MiniMax-H3 y Comfy-Org/MiniMax-H3
- MiniMax H3 Video VAE. Codifica/decodifica latentes de video utilizados por el backbone de difusión de H3. Incluido en el repack de Comfy-Org. Comfy-Org/MiniMax-H3
- MiniMax H3 Audio VAE. Decodifica los latentes de audio del modelo a formas de onda estéreo nativas alineadas con los cuadros. Incluido en el repack de Comfy-Org. Comfy-Org/MiniMax-H3
- Codificador de texto Qwen3‑VL 32B (variante MiniMax H3). Analiza tu aviso de movimiento y diálogo en condicionamiento para H3. Empaquetado con la versión de Comfy-Org bajo text_encoders. Comfy-Org/MiniMax-H3
- MiniMax‑H3 Turbo LoRA (4‑pasos). Un LoRA que acelera el muestreo de H3 para que las previsualizaciones nítidas sean posibles con un recuento de pasos muy bajo. larryvrh/MiniMax-H3-Turbo-Lora y el documento conceptual de LoRA LoRA: Low‑Rank Adaptation
Cómo usar el flujo de trabajo Turbo de 4 pasos de MiniMax H3 ComfyUI Image to Video#
Flujo general. El gráfico escala tu imagen subida, convierte tu duración en un recuento de cuadros válido de H3, luego alimenta el cuadro inicial y el aviso en H3 con el Turbo LoRA aplicado. El muestreador produce latentes de video y audio conjuntos, que son decodificados y combinados en un clip descargable.
Subir imagen. Usa LoadImage (#114) para proporcionar el primer cuadro que deseas animar. La imagen se escala automáticamente por LayerUtility: ImageScaleByAspectRatio V2 (#167) a un lado largo objetivo mientras se preserva el aspecto; el ancho/alto derivado alimenta el nodo central de H3. Se utiliza letterboxing cuando es necesario para evitar distorsiones. Esto mantiene tu composición intacta mientras coincide con la cuadrícula preferida de H3.
Parámetros y aviso. Establece la longitud del clip usando el control de Duración (etiqueta "Duration (sec)") que alimenta un pequeño nodo matemático, ComfyMathExpression (#134), que convierte segundos a cuadros a la tasa de filmación y se ajusta a la cuadrícula válida de H3. Ingresa tu movimiento y diálogo en el nodo de aviso easy positive verde (#152); puedes escribir oraciones naturales y discurso entre comillas. El aviso es codificado por el codificador de texto Qwen3‑VL a través de CLIPLoader (#130), preparando el condicionamiento para el modelo.
Generación central. UNETLoader (#129) carga el backbone de difusión MiniMax H3 y VAELoader (#121, #122) carga los VAEs de video y audio. El Turbo LoRA se fusiona en tiempo de ejecución por LoraLoaderModelOnly (#171), y un parche de atención eficiente en memoria (MiniMaxH3MemoryEfficientSageAttentionPatch (#170)) ayuda a reducir VRAM. El nodo principal, MiniMaxH3ImageToVideo (#133), recibe tu cuadro inicial, aviso y ancho/alto/longitud calculados, luego produce latentes de video y audio sincronizados.
Muestreo y decodificación. Una pila de muestreador compacto (KSamplerSelect (#125), BasicScheduler (#126), BasicGuider (#128), SamplerCustomAdvanced (#127), RandomNoise (#131)) realiza la eliminación de ruido en muy pocas iteraciones gracias al Turbo LoRA. VAEDecode (#124) convierte latentes de video en cuadros, y VAEDecodeAudio (#123) produce audio estéreo alineado con esos cuadros. No necesitas ajustar configuraciones de decodificación; están cableadas para previsualizaciones limpias.
Salida. CreateVideo (#132) combina los cuadros y el audio en un solo clip a la tasa de cuadros de trabajo, y SaveVideo (#92) lo escribe con el prefijo de nombre de archivo configurado para que puedas descargar inmediatamente desde RunComfy. El resultado es un video corto y sincronizado que refleja tu cuadro inicial, aviso de movimiento y diálogo.
Nodos clave en el flujo de trabajo Turbo de 4 pasos de MiniMax H3 ComfyUI Image to Video#
MiniMaxH3ImageToVideo (#133). El corazón del gráfico: consume el cuadro inicial, el aviso codificado y tu tamaño/longitud objetivo y produce latentes de video y audio conjuntos. Ajusta solo las pocas entradas expuestas a ti en este flujo de trabajo: proporciona un aviso fuerte y descriptivo (incluye diálogo entre comillas) y establece una duración realista; el nodo maneja el resto usando el modelo H3 y VAEs del repack de Comfy-Org. Comfy-Org/MiniMax-H3
LoraLoaderModelOnly (#171). Inyecta el MiniMax‑H3 Turbo LoRA para que el muestreador pueda alcanzar alta nitidez en muy pocos pasos. Si necesitas intercambiar artefactos por velocidad, baja ligeramente la fuerza del LoRA; si ves manchas de movimiento, súbela un poco. El LoRA está diseñado para trabajar a través de las variantes comunes de base H3, incluyendo repacks podados y cuantizados. larryvrh/MiniMax-H3-Turbo-Lora
BasicScheduler (#126) y SamplerCustomAdvanced (#127). Juntos controlan el programa de eliminación de ruido y el comportamiento de los pasos. Con el Turbo LoRA en su lugar, puedes ejecutar con un recuento de pasos muy bajo para previsualizaciones rápidas; aumentar los pasos mejorará modestamente la estabilidad si puedes permitirte el tiempo. Mantén las elecciones del programador y del muestreador convencionales a menos que tengas un aspecto específico en mente.
LayerUtility: ImageScaleByAspectRatio V2 (#167). Asegura que la imagen fija subida se redimensione a una resolución limpia y amigable para el modelo mientras se preserva el aspecto. Usa esto al cambiar imágenes de origen para evitar recortes o deformaciones inesperadas; el nodo emite el ancho/alto exacto que consume el nodo central H3. ComfyUI_LayerStyle
ComfyMathExpression (#134). Convierte segundos a cuadros y ajusta el recuento a la cuadrícula de cuadros válida de H3 para que el audio permanezca bloqueado en fase con el video. Puedes pensar en ello como un "guardia de seguridad" que evita recuentos de cuadros que H3 no soporta, previniendo desincronizaciones sutiles en la etapa de combinación. La entrada es la duración en inglés simple que estableces en la parte superior del lienzo.
MiniMaxH3MemoryEfficientSageAttentionPatch (#170). Aplica una optimización experimental de atención que reduce el pico de VRAM durante el muestreo en H3. Enciéndelo cuando trabajes en tamaños más grandes o en GPUs con memoria limitada; conserva la intención creativa mientras mejora el ajuste. ComfyUI‑KJNodes
Extras Opcionales#
- Aviso para sincronización de labios: escribe la línea real entre comillas (por ejemplo, "La cena está lista — prueba esta carbonara.") y describe el ambiente y el movimiento de la cámara en lenguaje sencillo.
- Composición primero: elige un cuadro inicial que ya encuadre a tu sujeto a la distancia prevista; la animación respetará esa composición.
- Velocidad vs pulido: la configuración Turbo de MiniMax H3 ComfyUI Image to Video de 4 pasos está afinada para previsualizaciones rápidas; si un disparo importa, agrega algunos pasos más o reduce ligeramente la fuerza del LoRA para domar el grano excesivamente nítido.
- Espacio de ejecución: si alcanzas los límites de VRAM, intenta una longitud máxima de lado de imagen más pequeña, acorta la duración o habilita el parche de atención eficiente en memoria.
- Explora bases: el flujo de trabajo es compatible con las variantes de repack de Comfy‑Org H3 (bf16, int8 convrot, podado). Si cambias la base, mantén el Turbo LoRA conectado entre el cargador de modelo y el muestreador para el mismo efecto de aceleración. Comfy-Org/MiniMax-H3
Agradecimientos#
Este flujo de trabajo implementa y se basa en los siguientes trabajos y recursos. Agradecemos sinceramente a MiniMax por el modelo MiniMax H3, a Comfy.org por el tutorial del flujo de trabajo MiniMax H3 ComfyUI, a Comfy-Org por los pesos del modelo MiniMax-H3, y a larryvrh por el MiniMax-H3 Turbo LoRA por sus contribuciones y mantenimiento. Para detalles autorizados, por favor refiérase a la documentación y repositorios originales enlazados a continuación.
Recursos#
- Anuncio oficial de MiniMax/MiniMax H3
- Documentos / Notas de lanzamiento: Anuncio oficial de MiniMax H3
- Tutorial de Comfy.org/MiniMax H3
- GitHub: Comfy-Org/docs
- Documentos / Notas de lanzamiento: Tutorial de MiniMax H3
- Pesos del modelo Comfy-Org/MiniMax-H3
- Hugging Face: Comfy-Org/MiniMax-H3
- larryvrh/MiniMax-H3 Turbo LoRA
- GitHub: Larryvrh/ComfyUI-MiniMax-H3-Turbo
- Hugging Face: larryvrh/MiniMax-H3-Turbo-Lora
Nota: El uso de los modelos, conjuntos de datos y código referenciados está sujeto a las respectivas licencias y términos proporcionados por sus autores y mantenedores.


