Minimax H3 I2V Dual Clock 8-Step de Alta Calidad y Ultra-Rápido#
Este flujo de trabajo ComfyUI listo para RunComfy convierte una imagen de referencia única y una indicación combinada de movimiento y audio en un video corto y sincronizado con sonido estéreo nativo. Construido alrededor del acondicionamiento MiniMax H3 Ref2VA y un muestreador Dual Clock de 8 pasos, ofrece animación de imágenes rápida y sonido estrechamente acoplado sin sacrificar la coherencia visual.
Utiliza el flujo de trabajo Minimax H3 I2V Dual Clock 8-Step de Alta Calidad y Ultra-Rápido para la animación de imágenes cinematográficas, actuaciones de personajes, vehículos, tomas de productos y escenas atmosféricas que se benefician del movimiento sincronizado y el audio generado. El gráfico integra SageAttention para inferencia eficiente en memoria y el MiniMax-H3 Turbo LoRA para generación acelerada mientras mantiene la experiencia I2V simple para el usuario.
Modelos clave en el flujo de trabajo ComfyUI Minimax H3 I2V Dual Clock 8-Step de Alta Calidad y Ultra-Rápido#
- Modelo de Fundación AV MiniMax-H3. El transformador audiovisual central que impulsa el acondicionamiento de imagen de referencia, la generación de movimiento y la síntesis de audio nativo. Consulta la tarjeta de modelo oficial en Hugging Face: MiniMaxAI/MiniMax-H3.
- MiniMax-H3 Turbo LoRA V4 step600. Un adaptador ligero que acelera y estabiliza MiniMax-H3 para muestreo de 8 pasos mientras preserva la fidelidad. Tarjeta de modelo: larryvrh/MiniMax-H3-Turbo-Lora.
- MiniMax-H3 Video VAE y Audio VAE. Decodificadores emparejados que convierten latentes audiovisuales en cuadros RGB y formas de onda estéreo. Aseguran un transporte latente eficiente durante el muestreo y una decodificación de alta calidad al final.
Cómo usar el flujo de trabajo ComfyUI Minimax H3 I2V Dual Clock 8-Step de Alta Calidad y Ultra-Rápido#
Este flujo de trabajo se ejecuta de izquierda a derecha en tres etapas agrupadas: configuración de modelos y activos, muestreo de reloj dual, y decodificación más multiplexado MP4. Proporcionas una imagen de referencia y una única indicación que incluye tanto la dirección visual como una sección “Audio:” que describe el sonido deseado.
Cargadores H3 + Turbo LoRA (EMA)#
Este grupo prepara la pila MiniMax-H3 y aplica el Turbo LoRA para velocidad. Carga tu imagen de referencia en LoadImage, luego escribe una indicación de movimiento descriptiva que termine con una cláusula “Audio: …” en CR Prompt Text. Elige tu tamaño de salida usando ResolutionSelector, que mantiene las dimensiones alineadas a múltiplos de 32 para estabilidad de video. Establece tu duración objetivo en segundos con el control Float (duration); las matemáticas internas del gráfico la convierten en un conteo de cuadros alineado con el tiempo del modelo para que el muestreador funcione sin problemas. Se aplica un parche SageAttention al modelo para reducir el uso de VRAM y mejorar el rendimiento sin cambiar el aspecto final.
ESTABLE: video 4 / audio 4#
Este grupo realiza el corazón de la generación con un muestreador MiniMax H3 Dual Clock de 8 pasos. El bloque de acondicionamiento usa Ref2VA para fusionar tu imagen de referencia e indicación de texto en un latente AV, que ancla identidad, composición y señales de sonido de alto nivel. El muestreador Dual Clock avanza video y audio con relojes separados pero sincronizados para que el movimiento y el sonido se sientan naturalmente bloqueados. Si necesitas corregir el adelantamiento o retraso percibido, ajusta los desplazamientos de reloj de video y audio para empujar cualquier flujo hacia adelante o hacia atrás hasta que el rendimiento se sincronice. Un guía básico estilo CFG equilibra la fidelidad a tu indicación con los priors aprendidos del modelo para un movimiento limpio y cinematográfico.
Decodificación + MP4 sincronizado#
El decodificador convierte el latente AV final en una secuencia de cuadros y una pista de audio estéreo utilizando los VAEs dedicados MiniMax-H3. La etapa VHS_VideoCombine empaqueta cuadros y audio en un único MP4 H.264 a tu tasa de cuadros elegida, guardando un video listo para compartir. Si traes tu propio audio más tarde, puedes recortar a la longitud del audio o exportar solo imágenes para edición externa. El resultado es un clip compacto y sincronizado que preserva el aspecto de tu imagen de referencia mientras agrega movimiento y sonido realistas.
Nodos clave en el flujo de trabajo ComfyUI Minimax H3 I2V Dual Clock 8-Step de Alta Calidad y Ultra-Rápido#
MiniMaxH3AudioConditioningT8 (#6)#
Este nodo implementa el acondicionamiento Ref2VA, tomando tu indicación, imagen de referencia, ancho objetivo, altura y longitud para crear un latente audiovisual y un acondicionamiento positivo. Úsalo para establecer la intención creativa: describe el movimiento, el comportamiento de la cámara y la continuidad de la escena, luego agrega un segmento “Audio:” que especifique instrumentos, timbre, ambiente y dinámica. Mantén el ancho y la altura consistentes con el aspecto de tu imagen de referencia para los diseños más coherentes. El control de longitud mapea tu duración a cuadros alineados con el tiempo interno del muestreador, lo que ayuda a mantener un movimiento suave y un audio estable. Proporcionado por el proyecto ComfyUI MiniMax H3 Turbo: Larryvrh/ComfyUI-MiniMax-H3-Turbo.
MiniMaxH3DualClockSamplerT8 (#7)#
Un muestreador de 8 pasos diseñado específicamente para la generación AV de MiniMax-H3 con relojes de video y audio separados. Produce resultados rápidos y de alta calidad coordinando ambas líneas de tiempo mientras respeta tus restricciones Ref2VA. Si los visuales se sienten ligeramente adelantados o atrasados en relación con el ritmo o la acción, ajusta los desplazamientos de reloj de video y audio en pequeños incrementos para re-centrar la sincronización. Mantén el número de pasos en ocho para el equilibrio de Alta Calidad y Ultra-Rápido previsto. Implementado en el mismo plugin: Larryvrh/ComfyUI-MiniMax-H3-Turbo.
LoraLoaderBypassModelOnly (#2)#
Inyecta el MiniMax-H3 Turbo LoRA en el modelo base para acelerar la convergencia y mejorar la estabilidad en pasos bajos. Si notas sobre-agudización o desviación de identidad en ciertas imágenes, reduce ligeramente la fuerza de LoRA para recuperar la neutralidad. Para un detalle más impactante o un bloqueo temporal más fuerte, aumenta la fuerza con moderación. Referencia LoRA: larryvrh/MiniMax-H3-Turbo-Lora.
MiniMaxH3MemoryEfficientSageAttentionPatch (#17)#
Aplica una implementación de atención eficiente en memoria al modelo MiniMax-H3 para un mejor rendimiento en GPUs típicas. Úsalo tal cual para reducir la presión de VRAM en resoluciones más grandes y duraciones más largas. El parche es parte de la suite KJNodes para ComfyUI: kijai/ComfyUI-KJNodes.
MiniMaxH3AVDecodeT8 (#11)#
Decodifica el latente audiovisual en cuadros RGB y audio estéreo usando los VAEs emparejados MiniMax-H3. Aquí es donde se realiza la fidelidad final, así que mantén las elecciones de resolución realistas para tu GPU para evitar cuellos de botella de decodificación. El nodo genera cuadros y una señal de audio que están alineados en tiempo con los relojes del muestreador, listos para el multiplexado. Proporcionado por el plugin MiniMax H3 Turbo: Larryvrh/ComfyUI-MiniMax-H3-Turbo.
VHS_VideoCombine (#12)#
Combina cuadros decodificados y audio estéreo en un único MP4 usando Video Helper Suite. Configura tu tasa de cuadros preferida y habilita el recorte si luego sustituyes audio personalizado. Este nodo finaliza la entrega para que puedas previsualizar y exportar rápidamente. Referencia del proyecto: Kosinkadink/ComfyUI-VideoHelperSuite.
Extras opcionales#
- La indicación funciona mejor cuando divides la dirección visual y el diseño de sonido. Escribe la escena primero, luego agrega “Audio:” con instrumentos, estilo, tipo de sala e intensidad.
- Comienza con tamaños moderados que coincidan con el aspecto de tu imagen. Aumenta una vez que te guste el movimiento y el tiempo.
- Si la sincronización se siente desfasada, ajusta el desplazamiento del reloj de video o audio en lugar de cambiar la duración. Ajustes pequeños pueden bloquear el rendimiento al ritmo.
- Para tomas de personajes, elige imágenes con separación clara de sujetos e iluminación consistente para preservar la identidad a través del movimiento.
- Re-seed para explorar micro-variaciones en la redacción y el tiempo mientras mantienes la misma configuración.
Agradecimientos#
Este flujo de trabajo implementa y se basa en los siguientes trabajos y recursos. Agradecemos a RunningHub por la plantilla de flujo de trabajo Source, MiniMaxAI por los pesos del modelo MiniMax-H3, y a Larryvrh por MiniMax-H3 Turbo LoRA y el proyecto ComfyUI MiniMax H3 Turbo por sus contribuciones y mantenimiento. Para detalles autorizados, consulta la documentación original y los repositorios enlazados a continuación.
Recursos#
- Plantilla de flujo de trabajo Source de RunningHub
- Documentación / Notas de lanzamiento: Plantilla de flujo de trabajo Source
- Pesos del modelo MiniMax H3 de MiniMaxAI
- Hugging Face: MiniMaxAI/MiniMax-H3
- larryvrh/MiniMax-H3 Turbo LoRA
- Hugging Face: larryvrh/MiniMax-H3-Turbo-Lora
- Proyecto ComfyUI MiniMax H3 Turbo de Larryvrh
Nota: El uso de los modelos, conjuntos de datos y código referenciados está sujeto a las respectivas licencias y términos proporcionados por sus autores y mantenedores.


