ComfyUI>Flujos de trabajo>MiniMax H3 ComfyUI Texto-a-Video Turbo de 4 pasos

MiniMax H3 ComfyUI Texto-a-Video Turbo de 4 pasos

Workflow Name: RunComfy/MiniMax-H3-Turbo
Workflow ID: 0000...1483
Convierte un único aviso cinematográfico en un video corto. Obtienes sonido estéreo nativo en la misma pasada. Crea diálogo claro, canto y escenas ambientales. Hailuo H3 Turbo utiliza un muestreo de cuatro pasos para borradores más rápidos. Puedes probar ideas rápidamente. Exporta movimiento y audio juntos.

MiniMax H3 ComfyUI Text-to-Video 4-step Turbo Workflow

MiniMax H3 ComfyUI Text-to-Video | 4-Step Turbo
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

MiniMax H3 ComfyUI Text-to-Video 4-step Turbo Examples

MiniMax H3 ComfyUI Texto-a-Video Turbo de 4 pasos: aviso a clip con audio nativo en una sola pasada#

Este flujo de trabajo convierte un único aviso cinematográfico en un video corto con audio estéreo generado conjuntamente usando MiniMax H3. Aplica un LoRA de aceleración Turbo de 4 pasos para que puedas iterar rápidamente en diálogos, canto y escenas ambientales mientras mantienes el movimiento y el sonido estrechamente acoplados.

Construido para creadores que desean borradores solo con avisos, el flujo de trabajo Turbo de 4 pasos de MiniMax H3 ComfyUI Texto-a-Video produce habla o voces limpias, sonido ambiental cohesivo y cinematografía coherente sin ensamblaje manual de audio. El gráfico maneja la alineación de longitud, muestreo latente, decodificación y multiplexación automáticamente, para que puedas enfocarte en la narración y las señales de actuación.

Modelos clave en el flujo de trabajo Turbo de 4 pasos de MiniMax H3 ComfyUI Texto-a-Video#

  • Modelo de difusión MiniMax H3 (FL2VA UNet). Generador audiovisual central que aprende un latente compartido para imagen y sonido, permitiendo un movimiento y audio sincronizados desde la misma pasada de muestreo. Pesos: Comfy-Org/MiniMax-H3.
  • Codificador de texto Qwen3-VL 32B para H3 (variante AWQ/NVFP4). Codifica avisos ricos y multi-oración en condicionantes que dirigen la disposición de la escena, el rendimiento y los eventos de audio. Empaquetado en Comfy-Org/MiniMax-H3.
  • MiniMax H3 Video VAE. Decodifica el latente de video muestreado en cuadros con tono y detalle cinematográfico. Archivo: minimax_h3_video_vae_fp16.safetensors.
  • MiniMax H3 Audio VAE. Decodifica el latente compartido en audio estéreo alineado en el tiempo para habla, canto y ambiente. Archivo: minimax_h3_audio_vae_fp32.safetensors.
  • MiniMax H3 Turbo 4-step LoRA. Aplica la receta de aceleración que preserva la fidelidad de la escena mientras permite un muestreo muy rápido. Archivo: minimax_h3_turbo_4step_pruned_comfyui.safetensors.

Cómo usar el flujo de trabajo Turbo de 4 pasos de MiniMax H3 ComfyUI Texto-a-Video#

A un alto nivel, tu aviso se codifica, un modelo H3 aumentado con Turbo muestrea un único latente audiovisual, y los VAEs de video y audio decodifican ese latente antes de que el clip se multiplexe a un archivo reproducible.

1) Escribe el aviso cinematográfico y establece la duración#

Usa el campo de texto easy positive (#147) para describir apariencia, acción y rendimiento. Para guiar la voz o música, incluye señales claras como "Audio: voz masculina de mediana edad entrega la línea... ambiente de lluvia... baja subrayado de thriller." El controlador Float (duration) (#133) establece la longitud del clip en segundos. Un nodo matemático convierte tu duración en cuadros y alinea silenciosamente el conteo al ritmo requerido de H3, por lo que no necesitas gestionar las matemáticas de cuadros.

2) Carga H3, codificador de texto, VAEs y Turbo LoRA#

UNETLoader (#127) carga el modelo de difusión MiniMax H3, y CLIPLoader (#128) carga el codificador de texto Qwen3-VL adaptado para H3. Dos nodos VAELoader traen el VAE de video (#119) y el VAE de audio (#120). LoraLoaderModelOnly (#153) aplica el MiniMax H3 Turbo 4-step LoRA al modelo para que el programador y el muestreador operen en un régimen rápido sin perder coherencia audiovisual.

3) Construir el acondicionamiento y el latente audiovisual inicial#

MiniMaxH3ImageToVideo (#131) convierte tu aviso en un acondicionamiento positivo y prepara un latente inicial alineado a tu ancho, alto y cantidad de cuadros elegidos. Existen entradas opcionales first_frame y last_frame para anclar una imagen de inicio o final si decides extender el gráfico más tarde. El nodo produce el acondicionamiento y el latente que el muestreo posterior refinará.

4) Muestreo con Turbo#

BasicGuider (#126) empareja el modelo con tu acondicionamiento, KSamplerSelect (#123) elige el algoritmo de muestreo, y BasicScheduler (#124) establece el programa de pasos que funciona con el Turbo LoRA. RandomNoise (#129) siembra la generación para reproducibilidad. SamplerCustomAdvanced (#125) realiza la pasada de desruido para producir el latente compartido final que codifica tanto video como audio.

5) Decodificar y exportar el clip final#

VAEDecode (#122) reconstruye los cuadros de imagen del latente mientras VAEDecodeAudio (#121) reconstruye el audio estéreo sincronizado. CreateVideo (#130) multiplexa cuadros y audio en un solo flujo, luego SaveVideo (#92) escribe el archivo en disco usando el prefijo de nombre de archivo que estableciste.

Nodos clave en el flujo de trabajo Turbo de 4 pasos de MiniMax H3 ComfyUI Texto-a-Video#

MiniMaxH3ImageToVideo (#131)#

Produce el acondicionamiento positivo e inicializa el latente audiovisual a partir de tu aviso, resolución y longitud. Ajustar width, height o length cambia tanto la escala de movimiento como cuánto puede caber la acción en pantalla. Si más tarde extiendes el gráfico, first_frame y last_frame te permiten bloquear la continuidad a través de tomas.

LoraLoaderModelOnly (#153)#

Aplica el Turbo 4-step LoRA al modelo H3 cargado. Mantén el programador en un régimen de bajo paso para beneficiarte del Turbo; aumentar sustancialmente los pasos desvía la apariencia del comportamiento de iteración rápida previsto. Este LoRA está diseñado específicamente para MiniMax H3 y se encuentra junto a los pesos principales en el repositorio H3.

BasicScheduler (#124)#

Controla el programa de desruido que sigue el muestreador. Úsalo para equilibrar la velocidad y la fidelidad mientras te mantienes compatible con el Turbo LoRA. Si cambias el algoritmo del muestreador, revisa la elección del programa para mantener un movimiento estable y un audio limpio.

SamplerCustomAdvanced (#125)#

Ejecuta el desruido real dado el ruido, el guía, el muestreador, las sigmas y el latente inicial. Es el árbitro final de la textura, el tiempo y la nitidez audiovisual. Usa la misma semilla al comparar ajustes de aviso para que puedas atribuir diferencias a cambios de texto en lugar de ruido.

PathchSageAttentionKJ (#150)#

Aplica una optimización de atención antes de la inyección de LoRA para mejorar el rendimiento en grandes resoluciones. Proporcionado por KJNodes, que ofrece ayudas de rendimiento para ComfyUI. Repositorio: ComfyUI-KJNodes.

CreateVideo (#130)#

Combina cuadros decodificados con el audio decodificado en un clip sincronizado. Puedes cambiar la tasa de cuadros o la profundidad de bits aquí si necesitas ajustar las especificaciones de entrega. El nodo mantiene la sincronización audio-video derivada del latente compartido.

SaveVideo (#92)#

Escribe el clip renderizado en disco con el prefijo de nombre de archivo, contenedor y códec que elijas. Usa un nombre consistente para rastrear iteraciones para la misma escena y semilla.

Extras opcionales#

  • Avisos para habla: pon la línea exacta después de "Audio:" y describe la edad, género, tono y ritmo de la voz. Para cantar, especifica estilo y tempo. Para ambiente, enumera fuentes, intensidad y si deseas solo subrayado.
  • Compromisos de resolución y duración: cuentas de píxeles más altas y clips más largos cuestan más tiempo de muestreo. Si necesitas muchas tomas, comienza más pequeño, luego escala o alarga una vez que el tiempo y la entrega se sientan correctos.
  • Reproducibilidad: mantén la misma semilla al ajustar solo el texto para que puedas hacer A/B de pequeños cambios de aviso.
  • La alineación de longitud es automática: el gráfico convierte segundos en cuadros y alinea el conteo al ritmo interno de H3 para una síntesis audiovisual estable.
  • Opciones de continuidad: el nodo del modelo expone first_frame y last_frame opcionales. Si extiendes el flujo de trabajo más tarde, conecta imágenes allí para que coincidan los inicios o finales de tomas a través de ediciones.
  • Seguridad: evita personajes con derechos de autor, semejanzas de personas reales sin consentimiento y logotipos o subtítulos en pantalla en tu aviso.

Agradecimientos#

Este flujo de trabajo implementa y se basa en los siguientes trabajos y recursos. Agradecemos a MiniMax por el modelo de generación multimodal MiniMax H3 y el anuncio, a Comfy.org por el tutorial de flujo de trabajo de MiniMax H3 ComfyUI, y a Comfy-Org por los pesos del modelo MiniMax-H3 por sus contribuciones y mantenimiento. Para detalles autorizados, por favor consulta la documentación original y los repositorios vinculados a continuación.

Recursos#

Nota: El uso de los modelos, conjuntos de datos y código referidos está sujeto a las respectivas licencias y términos proporcionados por sus autores y mantenedores.

RunComfy
Derechos de autor 2026 RunComfy. Todos los derechos reservados.

RunComfy es la principal ComfyUI plataforma, ofreciendo ComfyUI en línea entorno y servicios, junto con flujos de trabajo de ComfyUI con impresionantes imágenes. RunComfy también ofrece AI Models, permitiendo a los artistas aprovechar las últimas herramientas de AI para crear arte increíble.