ComfyUI>Flujos de trabajo>MiniMax H3 T2V ComfyUI - Generador de Texto a Video con IA

MiniMax H3 T2V ComfyUI - Generador de Texto a Video con IA

Workflow Name: RunComfy/MiniMax-H3-T2V
Workflow ID: 0000...1472
Convierte un solo aviso en una escena de video completa. Obtienes movimiento cinematográfico y sonido estéreo nativo juntos. Crea diálogo, canto o tomas conceptuales. El gráfico de texto a video de MiniMax H3 mantiene el audio sincronizado. Puedes probar ideas más rápido. Ejecútalo listo para usar en RunComfy.

MiniMax H3 T2V ComfyUI Workflow

MiniMax H3 T2V ComfyUI - Video and Native Stereo Audio
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

MiniMax H3 T2V ComfyUI Examples

MiniMax H3 T2V ComfyUI: de aviso a video con audio estéreo nativo#

MiniMax H3 T2V ComfyUI convierte un solo aviso en un video cinematográfico corto con audio estéreo sincronizado. Construido a partir de la plantilla oficial de Comfy.org y los pesos abiertos de Comfy-Org MiniMax-H3, sigue la ruta FL2VA para que el movimiento y el sonido se generen juntos, no ensamblados después. Es ideal para exploraciones rápidas de escenas solo con aviso, clips de diálogo o canto, y tomas conceptuales que necesitan tanto visuales como sonido en una sola pasada.

Describe las tomas, la cámara, la actuación y las señales de audio en un solo bloque, elige el tamaño y la duración, luego encola el gráfico. El flujo de trabajo carga los componentes correctos de MiniMax-H3, muestrea latentes audiovisuales conjuntos, los decodifica en fotogramas y audio estéreo, mezcla el resultado y guarda un archivo de video terminado.

Modelos clave en el flujo de trabajo Comfyui MiniMax H3 T2V ComfyUI#

  • Modelo de difusión MiniMax-H3 FL2VA. El núcleo UNet que realiza la eliminación de ruido conjunta de audio y video para que el movimiento y el sonido permanezcan alineados en fase. Pesos proporcionados por Comfy-Org bajo diffusion_models. Model files
  • MiniMax-H3 Video VAE. Codifica y decodifica latentes visuales a fotogramas RGB, preservando el detalle cinematográfico y la continuidad del movimiento. minimax_h3_video_vae_fp16.safetensors
  • MiniMax-H3 Audio VAE. Codifica y decodifica latentes de audio a una forma de onda estéreo alineada en el tiempo para cada clip. minimax_h3_audio_vae_fp32.safetensors
  • Codificador de texto Qwen3-VL 32B (AWQ para MiniMax-H3). Interpreta el aviso en una condición que cubre la semántica de la escena, el tiempo y la intención del audio. qwen3vl_32b_minimax_h3_nvfp4_awq.safetensors

Si deseas comparar la plantilla original en la que se basa este gráfico, consulta la referencia de Comfy.org. Template JSON

Cómo usar el flujo de trabajo Comfyui MiniMax H3 T2V ComfyUI#

A un alto nivel, estableces la resolución y duración objetivo, escribes un solo aviso que incluye tanto visuales como audio, opcionalmente agregas el primer y último fotograma, luego ejecutas. Dentro del subgráfico, MiniMax-H3 crea latentes de video y audio sincronizados, que se decodifican, se unen en una película de 24 fps y se guardan.

ResolutionSelector (#115)#

Elige una relación de aspecto y escala para establecer width y height. El selector redondea a múltiplos eficientes de 32 y alimenta esos valores al subgráfico MiniMax-H3, por lo que no necesitas calcular las dimensiones manualmente. Comienza con tamaños moderados para una iteración más rápida, luego escala una vez que tu aviso se lea correctamente. Cambiar la relación de aspecto es una poderosa palanca creativa para trailers, clips verticales y previsualizaciones cuadradas.

Image to Video (MiniMax H3) (#105)#

Este subgráfico orquesta la tubería de ComfyUI MiniMax H3 T2V. Pega un aviso coherente que describa las tomas, ediciones y la banda sonora juntas, y opcionalmente proporciona imágenes de first_frame y last_frame para anclar la entrada y salida. Establece una duration amigable para los humanos y el gráfico la convierte en un número de fotogramas válido para el modelo. El subgráfico devuelve latentes audiovisuales sincronizados que proceden a la decodificación y mezcla.

Grupo de modelos#

El grupo de modelos carga los componentes exactos de MiniMax-H3 para este flujo de trabajo. UNETLoader (#6) extrae el modelo de difusión FL2VA, CLIPLoader (#13) carga el codificador Qwen3-VL, y dos nodos VAELoader (#11 video, #24 audio) preparan los decodificadores. Estos están dirigidos a los archivos MiniMax-H3 de Comfy-Org para que puedas ejecutar sin cableado manual. Mantener los modelos centralizados aquí hace que futuros intercambios o actualizaciones sean sencillos.

Grupo de acondicionamiento#

MiniMaxH3ImageToVideo (#104) convierte tu aviso, opcionalmente first_frame y last_frame, y el width, height y length seleccionados en un acondicionamiento MiniMax-H3 más un latente inicial. La idea es permitir que el modelo lea tanto el contenido de la escena como la intención del audio a la vez, lo que lleva a una sincronización más ajustada. Si proporcionas fotogramas de referencia, la entrada y salida están guiadas para la continuidad; si los dejas vacíos, la generación comienza en frío.

Grupo de muestreo#

El muestreo es manejado por RandomNoise (#15), KSamplerSelect (#17), BasicScheduler (#9), BasicGuider (#16), y el principal SamplerCustomAdvanced (#14). Juntos eliminan el ruido del latente conjunto para que el movimiento de la imagen y los eventos de sonido se desarrollen en sincronía. Puedes volver a ejecutar con una nueva semilla para tomas alternativas mientras mantienes la misma dirección creativa. Una vez cómodo, experimentar con la elección del muestreador o el horario puede cambiar ligeramente la energía del movimiento y la textura sonora.

Grupo de decodificación y creación de video#

VAEDecode (#10) reconstruye la secuencia de fotogramas del latente de video, y VAEDecodeAudio (#23) reconstruye una forma de onda estéreo del latente de audio. CreateVideo (#91) multiplexa fotogramas y audio en un clip terminado a 24 fps. Aquí es donde los cortes limpios y los ritmos especificados en el aviso se unen en la línea de tiempo. La salida procede a guardarse.

SaveVideo (#92)#

Escribe el video final en tu salida ComfyUI bajo video/MiniMax_H3. El nodo utiliza un nombramiento automático para que puedas iterar rápidamente, y puedes cambiar la ruta para mantener diferentes proyectos separados. La salida contiene tanto la imagen generada como el audio estéreo.

Nodos clave en el flujo de trabajo Comfyui MiniMax H3 T2V ComfyUI#

MiniMaxH3ImageToVideo (#104)#

Nodo de acondicionamiento central para MiniMax-H3 que acepta prompt, opcionalmente first_frame y last_frame, además de width, height y length. Mantén los avisos concisos pero cinematográficos, e incluye señales de audio como ambiente, efectos de sonido, diálogo y golpes musicales en el mismo bloque de texto. Usa fotogramas de referencia cuando necesites una entrada o salida específica; omítelos para una puesta en escena más libre.

ComfyMathExpression (#107)#

Mapea una duration legible por humanos en segundos a la length entera que el modelo espera, ajustándose a la cuadrícula de fotogramas del modelo para una sincronización limpia. Establece el flotante en la longitud de clip que deseas y deja que el nodo maneje la conversión. Los clips ligeramente más cortos tienden a preservar un movimiento y sincronización de sonido nítidos a resoluciones más altas.

SamplerCustomAdvanced (#14)#

Impulsa el proceso de eliminación de ruido basado en el muestreador y el horario seleccionados. Usa una noise_seed fija para bloquear una toma para comparación, luego cambia solo la semilla para explorar nuevas variaciones. Si el movimiento se siente demasiado caótico o demasiado rígido, prueba un muestreador diferente en KSamplerSelect (#17) o ajusta el horario en BasicScheduler (#9).

CreateVideo (#91)#

Combina fotogramas decodificados y audio estéreo en una sola transmisión de video a la velocidad de fotogramas que elijas. Para ediciones impulsadas por ritmo, establece fps para que coincida con la cadencia que describiste en el aviso. El nodo es también donde cambiarías fps si quieres una sensación más lenta o más rápida.

ResolutionSelector (#115)#

Un control para tanto la relación de aspecto como el conteo total de píxeles, con redondeo automático a tamaños amigables para el modelo. Elige primero el aspecto, luego ajusta la escala para equilibrar velocidad y fidelidad. Los lienzos más grandes recompensan el aviso cuidadoso y las duraciones más cortas.

SaveVideo (#92)#

Finaliza el clip en disco. Apúntalo a una subcarpeta del proyecto para mantener los experimentos organizados y renómbralo sabiamente cuando consigas un guardián.

Extras opcionales#

  • Escribe avisos como mini guiones gráficos con señales de tiempo y ritmos de audio explícitos para una sincronización confiable.
  • Incluye palabras de intención de audio como viento, pasos, multitud, reverberación o instrumentos específicos para guiar la banda sonora.
  • Agrega líneas para diálogo o canto directamente en el aviso y señala el tono del hablante.
  • Bloquea una noise_seed al comparar ajustes del aviso, cambia solo la semilla al explorar tomas alternativas.
  • Usa first_frame y last_frame para delimitar el movimiento cuando necesites continuidad en los cortes o una pose final precisa.

Agradecimientos#

Este flujo de trabajo implementa y se basa en los siguientes trabajos y recursos. Agradecemos a Comfy-Org por la plantilla de flujo de trabajo MiniMax H3 T2V y los pesos del modelo MiniMax-H3, a Comfy.org por el tutorial MiniMax H3, y a MiniMax por el anuncio oficial de MiniMax H3 por sus contribuciones y mantenimiento. Para detalles autorizados, consulta la documentación y repositorios originales vinculados a continuación.

Recursos#

Nota: El uso de los modelos, conjuntos de datos y código referenciados está sujeto a las respectivas licencias y términos proporcionados por sus autores y mantenedores.

RunComfy
Derechos de autor 2026 RunComfy. Todos los derechos reservados.

RunComfy es la principal ComfyUI plataforma, ofreciendo ComfyUI en línea entorno y servicios, junto con flujos de trabajo de ComfyUI con impresionantes imágenes. RunComfy también ofrece AI Models, permitiendo a los artistas aprovechar las últimas herramientas de AI para crear arte increíble.