ComfyUI>Flujos de trabajo>VDN H3 ComfyUI Texto a Video | Flujo de Trabajo Rápido MiniMax H3 VDN de 8 Pasos sin LoRA

VDN H3 ComfyUI Texto a Video | Flujo de Trabajo Rápido MiniMax H3 VDN de 8 Pasos sin LoRA

Workflow Name: RunComfy/VDN-H3-Text-To-Video
Workflow ID: 0000...1513
Crea videos MiniMax H3 con audio a partir de indicaciones de texto. Obtienes muestreo de 8 pasos con atención híbrida de Video DeltaNet. Construye escenas de fantasía, conducción o combate. Compara salidas con la rama FastVideo. Refina indicaciones para control creativo.

VDN H3 ComfyUI Text To Video Workflow

VDN H3 ComfyUI Text To Video | 8-Step Video and Audio
¿Quiere ejecutar este flujo de trabajo?
  • Flujos de trabajo completamente operativos
  • Sin nodos ni modelos faltantes
  • No se requiere configuración manual
  • Presenta visuales impresionantes

VDN H3 ComfyUI Text To Video Examples

VDN H3 MiniMax ComfyUI Texto a Video#

VDN H3 ComfyUI Texto a Video convierte indicaciones en lenguaje natural en videos cortos y cinematográficos con audio sincronizado. Combina la familia MiniMax H3 con atención híbrida de Video DeltaNet y muestreo de 8 pasos para generar video y audio a partir de una sola indicación. Es adecuado para guiones gráficos, clips de productos y escenas estilizadas como fantasía cinematográfica, conducción de rally y duelos de espadas blindadas.

El gráfico incluye dos ramas seleccionables de forma independiente. La rama VDN-H3 aplica el parche de Video DeltaNet y se utilizó para producir los ejemplos incluidos. La rama FastVideo se proporciona para comparar el tiempo de salida y generación con la ruta VDN. Ambas ramas renderizan MP4 con audio a la tasa de cuadros elegida.

Construido sobre componentes abiertos: VDN para MiniMax H3 GitHub y Hugging Face, nodos VDN-H3 ComfyUI por Saganaki22 GitHub, y pesos base MiniMax H3 y VAEs Hugging Face.

Modelos clave en el flujo de trabajo de Comfyui VDN H3 ComfyUI Texto a Video#

  • Modelo de difusión MiniMax-H3 (UNet). Dirige el proceso de eliminación de ruido que convierte el ruido en latentes de video y audio coherentes espaciotemporales. Los pesos se proporcionan en el paquete MiniMax H3 en Hugging Face.
  • Codificador de texto Qwen3-VL 32B MiniMax-H3. Convierte tu indicación en acondicionamiento para la generación de video y audio, ajustado para la familia H3. Incluido en el lanzamiento de MiniMax H3 en Hugging Face.
  • MiniMax-H3 Video VAE. Decodifica latentes de video a cuadros RGB. Disponible en la sección de VAEs de Hugging Face.
  • MiniMax-H3 Audio VAE. Reconstruye audio en forma de onda a partir de latentes de audio. También se proporciona en Hugging Face.
  • Pesos de parche VDN-H3. Video DeltaNet aplica atención híbrida a MiniMax H3. Obtén los puntos de control de Hugging Face.
  • Variante FastVideo UNet. La rama de comparación usa minimax_h3_fastvideo_vsa_datafree_1300step_4step_int8_convrot.safetensors de Kijai/MiniMax-H3-experimental.

Cómo usar el flujo de trabajo de Comfyui VDN H3 MiniMax ComfyUI Texto a Video#

Comienza configurando tu indicación, resolución, duración y tasa de cuadros. Selecciona la rama VDN-H3 o la rama FastVideo para una ejecución individual. Queue All puede ejecutar ambas ramas habilitadas y producir dos MP4s; las ramas de gráficos separadas no garantizan la ejecución simultánea de la GPU. Ambas ramas están configuradas para 8 pasos de muestreo.

Entrada del usuario#

Usa el panel (input:prompt) Text Prompt para describir tanto visuales como sonido en lenguaje sencillo. Para audio, agrega una línea final que comience con Audio: para solicitar Foley o ambiente específico, por ejemplo "Audio: cascos rítmicos, viento, rugido distante." Controla el tamaño visual con (input:Resolution) Megapixels que alimenta al ResolutionSelector para producir un ancho y alto que sean amigables con el cálculo. Establece (input:Duration) Seconds y (input:FPS) para definir cuán largo y suave debería sentirse el clip. El flujo de trabajo convierte la duración y FPS a un recuento de cuadros válido y lo ajusta silenciosamente a una longitud de secuencia que funciona bien con los internos de H3.

Modelos#

El CLIPLoader proporciona el codificador de texto ajustado para MiniMax utilizado para el acondicionamiento. Dos nodos VAELoader traen el MiniMax-H3 Video VAE y Audio VAE para que los cuadros y el sonido decodificados coincidan con el espacio latente del modelo. Estos cargadores son compartidos por ambas ramas para asegurar resultados A/B consistentes.

Acondicionamiento#

MiniMaxH3ImageToVideo (#219) convierte tu indicación más tamaño y longitud en el latente inicial de video y audio junto con el acondicionamiento positivo. Se pueden usar entradas de imagen opcionales para bloquear el primer o último cuadro cuando necesitas una pose de entrada o salida específica. Esta etapa es donde tus decisiones narrativas importan más: movimiento de cámara, acción del sujeto, iluminación, y la línea Audio: se convierten en guía para el muestreador aguas abajo.

Parche VDN-H3#

La rama VDN aplica la actualización de Video DeltaNet con ApplyVDNH3Advanced (#6126). Aplica el parche de atención híbrida seleccionado. MiniMaxChunkFeedForward y ModelPatchTorchSettings configuran la memoria y la ejecución. MiniMaxH3SigmaShift ajusta la programación de ruido para video y audio antes de que comience el muestreo.

Muestreo (VDN-H3)#

El muestreo VDN comienza desde RandomNoise (#6141), fusiona la guía con BasicGuider (#6134), elige el solucionador en KSamplerSelect (#6137), y programa un número compacto de pasos de difusión en BasicScheduler (#6136). SamplerCustomAdvanced (#6135) realiza la eliminación de ruido sobre la secuencia completa para producir latentes de video y audio refinados. Mantén la semilla fija para repetibilidad o cámbiala para obtener variaciones frescas con la misma indicación.

Decodificación y creación de video (VDN-H3)#

VAEDecode (#6146) reconstruye los cuadros mientras que VAEDecodeAudio (#6145) reconstruye la banda sonora. VHS_VideoCombine (#6170) mezcla cuadros y audio en un MP4, respetando la tasa de cuadros que configuraste anteriormente y guardando un archivo listo para vista previa. La salida VDN se guarda con un prefijo de nombre de archivo distinto para que sea fácil de comparar con el resultado de FastVideo.

Rama de comparación FastVideo#

La ruta FastVideo carga un MiniMax H3 UNet ajustado para velocidad y aplica un parche de atención liviano antes del muestreo. Reutiliza tu indicación, tamaño y recuento de cuadros para que puedas comparar directamente el tiempo y el aspecto. El muestreo refleja la estructura de la rama VDN y también está configurado para 8 pasos. Los cuadros y el audio se decodifican y combinan con VHS_VideoCombine (#6104) para producir un segundo MP4. Usa estas salidas lado a lado para decidir qué rama se adapta mejor a tu escena.

Nodos clave en el flujo de trabajo de Comfyui VDN H3 ComfyUI Texto a Video#

  • ApplyVDNH3Advanced (#6126). Habilita Video DeltaNet en MiniMax H3 usando el punto de control seleccionado de la publicación VDN-H3. Ajusta solo cuando desees cambiar el punto de control VDN o cambiar los backend de atención; mantén los valores predeterminados de atención híbrida para uso general. Implementación de referencia: Saganaki22/ComfyUI-VDN-H3.
  • MiniMaxH3ImageToVideo (#219). Punto de control central para historia y cronometraje, aceptando la indicación de texto, el ancho y alto calculados, y el recuento de cuadros derivado. Para audio, agrega una sola línea Audio: a la indicación para guiar Foley y ambiente mientras evitas el habla a menos que se solicite explícitamente.
  • MiniMaxH3SigmaShift (#6131, #6007). Reequilibra la programación sigma para flujos de video y audio, lo que puede ayudar a reducir el temblor y preservar el detalle en recuentos bajos de pasos. Considera pequeños ajustes solo si cambias variantes de modelo o notas inestabilidad en el movimiento.
  • VHS_VideoCombine (#6170, #6104). Mezcla cuadros decodificados y audio en MP4 con tu tasa de cuadros y prefijo de nombre de archivo elegidos. Las opciones útiles incluyen recorte a la longitud del audio y selección del formato de píxel H.264 deseado. Página del proyecto: ComfyUI-VideoHelperSuite.

Extras opcionales#

  • Consejos para indicaciones: comienza con una sola oración que establezca sujeto, acción y movimiento de cámara, luego agrega pistas de apariencia y una línea Audio: para foley.
  • Para clips más largos, prefiere megapíxeles modestos sobre alta resolución para mantener el movimiento estable y el uso de memoria bajo control.
  • Fija la semilla en RandomNoise cuando desees iteraciones consistentes; cámbiala para explorar variaciones.
  • Compara las dos ramas en tu propia escena para evaluar la calidad de salida y el tiempo de generación.
  • Si alcanzas límites de memoria, reduce megapíxeles o duración primero; el feed-forward en trozos ya ayuda con secuencias más largas.

Agradecimientos#

Este flujo de trabajo implementa y se basa en los siguientes trabajos y recursos. Agradecemos a OpenVDN por el modelo vdn-minimax-h3, pesos y repositorio, a Saganaki22 por los nodos ComfyUI-VDN-H3, y a Benji (AI Future Tech) por el flujo de trabajo VDN-H3 por sus contribuciones y mantenimiento. Para detalles autorizados, consulte la documentación original y los repositorios enlazados a continuación.

Recursos#

Nota: El uso de los modelos, conjuntos de datos y código referenciados está sujeto a las licencias y términos respectivos proporcionados por sus autores y mantenedores.

RunComfy
Derechos de autor 2026 RunComfy. Todos los derechos reservados.

RunComfy es la principal ComfyUI plataforma, ofreciendo ComfyUI en línea entorno y servicios, junto con flujos de trabajo de ComfyUI con impresionantes imágenes. RunComfy también ofrece AI Models, permitiendo a los artistas aprovechar las últimas herramientas de AI para crear arte increíble.