ComfyUI>Flujos de trabajo>LTX 2.5 ComfyUI Imagen a Video | Movimiento Realista & Audio Nativo

LTX 2.5 ComfyUI Imagen a Video | Movimiento Realista & Audio Nativo

Workflow Name: RunComfy/LTX-2.5-ComfyUI
Workflow ID: 0000...1489
Puedes convertir una imagen en un corto cinematográfico. Guía el movimiento con un aviso en lenguaje natural. Obtén movimiento más nítido y audio sincronizado. Usa la mejora de avisos para un mejor control de la escena. Anima retratos, productos, animales o ubicaciones. Ejecuta el flujo de trabajo LTX-2.5 en RunComfy sin configuración adicional.

LTX 2.5 ComfyUI Workflow

LTX 2.5 ComfyUI Image to Video | Synced Audio
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

LTX 2.5 ComfyUI Examples

LTX 2.5 ComfyUI Imagen a Video con Audio Sincronizado#

Este flujo de trabajo LTX 2.5 ComfyUI listo para RunComfy convierte un solo primer fotograma y un aviso de movimiento en un corto cinematográfico con audio coherente y en-modelo. Está impulsado por la familia Lightricks LTX-2.5, combinando Difusión de Píxeles, un potenciador de avisos basado en Gemma, VAEs de video y audio, y una ampliación latente para un movimiento nítido y una fuerte adherencia a los avisos.

Usa este grafo LTX 2.5 ComfyUI para animar retratos, ubicaciones atmosféricas, productos, animales y tomas conceptuales mientras permaneces dentro de ComfyUI. Proporciona una imagen de inicio, describe la acción y la cámara, establece la duración y la tasa de fotogramas, y renderiza una toma que mantiene el carácter, la iluminación y el estilo a través de los fotogramas.

Modelos clave en el flujo de trabajo Comfyui LTX 2.5 ComfyUI#

Cómo usar el flujo de trabajo Comfyui LTX 2.5 ComfyUI#

Este flujo de trabajo expande y condiciona tu aviso, construye latentes de video y audio, realiza un pase de baja resolución, realiza una ampliación latente, luego decodifica en fotogramas y audio sincronizado para la mezcla final. El controlador de nivel superior es Image to Video (LTX-2.5) (#398), que toma tu primer fotograma, aviso de texto, y configuraciones clave, luego se enruta al subgrafo.

Preprocesamiento de Imagen#

Proporciona tu imagen de inicio a Load First Frame (#395). El fotograma se estandariza en LTXVPreprocess (#350) a una base limpia y amigable con el modelo. Usa ResolutionSelector (#403) para elegir el aspecto y la escala; produce ancho y alto alineados a múltiplos amigables con el modelo. Los buenos primeros fotogramas son nítidos, bien iluminados y compuestos para el movimiento que planeas describir. El preprocesador evita cambios destructivos mientras prepara la imagen para el muestreo latente.

Mejora de Avisos#

Escribe tu aviso de movimiento y cámara en Prompt (#376). Si habilitas el potenciador incorporado, TextGenerateLTX2Prompt (#380) enriquece tu texto con detalles sobre los ritmos de acción, continuidad y encuadre usando un modelo basado en Gemma. El conmutador ComfySwitchNode (#382) te permite enrutar tu texto en bruto o la versión mejorada al condicionamiento. Este paso mejora la adherencia a los avisos para entradas cortas y ayuda a mantener sujetos y estilo a través de los fotogramas. Puedes previsualizar el texto expandido en PreviewAny (#381) antes de renderizar.

Modelo#

El subgrafo carga el generador destilado en UNETLoader (#384) y los decodificadores en VAELoader para video (#385) y audio (#386). El modelo de ampliación latente se prepara por LatentUpscaleModelLoader (#371) para un pase x2 limpio de detalles más tarde. Este bloque asegura que la misma familia de modelos LTX-2.5 se use a través de la codificación, muestreo y decodificación, lo que preserva la coherencia temporal.

Aviso#

CLIPLoader (#387) y CLIPTextEncode positivo (#364) convierten tu aviso descriptivo en condicionamiento. Un codificador negativo dedicado (#373) suprime rasgos no deseados como baja calidad o artefactos. LTXVConditioning (#365) fusiona el condicionamiento de texto con la tasa de fotogramas elegida para que la guía de tiempo fluya en la corriente latente audiovisual. Mantener el lenguaje de cámara y acción claro conduce a un movimiento más estable y a una latitud de edición.

Configuración de Video#

Duración, ancho, alto, tasa de fotogramas y semilla se establecen en el grupo Video Settings (p. ej., Duration (#362) y Frame Rate (#361)). Ayudantes matemáticos simples calculan el conteo total de fotogramas y alimentan valores uniformes donde sea necesario. Elige una tasa de fotogramas que coincida con el sentimiento que deseas; la acción más lenta puede verse mejor a fps más bajos, mientras que el movimiento rápido se beneficia de fps más altos. Para tomas reproducibles, fija la semilla; varíala para explorar alternativas.

Latente Vacío#

EmptyLTXVLatentVideo (#356) crea un video latente del tamaño y longitud correctos, mientras que LTXVEmptyLatentAudio (#366) construye un latente de audio alineado en tiempo. Esto asegura que los flujos de video y audio compartan el tiempo desde el principio. Con la longitud derivada de la duración y la tasa de fotogramas, el muestreador recibe tensores de forma correcta. El resultado es una base sincronizada para la desinfección conjunta audiovisual.

Generar Baja Resolución#

Un primer pase de muestreo construye movimiento coherente a una resolución manejable. LTXVDualCFGGuider (#388) aplica orientación de modalidad dual para que tanto el texto como el tiempo den forma a los latentes de video y audio juntos. SamplerCustomAdvanced (#344) ejecuta los pasos de difusión con tu muestreador y programación elegidos, sembrado por RandomNoise (#339). La restricción del primer fotograma se aplica por LTXVImgToVideoInplace (#357), que mantiene la identidad, iluminación y composición ancladas a tu imagen proporcionada. Después del muestreo, LTXVConcatAVLatent y LTXVSeparateAVLatent barajan los latentes de audio y video según sea necesario para las próximas etapas.

Ampliación Latente#

LTXVLatentUpsampler (#348) realiza una ampliación x2 en el espacio latente para afilar texturas y microdetalles antes de decodificar. LTXVImgToVideoInplace (#349) realinea el latente ampliado con el fotograma inicial para que la identidad y el diseño permanezcan estables. Hacer esto en el espacio latente preserva la suavidad temporal mejor que el redimensionamiento en el espacio de píxeles. Esta etapa es un contribuyente importante a la nitidez final.

Generar Alta Resolución#

Un muestreador de refinamiento (KSamplerSelect (#341) más SamplerCustomAdvanced (#368)) se ejecuta en el latente ampliado con una programación más corta, estabilizando bordes y enriqueciendo detalles. LTXVDualCFGGuider (#391) mantiene la orientación consistente con tu texto mientras preserva el movimiento establecido en el primer pase. El latente combinado luego se divide por LTXVSeparateAVLatent (#369) para la decodificación. VAEDecodeTiled (#374) convierte el latente de video en fotogramas y LTXVAudioVAEDecode (#358) produce audio sincronizado.

Renderizar y Guardar#

CreateVideo (#370) mezcla fotogramas y audio a tu fps elegido en un solo flujo de video. De vuelta en el grafo exterior, SaveVideo (#75) escribe el resultado en tu salida normal de ComfyUI. También puedes audicionar el audio solo a través de un nodo de previsualización en el contenedor de nivel superior antes de las renderizaciones completas.

Nodos clave en el flujo de trabajo Comfyui LTX 2.5 ComfyUI#

Image to Video (LTX-2.5) (#398)#

Este es el controlador único para toda la tubería. Proporciona el primer fotograma, tu aviso, duración, resolución, tasa de fotogramas, y si deseas habilitar la mejora de avisos. Úsalo para iterar rápidamente; cuando estés listo para afinar, haz clic en Entrar al subgrafo para ajustar muestreadores, orientación y decodificación. Si necesitas video solo de texto, abre el subgrafo y activa el bypass interno de texto a video en los nodos de imagen a video.

LTXVDualCFGGuider (#388)#

Aplica orientación libre de clasificador a través del latente audiovisual conjunto, equilibrando la adherencia a los avisos con la estabilidad temporal. Aumenta la orientación para un seguimiento más fuerte de los avisos y un movimiento más impactante; redúcelo para disminuir el parpadeo o preservar más de los matices del fotograma inicial. Mantén la orientación de video y audio en el mismo rango para que la banda sonora permanezca alineada con la acción en pantalla.

SamplerCustomAdvanced (#344)#

Impulsa la difusión con tu muestreador elegido y una programación sigma personalizada. Usa este nodo para explorar la calidad del movimiento frente a la estabilidad cambiando variantes de muestreador o editando programas. Combínalo con una semilla fija para comparar configuraciones de forma consistente, luego aleatoriza la semilla para buscar la mejor toma.

LTXVLatentUpsampler (#348)#

Amplía en el espacio latente con el modelo LTX-2.5 x2 dedicado, mejorando el detalle sin introducir tambaleos temporales. Si planeas recortes intensos o primeros planos ajustados, mantén esto habilitado para que las pequeñas características sobrevivan a la decodificación. Para límites extremos de VRAM, puedes omitir la ampliación a costa de algo de nitidez.

VAEDecodeTiled (#374)#

Decodifica latentes de video de alta resolución en fotogramas usando mosaicos para controlar el uso de memoria. En VRAM más baja, prefiere mosaicos más pequeños para evitar errores de falta de memoria. En VRAM más alta, los mosaicos más grandes pueden reducir costuras y acelerar la decodificación.

CreateVideo (#370)#

Combina los fotogramas decodificados con el audio generado en un solo flujo de video a tu tasa de fotogramas seleccionada. Ajusta fps aquí para coincidir con la intención creativa o para cumplir con los requisitos de la plataforma. La salida mezclada luego se pasa al guardador en el grafo exterior.

Extras opcionales#

  • Mantén los avisos concisos pero concretos: quién/qué, acción, movimiento de cámara, iluminación, estado de ánimo. Deja que el Potenciador de Avisos añada frases cinematográficas.
  • Evita direcciones de cámara conflictivas. Un movimiento fuerte (acercamiento, paneo, dolly) tiende a producir resultados más estables que apilar varios.
  • Usa primeros fotogramas limpios y de alto contraste para retratos y tomas de productos; el modelo preservará mejor la identidad y los bordes.
  • Comienza con duraciones moderadas para ajustar el movimiento y el encuadre; extiende solo después de que te guste el comportamiento.
  • Si las salidas parecen suaves, verifica que el ancho y alto sean múltiplos de 32 y mantén habilitado el ampliador latente.
  • Para iteraciones consistentes, fija la semilla. Al explorar alternativas, varía la semilla mientras mantienes intactas otras configuraciones.

Agradecimientos#

Este flujo de trabajo implementa y se construye sobre los siguientes trabajos y recursos. Agradecemos de manera especial a Comfy Org por el flujo de trabajo LTX-2.5: Plantilla de flujo de trabajo de ComfyUI de Imagen a Video, a Lightricks por los pesos del modelo LTX-2.5, a Lightricks por el proyecto LTX-2.5 Diffusers, y a Lightricks por los recursos de la organización Hugging Face por sus contribuciones y mantenimiento. Para obtener detalles autorizados, consulte la documentación y los repositorios originales vinculados a continuación.

Recursos#

Nota: El uso de los modelos, conjuntos de datos y código referenciados está sujeto a las respectivas licencias y términos proporcionados por sus autores y mantenedores.

Want More ComfyUI Workflows?

RunComfy
Derechos de autor 2026 RunComfy. Todos los derechos reservados.

RunComfy es la principal ComfyUI plataforma, ofreciendo ComfyUI en línea entorno y servicios, junto con flujos de trabajo de ComfyUI con impresionantes imágenes. RunComfy también ofrece AI Models, permitiendo a los artistas aprovechar las últimas herramientas de AI para crear arte increíble.