LTX 2.5 Primer Último Fotograma a Video: clips cinematográficos anclados en dos fotogramas con audio sincronizado#
Este flujo de trabajo listo para RunComfy convierte una imagen de inicio y fin coincidentes en un video cinematográfico corto con audio sincronizado. Al guiar la generación desde tus anclajes de primer y último fotograma, preserva la composición, iluminación, identidad del sujeto y estilo mientras crea un movimiento coherente entre ambos. LTX 2.5 Primer Último Fotograma a Video es ideal para acciones de personajes controladas, ritmos de productos, movimientos de cámara y transiciones de escena dentro de ComfyUI.
Bajo el capó, combina el transformador LTX-2.5 de Lightricks con VAEs de video y audio dedicados más un potenciador de indicaciones basado en Gemma. El gráfico se entrega con grupos claros para Indicación, Configuraciones de Video, Preparación de Primer/Último Fotograma, Condicionamiento, Muestreo y Decodificación para que puedas obtener resultados confiables y repetibles sin tocar el cableado de bajo nivel.
Modelos clave en el flujo de trabajo Comfyui LTX 2.5 Primer Último Fotograma a Video#
- Transformador destilado Lightricks LTX-2.5. El generador de video central que aprende movimiento, apariencia y consistencia temporal a partir de guías de texto y visuales. Página del modelo
- VAE de Video LTX-2.5. Comprime y decodifica latentes de video para obtener fotogramas nítidos mientras mantiene un uso de memoria práctico. Incluido en el repositorio LTX-2.5. Página del modelo
- VAE de Audio LTX-2.5. Genera y reconstruye latentes de audio sincronizados para coincidir con eventos visuales. Incluido en el repositorio LTX-2.5. Página del modelo
- Codificador de texto Gemma 4 12B con proyección para LTX-2.5. Codifica tu indicación en un condicionamiento rico que cubre sujetos, acciones, iluminación y dirección de cámara. Incluido en los activos LTX-2.5. Página del modelo
- Variante ajustada por instrucciones Gemma 4 E2B para mejora de indicaciones. Expande entradas cortas en direcciones cinematográficas cuando la mejora está habilitada. Página del modelo
- Referencia opcional de Diffusers para tuberías LTX-2.5 y comportamiento de programación. Útil para entender las compensaciones del muestreador. Página del proyecto
Cómo usar el flujo de trabajo Comfyui LTX 2.5 Primer Último Fotograma a Video#
El flujo de trabajo toma dos imágenes como anclajes, las transforma en guías, luego elimina el ruido de los latentes de video y audio bajo control de texto antes de decodificar a un clip listo para compartir. Cada grupo a continuación juega un papel específico; la mayoría de los usuarios solo tocarán Indicación, Mejora de Indicación y Configuraciones de Video.
Indicación#
Escribe una instrucción concisa pero descriptiva en el nodo Prompt (#252). El texto positivo es codificado por CLIPTextEncode (#222) usando el codificador Gemma 4 12B para que el modelo entienda sujetos, acciones, iluminación e intención de cámara. Mantén descrito el estado final así como el inicio para ayudar al modelo a respetar ambos anclajes. Si necesitas redacción estricta o términos de marca, escríbelos explícitamente en la indicación.
Mejora de Indicación#
Las indicaciones cortas pueden expandirse automáticamente con TextGenerateLTX2Prompt (#247). El ComfySwitchNode (#248) enruta tu indicación original o el texto mejorado al codificador, y PreviewAny (#249) te permite inspeccionar el texto final. Habilita la mejora cuando desees una redacción cinematográfica y pistas de movimiento más ricas; desactívala cuando la redacción de la indicación deba permanecer exacta.
Configuraciones de Video#
Configura la duración del clip, la tasa de fotogramas y la resolución con Duration (#198), Frame Rate(int) (#205), Width (#215) y height (#216). El gráfico calcula el conteo total de fotogramas a través de ComfyMathExpression (#226) y asigna latentes de video en EmptyLTXVLatentVideo (#201) y latentes de audio en LTXVEmptyLatentAudio (#197). Una resolución o tasa de fotogramas más alta aumenta el uso de VRAM y el tiempo; comienza modesto, luego escala una vez que te guste el movimiento.
Primer Fotograma#
Carga tu imagen de inicio, que se redimensiona en ResizeImageMaskNode (#213) para coincidir con la resolución objetivo. LTXVPreprocess (#199) normaliza el tono y el detalle para una guía estable. Imágenes limpias, bien expuestas y composicionalmente claras hacen que el modelo se fije más rápido y reduzca la deriva no deseada del anclaje.
Último Fotograma#
Carga tu imagen final; se redimensiona en ResizeImageMaskNode (#214) y se normaliza en LTXVPreprocess (#195). Apunta a una relación de aspecto, perspectiva y escala del sujeto coincidentes en relación con el primer fotograma para que la transición se sienta físicamente plausible y el anclaje se preserve al final.
Condicionamiento#
El condicionamiento de texto se compone en LTXVConditioning (#202), que también recibe la tasa de fotogramas objetivo para que el tiempo se alinee a través de las ramas. La guía de imagen se adjunta en dos pasadas con LTXVAddGuide (#206) para el primer fotograma y LTXVAddGuide (#204) para el último fotograma, asegurando que ambos anclajes influyan en la trayectoria. LTXVCropGuides (#200) reconcilia cualquier diferencia de tamaño residual para que las guías se alineen perfectamente con el lienzo latente.
Muestreo#
El ruido se siembra en RandomNoise (#196), y la eliminación de ruido es impulsada por SamplerCustomAdvanced (#211) con SamplerEulerAncestral (#208) y un programa ManualSigmas (#239) para actualizaciones nítidas y estables en movimiento. La guía proviene de LTXVDualCFGGuider (#235) impulsada por el UNETLoader (#230), combinando condiciones positivas y negativas para dirigir el aspecto y el movimiento. Los latentes de audio y video se concatenan y luego se separan con LTXVConcatAVLatent (#210) y LTXVSeparateAVLatent (#221) para que el movimiento y el sonido evolucionen juntos.
Decodificación y salida#
Los latentes se decodifican a fotogramas con VAEDecodeTiled (#219) usando el VAE de video y a audio con LTXVAudioVAEDecode (#220) usando el VAE de audio. CreateVideo (#218) combina imágenes y audio a tu FPS elegido para producir un clip final. De vuelta en el gráfico superior, SaveVideo (#68) escribe el resultado; renombra o cambia la ubicación allí si lo deseas.
Nodos clave en el flujo de trabajo Comfyui LTX 2.5 Primer Último Fotograma a Video#
TextGenerateLTX2Prompt (#247)#
Expande entradas breves en una indicación cinematográfica y compatible con LTX. Úsalo cuando desees verbos más ricos, iluminación y lenguaje de cámara con un esfuerzo mínimo. Si necesitas una redacción exacta o segura para la marca, desactiva la mejora a través de ComfySwitchNode (#248) y proporciona el texto final tú mismo.
LTXVDualCFGGuider (#235)#
Combina el modelo LTX-2.5 con condicionamiento positivo y negativo para equilibrar la adherencia y la libertad. Aumenta la guía para una mayor fidelidad a la indicación y el anclaje; redúcela para un movimiento más suelto y orgánico. Una guía extremadamente alta puede sobreconstrainar el movimiento o introducir saturación, así que ajusta en conjunto con la fuerza de tu indicación negativa.
SamplerCustomAdvanced (#211)#
Ejecuta el bucle de eliminación de ruido usando SamplerEulerAncestral (#208) y el programa de sigma elegido. Usa programas más cortos para pruebas de velocidad y más largos cuando necesites más retención de detalles a través del movimiento. Si el movimiento se ve tembloroso, prueba una rampa de sigma más suave o baja ligeramente la guía para reducir la sobrecorrección entre pasos.
ManualSigmas (#239)#
Define el programa de ruido que intercambia nitidez contra suavidad temporal. El ruido cargado al inicio puede fomentar movimientos más grandes al principio, mientras que una cola más suave puede preservar detalles cerca del anclaje final. Ajusta solo después de estar satisfecho con la indicación y los anclajes.
VAEDecodeTiled (#219)#
Decodifica latentes de video a imágenes usando procesamiento en mosaico para ajustar resoluciones más grandes en memoria. Mosaicos más pequeños reducen el uso de VRAM pero pueden arriesgar costuras de mosaico; mosaicos más grandes son más limpios pero más pesados. Mantén la resolución y el tamaño del mosaico en equilibrio para tu GPU.
LTXVAudioVAEDecode (#220)#
Reconstruye la pista de audio sincronizada desde latentes de audio. Para exportar un clip silencioso, desactiva temporalmente la rama de audio dentro del subgráfico antes de CreateVideo (#218). Si el sonido final se siente demasiado ocupado, reduce la densidad de acción en la indicación para que el modelo de audio siga un ritmo más simple.
RandomNoise (#196)#
Siembra la generación. Para resultados reproducibles, abre el subgráfico y establece una semilla fija en lugar de aleatorizar. Al explorar opciones de movimiento desde los mismos anclajes e indicación, varía la semilla para muestrear diferentes trayectorias.
Extras opcionales#
- Para las transiciones más limpias, mantén los primeros y últimos fotogramas alineados en relación de aspecto, horizonte y escala del sujeto; los desajustes fuerzan al modelo a deformar la geometría.
- Describe el movimiento explícitamente: “comienza mirando a la izquierda, gira hacia la cámara, la mano se abre, el cristal azul se eleva sobre la palma” se lee mejor que una indicación solo de estilo.
- La duración y el FPS interactúan; aumentar ambos eleva la memoria y el tiempo de renderizado. Estira uno a la vez y previsualiza antes de escalar.
- Si los bordes centellean, reduce los adjetivos de textura fina en la indicación o baja ligeramente la guía para favorecer la estabilidad temporal.
- Para acelerar la iteración, prueba a una resolución más pequeña, luego aumenta el ancho y la altura una vez que el movimiento y el encuadre estén bloqueados.
- Cuando necesites fotogramas finales perfectos para la marca, énfasisalos en la indicación y mantén el último fotograma limpio y de alto contraste para que LTX 2.5 Primer Último Fotograma a Video pueda fijarse de manera confiable.
Agradecimientos#
Este flujo de trabajo implementa y se basa en los siguientes trabajos y recursos. Agradecemos sinceramente a Comfy.org por la plantilla de flujo de trabajo Source, a Lightricks por los pesos del modelo LTX-2.5 y a Lightricks por el proyecto LTX-2.5 Diffusers por sus contribuciones y mantenimiento. Para detalles autorizados, consulta la documentación original y los repositorios enlazados a continuación.
Recursos#
- Plantilla de flujo de trabajo Comfy.org/Source
- Documentación / Notas de lanzamiento: Plantilla de flujo de trabajo Source
- Lightricks/LTX-2.5
- Hugging Face: Lightricks/LTX-2.5
- Lightricks/LTX-2.5-Diffusers
- Hugging Face: Lightricks/LTX-2.5-Diffusers
- Lightricks/organización de Hugging Face
- Hugging Face: Lightricks
Nota: El uso de los modelos, conjuntos de datos y código referenciados está sujeto a las respectivas licencias y términos proporcionados por sus autores y mantenedores.

