LTX 2.5 GGUF ComfyUI imagen a video con audio sincronizado#
Este flujo de trabajo LTX 2.5 GGUF ComfyUI convierte una única imagen fuente y un prompt en lenguaje natural en un corto con una pista de audio generada y sincronizada. Utiliza la familia de modelos oficiales LTX-2.5 para generación de video y audio, enrutada a través de un camino UNet cuantizado GGUF para reducir VRAM mientras mantiene el movimiento cinematográfico y la coherencia de la escena.
El gráfico está diseñado para iteraciones rápidas en tomas de personajes, movimientos de maquinaria y entornos. Incluye un interruptor para imagen a video o texto a video, un pipeline latente de dos etapas (paso grueso y luego escalado latente), y decodificación en mosaico para mantener baja la presión de memoria. Si necesitas un camino compacto y listo para producción, este flujo de trabajo LTX 2.5 GGUF ComfyUI es un punto de partida práctico.
Modelos clave en el flujo de trabajo ComfyUI LTX 2.5 GGUF ComfyUI#
- LTX-2.5 (oficial, por Lightricks). Modelo generativo principal de video y audio usado para síntesis de movimiento y guía multimodal. Model card
- LTX-2.5 Video VAE (bf16). Codifica y decodifica latentes de video para generación eficiente, emparejado con el modelo principal. Incluido en el repositorio LTX-2.5 bajo vae/. Video VAE
- LTX-2.5 Audio VAE (bf16). Maneja el camino latente de audio para que la renderización final incluya sonido sincronizado. Incluido en el repositorio LTX-2.5 bajo vae/. Audio VAE
- Codificador de texto basado en Gemma de 12B con proyección LTX-2.5. Proporciona embeddings de prompts emparejados a LTX-2.5, empaquetado por el repositorio LTX bajo text_encoders/. Text encoder
- LTX-2.5 Latent Spatial Upscaler x2 1.0. Un modelo de superresolución en espacio latente que agrega detalle después del pase grueso. Upscaler
- LTX-2.5 Distilled UNet (GGUF cuantizado). Pesos de UNet cuantizados cargados a través del cargador ComfyUI-GGUF para reducir el uso de memoria mientras se mantiene la calidad aceptable. GGUF es el formato de inferencia, no un nombre de modelo oficial. ComfyUI-GGUF
Cómo usar el flujo de trabajo ComfyUI LTX 2.5 GGUF ComfyUI#
El pipeline funciona en dos etapas: un pase guiado de baja resolución para establecer movimiento y sincronización, seguido por escalado latente y un refinamiento de alta resolución. El audio se lleva como un latente emparejado a lo largo del proceso, luego se decodifica y se combina con los fotogramas finales.
Modelo#
Carga el UNet cuantizado GGUF con UnetLoaderGGUF (#406). Los VAE de video y audio se seleccionan con VAELoader (#385, #386), y el codificador de texto basado en Gemma se proporciona con CLIPLoader (#387). El escalador se elige con LatentUpscaleModelLoader (#371). Este grupo define la columna vertebral de la que dependen todos los demás grupos.
Prompt#
Escribe la descripción de tu escena en el campo Prompt, enfocándote en sujetos, movimiento y un solo movimiento de cámara claro. El codificador de texto embebe prompts positivos y negativos a través de LTXVConditioning (#365), que también acepta la tasa de fotogramas elegida para alinear la sincronización. Si deseas audio similar al habla, incluye líneas cortas entrecomilladas; el camino de audio responderá al contexto textual mientras se mantiene consciente de la escena. Mantén los prompts concisos y específicos para evitar guías conflictivas.
Configuración de Video#
Establece duración, tasa de fotogramas y tamaño objetivo. Las utilidades convierten segundos y fps en conteos de fotogramas para que el gráfico asigne la longitud temporal correcta. Mantente en tamaños que sean múltiplos de 32 para estabilidad y velocidad. Usa el selector de resolución para elegir una relación de aspecto común, luego ajusta a tu escala deseada.
Preprocesamiento de Imagen#
Carga el primer fotograma (de referencia) y deja que LTXVPreprocess (#350) lo normalice para LTX-2.5. El interruptor ¿Cambiar a Texto a Video? (#363) controla si la imagen se usa como ancla espacial o se omite para texto a video puro. El asistente de redimensionamiento mantiene tu entrada consistente con la resolución de trabajo. Un buen preprocesamiento mejora la preservación de identidad y el diseño.
Latente Vacío#
EmptyLTXVLatentVideo (#356) y LTXVEmptyLatentAudio (#366) preasignan el lienzo temporal para video y audio. Estas longitudes provienen de tus elecciones de duración y fps. Esta separación asegura que los caminos de video y audio se mantengan sincronizados mientras avanzan a través del muestreo y refinamiento.
Generar Baja Resolución#
El primer bloque de muestreo usa LTXVDualCFGGuider (#388) con tu condicionamiento de prompt para impulsar el movimiento y la dinámica de la escena, luego sintetiza un latente grueso con SamplerCustomAdvanced (#344). Si estás haciendo imagen a video, LTXVImgToVideoInplace (#357) inyecta el fotograma de referencia en el latente para estabilizar la identidad y la composición; se omite para texto a video. Este pase es intencionalmente más ligero para establecer movimiento y sincronización antes del escalado.
Escalado Latente#
LTXVSeparateAVLatent (#367) divide el audio y el video para que el latente de video pueda ser mejorado por LTXVLatentUpsampler (#348) con el modelo x2. La imagen preprocesada se reaplica opcionalmente con LTXVImgToVideoInplace (#349) para mantener los detalles consistentes después del escalado. El latente de audio se vuelve a adjuntar a través de LTXVConcatAVLatent (#340), preservando la sincronización.
Generar Alta Resolución#
Un segundo bloque de muestreo (LTXVDualCFGGuider (#391) más SamplerCustomAdvanced (#368)) refina el detalle y la consistencia temporal a la escala más alta. LTXVSeparateAVLatent (#369) pasa el audio a LTXVAudioVAEDecode (#358) mientras que el latente de video se decodifica con VAEDecodeTiled (#374) para reducir los picos de VRAM. CreateVideo (#370) ensambla fotogramas y audio en el MP4 final a tu fps objetivo.
Nodos clave en el flujo de trabajo ComfyUI LTX 2.5 GGUF ComfyUI#
UnetLoaderGGUF (#406)#
Carga el UNet destilado LTX-2.5 en formato GGUF. Elige el archivo cuantizado que se ajuste a tu presupuesto de VRAM; una cuantización más ligera reduce la memoria y acelera la inferencia a un costo de calidad. Si mejoras a un archivo menos cuantizado, espera texturas más nítidas y un movimiento fino más estable.
LTXVImgToVideoInplace (#357 y #349)#
Inyecta el primer fotograma en el latente para que el movimiento evolucione desde tu imagen en lugar de desviarse. Activa el input bypass al cambiar entre imagen a video y texto a video. Usa el nodo de baja resolución (#357) para estabilización inicial y el nodo de alta resolución (#349) para reanclar detalles después del escalado.
LTXVLatentUpsampler (#348)#
Aplica el Escalador Espacial Latente LTX-2.5 para agregar detalle sin decodificar a píxeles. Úsalo cuando desees más definición al casi mismo costo de memoria que el pase grueso. Si ves parpadeo después del escalado, fortalece ligeramente la guía en la etapa de refinamiento siguiente.
ManualSigmas (#397 y #396)#
Controla el calendario de desruido utilizado por los muestreadores. Los calendarios más cortos son más rápidos pero pueden reducir la adherencia o la suavidad temporal; los calendarios más largos o cargados al frente agregan estabilidad a un costo adicional. Empareja esto con la elección del muestreador para equilibrar velocidad y calidad para tu escena.
VAEDecodeTiled (#374)#
Decodifica el latente de video de alta resolución a fotogramas usando mosaicos para limitar el uso de VRAM. Si te quedas sin memoria, reduce el tamaño del mosaico o habilita un mosaico más fuerte; si ves costuras, aumenta la superposición o prueba un mosaico más grande. Mantén tu selección de VAE alineada con el VAE de video oficial LTX-2.5.
CreateVideo (#370)#
Combina la secuencia de imágenes y el audio decodificado en un archivo de video final. Establece fps para que coincida con tu tasa de generación para evitar estiramiento de tiempo. Usa esto como el único punto de renderizado para resultados consistentes a través de iteraciones.
Extras opcionales#
- Para imagen a video, describe solo un movimiento de cámara claro y la acción del sujeto; evita múltiples movimientos en competencia.
- Para texto a video, mantén los prompts concisos y agrega líneas cortas entrecomilladas para audio similar al habla cuando sea apropiado.
- Consejos de resolución: mantente en múltiplos de 32; los tamaños comunes 16:9 incluyen 960x544 (rápido) y 1344x768 o 1504x832 (más nítido). Aumenta solo si tienes espacio de VRAM.
- Si los resultados ignoran el prompt, aumenta la guía en el bloque de muestreo o simplifica el lenguaje del prompt.
- Para reproducibilidad entre ejecuciones, establece una semilla fija en el nodo de ruido; las semillas aleatorias son mejores para la exploración.
- Si la VRAM es limitada, prefiere el nivel Q de GGUF que puedas costear y mantén el escalador habilitado; agrega detalle por un costo mínimo de memoria.
Enlaces de referencia: los modelos y activos oficiales LTX-2.5 están en Hugging Face, y el cargador GGUF UNet proviene de ComfyUI-GGUF.
- Modelos y activos LTX-2.5: Lightricks/LTX-2.5
- Cargador GGUF: city96/ComfyUI-GGUF
Agradecimientos#
Este flujo de trabajo implementa y se basa en los siguientes trabajos y recursos. Agradecemos sinceramente a Lightricks por LTX-2.5 y a city96 por ComfyUI-GGUF por sus contribuciones y mantenimiento. Para detalles autorizados, por favor consulta la documentación y los repositorios originales enlazados a continuación.
Recursos#
- Lightricks/LTX-2.5
- Hugging Face: Lightricks/LTX-2.5
- city96/ComfyUI-GGUF
- GitHub: city96/ComfyUI-GGUF
Nota: El uso de los modelos, conjuntos de datos y código referenciados está sujeto a las licencias y términos respectivos proporcionados por sus autores y mantenedores.

