ComfyUI>Flujos de trabajo>LTX 2.3 Primeros Planos - Imagen a Video Cinematográfico

LTX 2.3 Primeros Planos - Imagen a Video Cinematográfico

Workflow Name: RunComfy/LTX-2.3-Close-Up
Workflow ID: 0000...1469
Convierte tu retrato en un video cinematográfico de cara al frente. Obtén movimiento facial natural y audio nativo sincronizado. Enfoca moda, diálogos o clips sociales de manera ajustada. Dos etapas latentes preservan el detalle. El escalado 2x afila cada fotograma. Comienza rápidamente con esta configuración de LTX lista para usar.

ComfyUI LTX 2.3 Close-Up Shots Workflow

LTX 2.3 Close-Up Shots in ComfyUI - Audio and 2x Upscale
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

ComfyUI LTX 2.3 Close-Up Shots Examples

LTX 2.3 Primeros Planos: imagen de retrato a video con audio nativo#

LTX 2.3 Primeros Planos es un flujo de trabajo de ComfyUI listo para RunComfy que convierte un solo retrato en un clip cinematográfico de cara al frente con audio nativo generado conjuntamente. "Primeros Planos" describe el objetivo de encuadre y estilo de solicitud, no una variante de modelo LTX separada o LoRA. El gráfico ejecuta el camino LTX 2.3 v1.1 GGUF destilado sin detalle activo LoRA, usando un pipeline latente de dos etapas y un escalador espacial x2 para entregar identidad estable, sincronización labial natural y encuadre cerrado nítido.

Diseñado para retratos de moda, ritmos de diálogo, entrevistas y clips sociales pulidos, esta construcción de ComfyUI enfatiza la composición ajustada y el movimiento coherente de audio-video. Con LTX 2.3 Primeros Planos, proporcionas una imagen fija y una descripción concisa de la escena; el flujo de trabajo maneja el movimiento, el tiempo y la voz para producir un MP4 listo para compartir.

Modelos clave en el flujo de trabajo Comfyui LTX 2.3 Primeros Planos#

  • LTX-2.3 22B Destilado 1.1 (Solo Transformer). El generador de video-audio central destilado para inferencia más rápida y menor memoria mientras preserva la calidad. Fuente: Lightricks/LTX-2.3.
  • LTX-2.3 x2 Escalador Espacial 1.1. Un escalador latente nativo que afila detalles y mejora la estabilidad del movimiento durante el segundo pase. Empaquetado en la versión LTX 2.3: Lightricks/LTX-2.3.
  • LTX-2.3 Video VAE (bf16) y LTX-2.3 Audio VAE (bf16). Decodificadores que convierten latentes de video y audio en fotogramas y formas de onda manteniendo la sincronización ajustada. Pesos curados: Kijai/LTX2.3_comfy.
  • Pesos GGUF Cuantizados para LTX 2.3 22B 1.1. UNet/transformer eficiente en memoria y pila de texto, optimizado para descarga en CPU o GPUs de bajo VRAM. Distribución: QuantStack/LTX-2.3-GGUF.
  • Codificador de texto Instruct Gemma 3 12B con proyección de texto LTX. Proporciona comprensión de solicitud robusta y tokens de tiempo para ambas modalidades, integrado en la interfaz CLIP de ComfyUI. Incluido a través del paquete GGUF: QuantStack/LTX-2.3-GGUF.
  • VAE pequeño opcional para previsualizaciones rápidas. Útil para previsualizaciones de muestreo durante la iteración: madebyollin/taehv.

Cómo usar el flujo de trabajo Comfyui LTX 2.3 Primeros Planos#

Este flujo de trabajo se ejecuta en dos etapas coordinadas. El primer pase establece el movimiento de primeros planos y el audio nativo en un tamaño base. El segundo pase hace una muestra espacial y refina la identidad y la sincronización labial, luego decodifica y combina el video con el audio.

  • MODELOS Carga el modelo destilado LTX 2.3 22B 1.1 en GGUF, la pila de texto basada en Gemma 3 y los VAE de video y audio LTX. También habilita ayudantes de secuencia-paralela y previsualización para una iteración más suave. No hay detalle LoRA activo por defecto, lo que mantiene el aspecto de LTX 2.3 Primeros Planos limpio y consistente.
  • Configuración de Video Establece tu ancho, altura, tasa de fotogramas y duración del clip objetivo aquí. El gráfico impone dimensiones válidas internamente, pero elegir valores amigables para la producción produce resultados más estables y una reproducción más suave. Si planeas iterar rápidamente, comienza modestamente y escala en el segundo pase.
  • T2V — Modo de texto a video Cuando quieras generar solo desde texto, activa el interruptor de texto a video proporcionado. Para LTX 2.3 Primeros Planos, el camino por defecto es de imagen a video, lo que mantiene la identidad y el encuadre anclados en tu retrato.
  • Imagen de Entrada Proporciona un retrato limpio con la cara despejada. El flujo de trabajo preprocesa y redimensiona la imagen, luego usa LTXVImgToVideoInplace (#161) para anclar la identidad y la geometría de la lente. Mantén el desorden de fondo al mínimo y deja un poco de espacio para que el empuje lento se sienta natural.
  • Solicitud Usa una solicitud positiva concisa para describir la toma a lo largo del tiempo, incluidos los diálogos, respiraciones, micro-gestos y eventos audibles. Mantén la solicitud negativa centrada en la eliminación de artefactos en lugar de la vigilancia del estilo. No repitas detalles ya visibles en la imagen de referencia, ya que eso puede reducir la fidelidad y la estabilidad.
  • Preparar Latente LTX El gráfico crea latentes de video y audio vacíos que coinciden con tus configuraciones, los fusiona en un solo latente AV y adjunta tu condicionamiento positivo y negativo con la tasa de fotogramas elegida. Esto mantiene el tiempo, el movimiento y el audio en paso desde el inicio.
  • Muestreador — Primer Pase El primer pase usa CFGGuider (#129) con un muestreador optimizado para velocidad para generar un latente AV coherente de baja resolución. Esta etapa fija el comportamiento de la cámara en primer plano, la cadencia de discurso y la sincronización labial básica. Piénsalo como el pase narrativo que establece lo que sucede.
  • Muestreador — Segundo Pase de Escalado El latente AV se divide, y la ruta de video se escala x2 usando LTXVLatentUpsampler (#118). La identidad se reproyecta con LTXVImgToVideoInplace (#160) para mantener la cara estable en el tamaño más grande, luego el audio y el video se vuelven a unir y se refinan con un muestreador enfocado en la fidelidad. Este pase mejora el detalle, reduce el parpadeo y pule el aspecto de LTX 2.3 Primeros Planos.
  • Decodificar Los fotogramas de video se decodifican con un VAE en mosaico para eficiencia de memoria, el audio se decodifica a través del VAE de audio, y VHS_VideoCombine combina todo en un MP4 H.264 con formato de píxel estándar 4:2:0. Puedes previsualizar el audio durante la iteración y recortar la duración final para que coincida con el discurso generado.
  • Opcional Si el VRAM es ajustado, habilita la opción de avance por bloques para intercambiar un poco de velocidad por estabilidad. Para un desarrollo de aspecto más rápido, usa el VAE de previsualización pequeño. Los usuarios de múltiples GPU pueden beneficiarse del parche secuencial-paralelo para mantener secuencias largas suaves.

Nodos clave en el flujo de trabajo Comfyui LTX 2.3 Primeros Planos#

  • LTXVImgToVideoInplace (#161 y #160) Ancla el retrato en el video latente para que la cara permanezca estable mientras se desarrollan empujes sutiles y micro-movimientos. Mantenlo activo para imagen a video; cambia su bypass solo cuando uses el modo de texto a video. Para los mejores resultados de LTX 2.3 Primeros Planos, comienza desde una referencia nítida e iluminada uniformemente y evita la oclusión sobre la boca.
  • LTXVLatentUpsampler (#118) Aplica el escalador espacial nativo LTX 2.3 x2 en el espacio latente antes del refinamiento del segundo pase. Esto preserva la coherencia del movimiento mientras aumenta el detalle. Para primeros planos, mantener el escalado en x2 típicamente ofrece el mejor equilibrio entre nitidez y estabilidad.
  • CFGGuider (#129 y #103) Combina tu condicionamiento positivo y negativo en una señal de guía unificada para ambas modalidades. Pequeños ajustes en la fuerza de la guía pueden ajustar o aflojar la adherencia a tu guion y encuadre. Si aumentas la guía, considera suavizar ligeramente la lista negativa para evitar restringir demasiado las expresiones.
  • SamplerCustomAdvanced (#113 y #119) El primer pase favorece una estrategia orientada a la velocidad para establecer el movimiento y el audio rápidamente, mientras que el segundo pase cambia a una estrategia orientada a la fidelidad para afinar detalles. Si cambias la estrategia de muestreo, mantén el primer pase rápido y el segundo pase preciso para que LTX 2.3 Primeros Planos mantenga su pulido cinematográfico.
  • LTX2_NAG (#342) Introduce una guía consciente del ruido que equilibra el condicionamiento de video y audio. Aumentar el énfasis en el video puede reforzar el encuadre y la pose; aumentar el énfasis en el audio puede endurecer la sincronización labial. Ajusta de manera conservadora y en conjunto con CFGGuider para evitar restricciones excesivas.
  • LTXVConditioning (#107 y #22) Vincula tus solicitudes y tasa de fotogramas a la línea de tiempo latente. Mantén una sola solicitud positiva a nivel de escena y una solicitud negativa compacta para la alineación más limpia. La tasa de fotogramas adjunta asegura que el ritmo del discurso y la cadencia del movimiento se mantengan sincronizados.
  • VHS_VideoCombine (#140) Codifica el resultado final a MP4 con configuraciones de reproducción estándar. Para la entrega, aumenta la calidad reduciendo crf; para la edición, habilita trim_to_audio para que la longitud del clip coincida exactamente con el discurso generado.

Extras opcionales#

  • Consejos de encuadre para LTX 2.3 Primeros Planos Recorta para que los ojos estén cerca del tercio superior, deja un poco de espacio y mantén la boca completamente visible para mejorar la sincronización labial. Evita la luz de fondo fuerte o los filtros pesados en la referencia.
  • Solicitudes que funcionan Escribe lo que sucede con el tiempo, incluidos momentos audibles como respiraciones, risas y el tono de la habitación. No incluyas atributos ya presentes en la imagen. Mantén la lista negativa corta y práctica.
  • Tamaño y rendimiento Si tienes poco VRAM, prueba primero con tamaños base moderados, luego deja que el segundo pase aumente la escala. Las dimensiones que siguen las restricciones de la cuadrícula de LTX muestrearán de manera más predecible, y tasas de fotogramas más altas requieren más computación.
  • Flujo de trabajo de iteración Bloquea la imagen y la solicitud, itera el primer pase hasta que el movimiento y la lectura se sientan correctos, luego pasa al segundo pase para el detalle. Usa el VAE de previsualización pequeño para acelerar las comprobaciones, y solo habilita la decodificación completa cuando estés listo para exportar.
  • Cuándo usar T2V Cambia al modo de texto a video para tomas de B-roll y primeros planos abstractos impulsados puramente por la narración. Para tomas impulsadas por la identidad, mantén activada la ruta del retrato para preservar la estética de LTX 2.3 Primeros Planos.

Agradecimientos#

Este flujo de trabajo implementa y se basa en los siguientes trabajos y recursos. Agradecemos a Lightricks por el modelo LTX-2.3, LTX Docs por la Guía de Flujo de Trabajo de Imagen a Video, QuantStack por las cuantizaciones LTX-2.3-GGUF, y iiTzMYUNG por el escaparate de origen LTX 2.3 por sus contribuciones y mantenimiento. Para obtener detalles autorizados, consulta la documentación y los repositorios originales enlazados a continuación.

Recursos#

Nota: El uso de los modelos, conjuntos de datos y código referenciados está sujeto a las respectivas licencias y términos proporcionados por sus autores y mantenedores.

RunComfy
Derechos de autor 2026 RunComfy. Todos los derechos reservados.

RunComfy es la principal ComfyUI plataforma, ofreciendo ComfyUI en línea entorno y servicios, junto con flujos de trabajo de ComfyUI con impresionantes imágenes. RunComfy también ofrece AI Models, permitiendo a los artistas aprovechar las últimas herramientas de AI para crear arte increíble.