ComfyUI>Flujos de trabajo>LTX 2.3 Creador de Videos de Sincronización de Labios Hablando y Cantando

LTX 2.3 Creador de Videos de Sincronización de Labios Hablando y Cantando

Workflow Name: RunComfy/LTX-2.3-Talking-Sync
Workflow ID: 0000...1461
Este flujo de trabajo te permite transformar imágenes de retratos en videos de habla o canto con sincronización natural de la boca. Ayuda a diseñadores y creadores a dar vida a personajes estáticos para narraciones, videos musicales o contenido interactivo. Construido en torno a una separación avanzada de audio, garantiza voces claras y un movimiento preciso de los labios. Puedes generar resultados de calidad cinematográfica sin esfuerzo, coincidiendo la expresión facial y el ritmo del habla. Ideal para animación de humanos digitales, cantantes virtuales y pruebas de rendimiento.

ComfyUI LTX 2.3 Talking and Singing Lip Sync Workflow

LTX 2.3 Talking and Singing Lip Sync in ComfyUI | Portrait2Video Sync
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

ComfyUI LTX 2.3 Talking and Singing Lip Sync Examples

LTX 2.3 Sincronización de Labios Hablando y Cantando: Flujo de Trabajo Portrait-to-Performance ComfyUI#

LTX 2.3 Sincronización de Labios Hablando y Cantando convierte un retrato claro de frente y una voz o canción en un video digital humano cinematográfico con movimiento de boca expresivo y sincronizado. Construido para RunComfy, utiliza la generación de video LTX 2.3 con nodos LTXV ComfyUI y separación de audio Mel-Band RoFormer para mantener el rostro legible mientras coincide con el habla o las letras.

Este flujo de trabajo de ComfyUI es adecuado para videos musicales de IA, cantantes virtuales, pruebas de rendimiento de personajes y demostraciones de creadores donde tanto el intérprete en pantalla como el audio final deben permanecer utilizables. Proporcionas una imagen de retrato y una pista de audio, eliges una tasa de cuadros y duración, y la canalización renderiza un mp4 con sincronización de labios alineada con tu pista.

Nota: Para resultados especialmente impresionantes, recomendamos encarecidamente generar la canción con Ace Step Model, luego crear un retrato cinematográfico claro con Seedream 5.0 Pro. Usa esos dos activos como las entradas de audio y retrato para este flujo de trabajo para obtener una actuación digital humana más pulida.

Modelos clave en el flujo de trabajo de Comfyui LTX 2.3 Sincronización de Labios Hablando y Cantando#

  • Modelo de generación de video LTX-2.3 de Lightricks. Un generador de audio-video basado en transformadores que acopla características de audio con movimiento visual para producir cuadros temporalmente coherentes adecuados para hablar y cantar. Model card y repositorio oficial.
  • LTX-2.3 Video VAE y Audio VAE. Codificadores/decodificadores latentes que empaquetan video y audio en el espacio latente AV utilizado por LTX-2.3, asegurando un muestreo eficiente y una reconstrucción limpia. Implementado en la integración de LTX ComfyUI. ComfyUI-LTXVideo.
  • MelBandRoFormer. Un modelo moderno de separación de fuentes musicales utilizado aquí para extraer opcionalmente voces para un acondicionamiento de labios más limpio mientras se mantiene tu mezcla original para la renderización final. Weights y ComfyUI node.

Cómo usar el flujo de trabajo de Comfyui LTX 2.3 Sincronización de Labios Hablando y Cantando#

El flujo de trabajo se ejecuta en tres etapas: Entrada, Generación LTX 2.3 y Exportación. Los grupos trabajan juntos de extremo a extremo para convertir tu retrato y audio en una actuación sincronizada.

ENTRADA#

Carga un retrato de frente usando Character Image (front view + 9:16, recommended) (#444). La imagen se redimensiona para el modelo y se preprocesa ligeramente para preservar la identidad y el detalle de la región de la boca. Sube tu canción o voz con Upload Song or Voice (#1755), luego establece Start lip-sync from which second? e.g. 10.0 (seconds) (#1776) si deseas omitir barras de introducción o silencio. Elige una duración con Duration in seconds (best under 35s; enter 0 for full audio) (#1583) y establece Frame Rate (#1586) para la renderización. Escribe un mensaje de intención en Prompt (#1624) para guiar la expresión y el comportamiento de la cámara; el flujo de trabajo también inyecta señales negativas útiles para evitar subtítulos, marcas de agua y cuadros estáticos.

Sincronización de Labios Hablando/Cantando Humano Digital LTX2.3#

Tu retrato se convierte en un clip latente inicial por LTXV Preprocess (#446) y LTXVImgToVideoInplaceKJ (#1762). Controla cuán fuertemente se aplica el retrato usando IMG STRENGTH. Set 0 for T2I mode (#1722): valores más altos bloquean la foto, mientras que valores más bajos permiten más movimiento generativo. La ruta de audio recorta tu carga, opcionalmente separa voces con Mel-Band RoFormer Sampler (#1599), y codifica la pista elegida a través de LTXV Audio VAE Encode (#1605). Los latentes de audio y video se fusionan por LTXV Concat AV Latent (#350), y el condicionamiento de texto de los nodos CLIP Text Encode impulsa la intención general de la escena y la limpieza a través de LTXVConditioning (#164). El modelo LTX-2.3 se parchea y guía para precisión de labios usando LTX2 NAG (#508), luego se muestrea con SamplerCustomAdvanced (#161) bajo el programador y muestreador seleccionado.

Exportar y guardar#

Después del muestreo, el latente de video se decodifica por VAE Decode (#1318) en cuadros. Video Combine 🎥🅥🅗🅢 (#1747) mezcla esos cuadros con tu audio original recortado para producir un mp4 a la tasa de cuadros elegida. Si activaste solo voces para el acondicionamiento, la exportación final aún usa la mezcla completa, por lo que tu resultado permanece listo para compartir. La salida se guarda con un prefijo claro para facilitar la versión.

Nodos clave en el flujo de trabajo de Comfyui LTX 2.3 Sincronización de Labios Hablando y Cantando#

LTXVImgToVideoInplaceKJ (#1762)#

Convierte el retrato de referencia en un video latente inicial. Ajusta IMG STRENGTH. Set 0 for T2I mode (#1722) para equilibrar el bloqueo de identidad frente a la libertad de movimiento. Para un parecido estrecho y una pose de cabeza estable, mantén la fuerza más alta; para un movimiento más performativo, redúcelo. Si lo configuras en 0, trata el flujo de trabajo como texto a video y confía más en el mensaje y el audio.

Mel-Band RoFormer Sampler (#1599)#

Separa las voces de una canción para alimentar características de habla más limpias al modelo. Usa USE VOCALS ONLY (#1616) cuando el instrumental sea dominante o cuando las consonantes se pierdan; mantenlo apagado cuando desees que la mezcla completa influya en la expresividad. La renderización final usa el audio original recortado, preservando tu banda sonora prevista. Consulta los detalles del modelo en la extensión ComfyUI y los pesos vinculados anteriormente.

LTXV Audio VAE Encode (#1605)#

Codifica el audio seleccionado en el espacio latente de audio LTX que impulsa las formas de la boca y las micro-expresiones. Recorta los silencios obvios antes de codificar para una alineación más rápida. Empareja con el desplazamiento de tiempo de inicio si tu entrada de letra no comienza en 0 segundos.

LTX2 NAG (#508)#

Aplica una guía aumentada por ruido diseñada para LTX 2.3 para afinar el acoplamiento audio-labios. Si los labios se sienten poco animados, aumenta ligeramente su guía; si los dientes o las formas de la boca parecen sobreexigidos, reduce el efecto. Los cambios pequeños e incrementales funcionan mejor porque este control interactúa con la fuerza de tu mensaje y la configuración del muestreador. La implementación de referencia vive en los repositorios de LTX.

SamplerCustomAdvanced (#161)#

Ejecuta el proceso de eliminación de ruido con tu KSamplerSelect (#154), CFG Guider (#153) y programador elegidos. Una guía de clasificación libre más baja generalmente favorece el movimiento natural y la retención de identidad; los valores más altos aumentan el dominio del mensaje pero pueden endurecer los labios. Si cambias de muestreador, mantén el resto de la configuración intacta para una comparación justa A/B.

Video Combine 🎥🅥🅗🅢 (#1747)#

Escribe el mp4 final combinando cuadros y el audio recortado. Deja los valores predeterminados para una amplia compatibilidad o aumenta la calidad si planeas hacer corrección de color más tarde. Asegúrate de que el frame_rate coincida con tu intención creativa y coincida con lo que estableciste anteriormente.

Extras opcionales#

  • Usa un retrato limpio de frente con iluminación neutral y un recorte 9:16 para obtener los resultados más convincentes de LTX 2.3 Sincronización de Labios Hablando y Cantando.
  • Si los instrumentos enmascaran las consonantes, activa USE VOCALS ONLY (#1616) para que el modelo se condicione en un tallo vocal más limpio mientras tu exportación mantiene la mezcla completa.
  • Mantén los clips por debajo de aproximadamente 35 segundos para una iteración más rápida; une tomas externamente si estás construyendo un video musical largo.
  • Cuando el movimiento es demasiado estático, baja IMG STRENGTH; cuando la identidad se desvía, súbelo y simplifica el mensaje.
  • Alinea las letras recortando el silencio de entrada y usando el control de desplazamiento de tiempo de inicio para que las formas de los labios comiencen exactamente en tu primera palabra.
  • Establece una Start Seed fija para reproducir una toma, luego varía la semilla para alternar.
  • Respeta la semejanza y los derechos de música al usar este flujo de trabajo de LTX 2.3 Sincronización de Labios Hablando y Cantando en proyectos públicos.

Enlaces a recursos oficiales

Agradecimientos#

Este flujo de trabajo implementa y se basa en los siguientes trabajos y recursos. Agradecemos sinceramente a Lightricks por LTX-Video (incluyendo el modelo LTX 2.3 y los nodos ComfyUI-LTXVideo), Kijai por MelBandRoFormer (nodos ComfyUI y pesos del modelo), y RunningHub por el artículo fuente del flujo de trabajo por sus contribuciones y mantenimiento. Para obtener detalles autorizados, consulte la documentación original y los repositorios vinculados a continuación.

Recursos#

Nota: El uso de los modelos, conjuntos de datos y código referenciados está sujeto a las respectivas licencias y términos proporcionados por sus autores y mantenedores.

RunComfy
Derechos de autor 2026 RunComfy. Todos los derechos reservados.

RunComfy es la principal ComfyUI plataforma, ofreciendo ComfyUI en línea entorno y servicios, junto con flujos de trabajo de ComfyUI con impresionantes imágenes. RunComfy también ofrece AI Models, permitiendo a los artistas aprovechar las últimas herramientas de AI para crear arte increíble.