ComfyUI>Fluxos de Trabalho>LTX 2.3 Criador de Vídeos de Sincronização Labial de Falar e Cantar

LTX 2.3 Criador de Vídeos de Sincronização Labial de Falar e Cantar

Workflow Name: RunComfy/LTX-2.3-Talking-Sync
Workflow ID: 0000...1461
Este fluxo de trabalho permite transformar imagens de retrato em vídeos falantes ou cantantes com sincronização natural da boca. Ajuda designers e criadores a dar vida a personagens estáticos para narrativas, videoclipes ou conteúdo interativo. Construído em torno de uma separação avançada de áudio, garante vocais claros e movimento labial preciso. Você pode gerar resultados de qualidade cinematográfica sem esforço, combinando expressão facial e ritmo de fala. Ideal para animação de humanos digitais, cantores virtuais e testes de performance.

ComfyUI LTX 2.3 Talking and Singing Lip Sync Workflow

LTX 2.3 Talking and Singing Lip Sync in ComfyUI | Portrait2Video Sync
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

ComfyUI LTX 2.3 Talking and Singing Lip Sync Examples

LTX 2.3 Sincronização Labial de Falar e Cantar: Fluxo de Trabalho ComfyUI de Retrato para Performance#

LTX 2.3 Sincronização Labial de Falar e Cantar transforma um retrato frontal claro e uma voz ou música em um vídeo digital-humano cinematográfico com movimento de boca expressivo e sincronizado. Construído para RunComfy, utiliza geração de vídeo LTX 2.3 com nós LTXV ComfyUI e separação de áudio Mel-Band RoFormer para manter o rosto legível enquanto combina fala ou letras.

Este fluxo de trabalho ComfyUI é adequado para videoclipes de música AI, cantores virtuais, testes de performance de personagens e demos de criadores onde tanto o artista na tela quanto o áudio final devem permanecer utilizáveis. Você fornece uma imagem de retrato e uma faixa de áudio, escolhe uma taxa de quadros e duração, e o pipeline renderiza um mp4 com sincronização labial alinhada à sua faixa.

Nota: Para resultados especialmente impressionantes, recomendamos fortemente gerar a música com Ace Step Model, depois criar um retrato cinematográfico claro com Seedream 5.0 Pro. Use esses dois ativos como os insumos de áudio e retrato para este fluxo de trabalho para obter uma performance digital-humana mais polida.

Principais modelos no fluxo de trabalho LTX 2.3 Sincronização Labial de Falar e Cantar do ComfyUI#

  • Modelo de geração de vídeo LTX-2.3 por Lightricks. Um gerador de áudio-vídeo baseado em transformador que acopla recursos de áudio com movimento visual para produzir quadros temporalmente coerentes adequados para falar e cantar. Model card e repositório oficial.
  • LTX-2.3 Video VAE e Audio VAE. Codificadores/decodificadores latentes que compactam vídeo e áudio no espaço latente AV usado pelo LTX-2.3, garantindo amostragem eficiente e reconstrução limpa. Implementado na integração LTX ComfyUI. ComfyUI-LTXVideo.
  • MelBandRoFormer. Um modelo moderno de separação de fonte musical usado aqui para opcionalmente extrair vocais para condicionamento labial mais limpo, enquanto mantém seu mix original para a renderização final. Weights e nó ComfyUI.

Como usar o fluxo de trabalho LTX 2.3 Sincronização Labial de Falar e Cantar do ComfyUI#

O fluxo de trabalho ocorre em três estágios: Entrada, Geração LTX 2.3, e Exportação. Grupos trabalham juntos de ponta a ponta para transformar seu retrato e áudio em uma performance sincronizada.

ENTRADA#

Carregue um retrato frontal usando Character Image (front view + 9:16, recommended) (#444). A imagem é redimensionada para o modelo e levemente pré-processada para preservar a identidade e detalhes da região da boca. Carregue sua música ou voz com Upload Song or Voice (#1755), então defina Start lip-sync from which second? e.g. 10.0 (seconds) (#1776) se quiser pular barras de introdução ou silêncio. Escolha uma duração com Duration in seconds (best under 35s; enter 0 for full audio) (#1583) e defina Frame Rate (#1586) para a renderização. Escreva um prompt de intenção em Prompt (#1624) para guiar a expressão e o comportamento da câmera; o fluxo de trabalho também injeta dicas negativas úteis para evitar legendas, marcas d'água e quadros estáticos.

LTX2.3 Humano Digital Falante/Cantante Sincronização Labial#

Seu retrato é transformado em um clipe latente inicial por LTXV Preprocess (#446) e LTXVImgToVideoInplaceKJ (#1762). Controle o quão fortemente o retrato é imposto usando IMG STRENGTH. Set 0 for T2I mode (#1722): valores mais altos travam na foto, enquanto valores mais baixos permitem mais movimento generativo. O caminho de áudio corta seu upload, opcionalmente separa vocais com Mel-Band RoFormer Sampler (#1599), e codifica a faixa escolhida através de LTXV Audio VAE Encode (#1605). Latentes de áudio e vídeo são fundidos por LTXV Concat AV Latent (#350), e o condicionamento de texto dos nós CLIP Text Encode dirige a intenção geral da cena e limpeza via LTXVConditioning (#164). O modelo LTX-2.3 é corrigido e guiado para precisão labial usando LTX2 NAG (#508), então amostrado com SamplerCustomAdvanced (#161) sob o agendador e sampler selecionados.

Exportar e salvar#

Após a amostragem, o vídeo latente é decodificado por VAE Decode (#1318) em quadros. Video Combine 🎥🅥🅗🅢 (#1747) combina esses quadros com seu áudio original cortado para produzir um mp4 na taxa de quadros escolhida. Se você habilitou apenas vocais para condicionamento, a exportação final ainda usa o mix completo para que seu resultado permaneça pronto para compartilhar. A saída é salva com um prefixo claro para fácil versionamento.

Principais nós no fluxo de trabalho LTX 2.3 Sincronização Labial de Falar e Cantar do ComfyUI#

LTXVImgToVideoInplaceKJ (#1762)#

Converte o retrato de referência em um vídeo latente inicial. Ajuste IMG STRENGTH. Set 0 for T2I mode (#1722) para equilibrar o bloqueio de identidade versus liberdade de movimento. Para semelhança apertada e pose de cabeça estável, mantenha a força mais alta; para mais movimento performático, reduza. Se definir como 0, trate o fluxo de trabalho como texto-para-vídeo e confie mais no prompt e no áudio.

Mel-Band RoFormer Sampler (#1599)#

Separa vocais de uma música para alimentar características de fala mais limpas no modelo. Use USE VOCALS ONLY (#1616) quando o instrumental for dominante ou quando consoantes estiverem se perdendo; mantenha desligado quando quiser que o mix completo influencie a expressividade. A renderização final usa o áudio original cortado, preservando sua trilha sonora pretendida. Veja os detalhes do modelo na extensão ComfyUI e pesos vinculados acima.

LTXV Audio VAE Encode (#1605)#

Codifica o áudio selecionado no espaço latente de áudio LTX que dirige formas de boca e micro-expressões. Corte silêncios óbvios antes da codificação para alinhamento mais rápido. Combine com o deslocamento de tempo de início se sua entrada de letra não começar em 0 segundos.

LTX2 NAG (#508)#

Aplica orientação aumentada por ruído adaptada para LTX 2.3 para aprimorar o acoplamento áudio-para-labial. Se os lábios parecerem pouco animados, aumente ligeiramente sua orientação; se os dentes ou formas de boca parecerem exagerados, diminua o efeito. Pequenas, mudanças incrementais funcionam melhor porque este controle interage com a força do prompt e configurações do sampler. Implementação de referência está nos repositórios LTX.

SamplerCustomAdvanced (#161)#

Executa o processo de remoção de ruído com seu KSamplerSelect (#154), CFG Guider (#153), e agendador escolhidos. Orientação sem classificador mais baixa geralmente favorece movimento natural e retenção de identidade; valores mais altos aumentam a dominância do prompt, mas podem enrijecer os lábios. Se mudar de samplers, mantenha o resto das configurações intactas para uma comparação A/B justa.

Video Combine 🎥🅥🅗🅢 (#1747)#

Escreve o mp4 final combinando quadros e o áudio cortado. Deixe os padrões para ampla compatibilidade ou aumente a qualidade se planejar fazer correção de cor mais tarde. Certifique-se de que a frame_rate corresponda à sua intenção criativa e ao que você definiu anteriormente.

Extras opcionais#

  • Use um retrato limpo e frontal com iluminação neutra e corte 9:16 para os resultados mais convincentes de LTX 2.3 Sincronização Labial de Falar e Cantar.
  • Se instrumentos mascararem consoantes, ative USE VOCALS ONLY (#1616) para que o modelo se condicione em um vocal mais limpo enquanto sua exportação mantém o mix completo.
  • Mantenha clipes com menos de aproximadamente 35 segundos para iteração mais rápida; junte tomadas externamente se estiver construindo um videoclipe longo.
  • Quando o movimento estiver muito estático, reduza IMG STRENGTH; quando a identidade se desviar, aumente e simplifique o prompt.
  • Alinhe letras cortando silêncio inicial e usando o controle de deslocamento de tempo de início para que as formas dos lábios comecem exatamente na sua primeira palavra.
  • Defina uma Start Seed fixa para reproduzir uma tomada, depois varie a seed para alternativas.
  • Respeite semelhança e direitos de música ao usar este fluxo de trabalho LTX 2.3 Sincronização Labial de Falar e Cantar em projetos públicos.

Links para recursos oficiais

Agradecimentos#

Este fluxo de trabalho implementa e constrói sobre os seguintes trabalhos e recursos. Agradecemos a Lightricks pelo LTX-Video (incluindo o modelo LTX 2.3 e nós ComfyUI-LTXVideo), Kijai pelo MelBandRoFormer (nós ComfyUI e pesos do modelo), e RunningHub pelo artigo fonte do fluxo de trabalho por suas contribuições e manutenção. Para detalhes autoritativos, por favor, consulte a documentação e repositórios originais vinculados abaixo.

Recursos#

Nota: O uso dos modelos, conjuntos de dados e código referenciados está sujeito às respectivas licenças e termos fornecidos por seus autores e mantenedores.

RunComfy
Copyright 2026 RunComfy. Todos os Direitos Reservados.

RunComfy é a principal ComfyUI plataforma, oferecendo ComfyUI online ambiente e serviços, juntamente com fluxos de trabalho do ComfyUI apresentando visuais impressionantes. RunComfy também oferece AI Models, permitindo que artistas utilizem as mais recentes ferramentas de AI para criar arte incrível.