LTX 2.3 Sincronização Labial de Falar e Cantar: Fluxo de Trabalho ComfyUI de Retrato para Performance#
LTX 2.3 Sincronização Labial de Falar e Cantar transforma um retrato frontal claro e uma voz ou música em um vídeo digital-humano cinematográfico com movimento de boca expressivo e sincronizado. Construído para RunComfy, utiliza geração de vídeo LTX 2.3 com nós LTXV ComfyUI e separação de áudio Mel-Band RoFormer para manter o rosto legível enquanto combina fala ou letras.
Este fluxo de trabalho ComfyUI é adequado para videoclipes de música AI, cantores virtuais, testes de performance de personagens e demos de criadores onde tanto o artista na tela quanto o áudio final devem permanecer utilizáveis. Você fornece uma imagem de retrato e uma faixa de áudio, escolhe uma taxa de quadros e duração, e o pipeline renderiza um mp4 com sincronização labial alinhada à sua faixa.
Nota: Para resultados especialmente impressionantes, recomendamos fortemente gerar a música com Ace Step Model, depois criar um retrato cinematográfico claro com Seedream 5.0 Pro. Use esses dois ativos como os insumos de áudio e retrato para este fluxo de trabalho para obter uma performance digital-humana mais polida.
Principais modelos no fluxo de trabalho LTX 2.3 Sincronização Labial de Falar e Cantar do ComfyUI#
- Modelo de geração de vídeo LTX-2.3 por Lightricks. Um gerador de áudio-vídeo baseado em transformador que acopla recursos de áudio com movimento visual para produzir quadros temporalmente coerentes adequados para falar e cantar. Model card e repositório oficial.
- LTX-2.3 Video VAE e Audio VAE. Codificadores/decodificadores latentes que compactam vídeo e áudio no espaço latente AV usado pelo LTX-2.3, garantindo amostragem eficiente e reconstrução limpa. Implementado na integração LTX ComfyUI. ComfyUI-LTXVideo.
- MelBandRoFormer. Um modelo moderno de separação de fonte musical usado aqui para opcionalmente extrair vocais para condicionamento labial mais limpo, enquanto mantém seu mix original para a renderização final. Weights e nó ComfyUI.
Como usar o fluxo de trabalho LTX 2.3 Sincronização Labial de Falar e Cantar do ComfyUI#
O fluxo de trabalho ocorre em três estágios: Entrada, Geração LTX 2.3, e Exportação. Grupos trabalham juntos de ponta a ponta para transformar seu retrato e áudio em uma performance sincronizada.
ENTRADA#
Carregue um retrato frontal usando Character Image (front view + 9:16, recommended) (#444). A imagem é redimensionada para o modelo e levemente pré-processada para preservar a identidade e detalhes da região da boca. Carregue sua música ou voz com Upload Song or Voice (#1755), então defina Start lip-sync from which second? e.g. 10.0 (seconds) (#1776) se quiser pular barras de introdução ou silêncio. Escolha uma duração com Duration in seconds (best under 35s; enter 0 for full audio) (#1583) e defina Frame Rate (#1586) para a renderização. Escreva um prompt de intenção em Prompt (#1624) para guiar a expressão e o comportamento da câmera; o fluxo de trabalho também injeta dicas negativas úteis para evitar legendas, marcas d'água e quadros estáticos.
LTX2.3 Humano Digital Falante/Cantante Sincronização Labial#
Seu retrato é transformado em um clipe latente inicial por LTXV Preprocess (#446) e LTXVImgToVideoInplaceKJ (#1762). Controle o quão fortemente o retrato é imposto usando IMG STRENGTH. Set 0 for T2I mode (#1722): valores mais altos travam na foto, enquanto valores mais baixos permitem mais movimento generativo. O caminho de áudio corta seu upload, opcionalmente separa vocais com Mel-Band RoFormer Sampler (#1599), e codifica a faixa escolhida através de LTXV Audio VAE Encode (#1605). Latentes de áudio e vídeo são fundidos por LTXV Concat AV Latent (#350), e o condicionamento de texto dos nós CLIP Text Encode dirige a intenção geral da cena e limpeza via LTXVConditioning (#164). O modelo LTX-2.3 é corrigido e guiado para precisão labial usando LTX2 NAG (#508), então amostrado com SamplerCustomAdvanced (#161) sob o agendador e sampler selecionados.
Exportar e salvar#
Após a amostragem, o vídeo latente é decodificado por VAE Decode (#1318) em quadros. Video Combine 🎥🅥🅗🅢 (#1747) combina esses quadros com seu áudio original cortado para produzir um mp4 na taxa de quadros escolhida. Se você habilitou apenas vocais para condicionamento, a exportação final ainda usa o mix completo para que seu resultado permaneça pronto para compartilhar. A saída é salva com um prefixo claro para fácil versionamento.
Principais nós no fluxo de trabalho LTX 2.3 Sincronização Labial de Falar e Cantar do ComfyUI#
LTXVImgToVideoInplaceKJ (#1762)#
Converte o retrato de referência em um vídeo latente inicial. Ajuste IMG STRENGTH. Set 0 for T2I mode (#1722) para equilibrar o bloqueio de identidade versus liberdade de movimento. Para semelhança apertada e pose de cabeça estável, mantenha a força mais alta; para mais movimento performático, reduza. Se definir como 0, trate o fluxo de trabalho como texto-para-vídeo e confie mais no prompt e no áudio.
Mel-Band RoFormer Sampler (#1599)#
Separa vocais de uma música para alimentar características de fala mais limpas no modelo. Use USE VOCALS ONLY (#1616) quando o instrumental for dominante ou quando consoantes estiverem se perdendo; mantenha desligado quando quiser que o mix completo influencie a expressividade. A renderização final usa o áudio original cortado, preservando sua trilha sonora pretendida. Veja os detalhes do modelo na extensão ComfyUI e pesos vinculados acima.
LTXV Audio VAE Encode (#1605)#
Codifica o áudio selecionado no espaço latente de áudio LTX que dirige formas de boca e micro-expressões. Corte silêncios óbvios antes da codificação para alinhamento mais rápido. Combine com o deslocamento de tempo de início se sua entrada de letra não começar em 0 segundos.
LTX2 NAG (#508)#
Aplica orientação aumentada por ruído adaptada para LTX 2.3 para aprimorar o acoplamento áudio-para-labial. Se os lábios parecerem pouco animados, aumente ligeiramente sua orientação; se os dentes ou formas de boca parecerem exagerados, diminua o efeito. Pequenas, mudanças incrementais funcionam melhor porque este controle interage com a força do prompt e configurações do sampler. Implementação de referência está nos repositórios LTX.
SamplerCustomAdvanced (#161)#
Executa o processo de remoção de ruído com seu KSamplerSelect (#154), CFG Guider (#153), e agendador escolhidos. Orientação sem classificador mais baixa geralmente favorece movimento natural e retenção de identidade; valores mais altos aumentam a dominância do prompt, mas podem enrijecer os lábios. Se mudar de samplers, mantenha o resto das configurações intactas para uma comparação A/B justa.
Video Combine 🎥🅥🅗🅢 (#1747)#
Escreve o mp4 final combinando quadros e o áudio cortado. Deixe os padrões para ampla compatibilidade ou aumente a qualidade se planejar fazer correção de cor mais tarde. Certifique-se de que a frame_rate corresponda à sua intenção criativa e ao que você definiu anteriormente.
Extras opcionais#
- Use um retrato limpo e frontal com iluminação neutra e corte 9:16 para os resultados mais convincentes de LTX 2.3 Sincronização Labial de Falar e Cantar.
- Se instrumentos mascararem consoantes, ative
USE VOCALS ONLY(#1616) para que o modelo se condicione em um vocal mais limpo enquanto sua exportação mantém o mix completo. - Mantenha clipes com menos de aproximadamente 35 segundos para iteração mais rápida; junte tomadas externamente se estiver construindo um videoclipe longo.
- Quando o movimento estiver muito estático, reduza
IMG STRENGTH; quando a identidade se desviar, aumente e simplifique o prompt. - Alinhe letras cortando silêncio inicial e usando o controle de deslocamento de tempo de início para que as formas dos lábios comecem exatamente na sua primeira palavra.
- Defina uma
Start Seedfixa para reproduzir uma tomada, depois varie a seed para alternativas. - Respeite semelhança e direitos de música ao usar este fluxo de trabalho LTX 2.3 Sincronização Labial de Falar e Cantar em projetos públicos.
Links para recursos oficiais
- Model card LTX-2.3: Lightricks/LTX-2.3
- Repositório LTX-Video: Lightricks/ltx-video
- ComfyUI-LTXVideo: Lightricks/ComfyUI-LTXVideo
- ComfyUI-MelBandRoFormer: kijai/ComfyUI-MelBandRoFormer
- Pesos MelBandRoFormer: Kijai/MelBandRoFormer_comfy
Agradecimentos#
Este fluxo de trabalho implementa e constrói sobre os seguintes trabalhos e recursos. Agradecemos a Lightricks pelo LTX-Video (incluindo o modelo LTX 2.3 e nós ComfyUI-LTXVideo), Kijai pelo MelBandRoFormer (nós ComfyUI e pesos do modelo), e RunningHub pelo artigo fonte do fluxo de trabalho por suas contribuições e manutenção. Para detalhes autoritativos, por favor, consulte a documentação e repositórios originais vinculados abaixo.
Recursos#
- RunningHub/RunningHub fonte do fluxo de trabalho
- Docs / Notas de Lançamento: RunningHub Post
- Lightricks/modelo LTX 2.3
- GitHub: Lightricks/ltx-video
- Hugging Face: Lightricks/LTX-2.3
- Repositório oficial Lightricks/LTX-Video
- GitHub: Lightricks/ltx-video
- Hugging Face: Lightricks/LTX-2.3
- Nós Lightricks/ComfyUI-LTXVideo
- GitHub: Lightricks/ComfyUI-LTXVideo
- Nós Kijai/ComfyUI-MelBandRoFormer
- GitHub: kijai/ComfyUI-MelBandRoFormer
- Hugging Face: Kijai/MelBandRoFormer_comfy
- Pesos do modelo ComfyUI Kijai/MelBandRoFormer
- Hugging Face: Kijai/MelBandRoFormer_comfy
- GitHub: kijai/ComfyUI-MelBandRoFormer
Nota: O uso dos modelos, conjuntos de dados e código referenciados está sujeito às respectivas licenças e termos fornecidos por seus autores e mantenedores.


