LTX 2.3 Close-Up Shots: imagem de retrato para vídeo com áudio nativo#
LTX 2.3 Close-Up Shots é um fluxo de trabalho ComfyUI pronto para RunComfy que transforma um único retrato em um clipe cinematográfico voltado para o rosto com áudio nativo gerado em conjunto. "Close-Up Shots" descreve o objetivo de enquadramento e estilo de prompt, não uma variante de modelo LTX separada ou LoRA. O gráfico executa o caminho LTX 2.3 v1.1 GGUF destilado sem detalhador LoRA ativo, usando um pipeline latente de dois estágios e um upscaler espacial x2 para entregar identidade estável, sincronização labial natural e enquadramento nítido.
Projetado para retratos de moda, ritmos de diálogo, entrevistas e clipes sociais polidos, esta construção ComfyUI enfatiza composição precisa e movimento áudio-vídeo coerente. Com LTX 2.3 Close-Up Shots, você fornece uma imagem estática e uma descrição de cena concisa; o fluxo de trabalho lida com movimento, tempo e voz para produzir um MP4 pronto para compartilhar.
Modelos principais no fluxo de trabalho Comfyui LTX 2.3 Close-Up Shots#
- LTX-2.3 22B Distilled 1.1 (Apenas Transformer). O gerador de vídeo-áudio central destilado para inferência mais rápida e menor memória enquanto preserva a qualidade. Fonte: Lightricks/LTX-2.3.
- LTX-2.3 x2 Spatial Upscaler 1.1. Um upscaler latente nativo que aprimora detalhes e melhora a estabilidade do movimento durante a segunda passagem. Empacotado no lançamento LTX 2.3: Lightricks/LTX-2.3.
- LTX-2.3 Video VAE (bf16) e LTX-2.3 Audio VAE (bf16). Decodificadores que transformam latentes de vídeo e áudio em quadros e forma de onda enquanto mantêm a sincronização apertada. Pesos curados: Kijai/LTX2.3_comfy.
- Pesos GGUF quantizados para LTX 2.3 22B 1.1. UNet/transformer e pilha de texto eficientes em memória, otimizados para descarregamento em CPU ou GPUs de baixa VRAM. Distribuição: QuantStack/LTX-2.3-GGUF.
- Codificador de texto Gemma 3 12B Instruct com projeção de texto LTX. Fornece compreensão robusta de prompt e tokens de tempo para ambas as modalidades, conectado à interface CLIP do ComfyUI. Incluído via o pacote GGUF: QuantStack/LTX-2.3-GGUF.
- VAE pequeno opcional para pré-visualizações rápidas. Útil para pré-visualizações de amostra durante a iteração: madebyollin/taehv.
Como usar o fluxo de trabalho Comfyui LTX 2.3 Close-Up Shots#
Este fluxo de trabalho é executado em dois estágios coordenados. A primeira passagem estabelece movimento de close-up e áudio nativo em um tamanho base. A segunda passagem aumenta espacialmente e refina a identidade e a sincronização labial, depois decodifica e mescla vídeo com áudio.
- MODELOS Carrega o modelo destilado LTX 2.3 22B 1.1 em GGUF, a pilha de texto baseada em Gemma 3 e os VAEs de vídeo e áudio LTX. Também habilita auxiliares de sequência-paralela e pré-visualização para uma iteração mais suave. Nenhum detalhador LoRA está ativo por padrão, o que mantém o visual LTX 2.3 Close-Up Shots limpo e consistente.
- Configurações de Vídeo Defina aqui sua largura, altura, taxa de quadros e duração do clipe alvo. O gráfico aplica dimensões válidas internamente, mas escolher valores amigáveis à produção gera resultados mais estáveis e reprodução mais suave. Se você planeja iterar rapidamente, comece modestamente e aumente na segunda passagem.
- T2V — Modo de texto para vídeo Quando quiser gerar apenas a partir de texto, alterne o comutador fornecido de texto para vídeo. Para LTX 2.3 Close-Up Shots, o caminho padrão é imagem para vídeo, que mantém identidade e enquadramento ancorados ao seu retrato.
- Imagem de Entrada Forneça um retrato limpo com o rosto desobstruído. O fluxo de trabalho pré-processa e redimensiona a imagem, depois usa
LTXVImgToVideoInplace(#161) para ancorar identidade e geometria da lente. Mantenha a desordem de fundo mínima e permita um pouco de espaço para que o movimento lento pareça natural. - Prompt Use um prompt positivo conciso para descrever a cena ao longo do tempo, incluindo leituras de linha, respirações, micro-gestos e eventos audíveis. Mantenha o prompt negativo focado na remoção de artefatos em vez de policiamento de estilo. Não repita detalhes já visíveis na imagem de referência, pois isso pode reduzir a fidelidade e a estabilidade.
- Prepare LTX Latent O gráfico cria latentes de vídeo e áudio vazios que correspondem às suas configurações, mescla-os em um único AV latente e anexa seu condicionamento positivo e negativo com a taxa de quadros escolhida. Isso mantém tempo, movimento e áudio em sincronia desde o início.
- Amostrador — Primeira Passagem A primeira passagem usa
CFGGuider(#129) com um amostrador otimizado para velocidade para gerar um AV latente de baixa resolução coerente. Este estágio trava o comportamento da câmera de close-up, cadência de fala e sincronização labial básica. Pense nisso como a passagem narrativa que estabelece o que acontece. - Amostrador — Segunda Passagem Upscale O AV latente é dividido, e o caminho de vídeo é ampliado x2 usando
LTXVLatentUpsampler(#118). Identidade é re-projetada comLTXVImgToVideoInplace(#160) para manter o rosto estável no tamanho maior, depois áudio e vídeo são reunidos e refinados com um amostrador focado em fidelidade. Esta passagem melhora detalhes, reduz tremulação e aprimora o visual LTX 2.3 Close-Up Shots. - Decodificar Quadros de vídeo são decodificados com um VAE em mosaico para eficiência de memória, áudio é decodificado via o VAE de áudio, e
VHS_VideoCombinemescla tudo em um H.264 MP4 com formato de pixel padrão 4:2:0. Você pode pré-visualizar áudio durante a iteração e ajustar a duração final para corresponder ao discurso gerado. - Opcional Se a VRAM estiver limitada, ative a opção de feed-forward em pedaços para trocar um pouco de velocidade por estabilidade. Para desenvolvimento rápido, use o VAE de pré-visualização pequeno. Usuários de multi-GPU podem se beneficiar do patcher de sequência-paralela para manter sequências longas suaves.
Nós principais no fluxo de trabalho Comfyui LTX 2.3 Close-Up Shots#
LTXVImgToVideoInplace(#161 e #160) Ancoras o retrato no vídeo latente para que o rosto permaneça estável enquanto movimentos sutis e micro-movimentos se desenrolam. Mantenha-o ativo para imagem-para-vídeo; alterne seubypassapenas ao usar o modo texto-para-vídeo. Para os melhores resultados de LTX 2.3 Close-Up Shots, comece com uma referência nítida e bem iluminada e evite obstrução sobre a boca.LTXVLatentUpsampler(#118) Aplica o upscaler espacial x2 nativo LTX 2.3 no espaço latente antes do refinamento de segunda passagem. Isso preserva a coerência do movimento enquanto aumenta o detalhe. Para close-ups, manter o upscaling em x2 geralmente oferece o melhor equilíbrio de nitidez e estabilidade.CFGGuider(#129 e #103) Combina seu condicionamento positivo e negativo em um sinal de orientação unificado para ambas as modalidades. Pequenos ajustes na força de orientação podem apertar ou afrouxar a aderência ao seu roteiro e enquadramento. Se aumentar a orientação, considere suavizar ligeiramente a lista negativa para evitar restringir excessivamente as expressões.SamplerCustomAdvanced(#113 e #119) A primeira passagem favorece uma estratégia orientada para velocidade para estabelecer movimento e áudio rapidamente, enquanto a segunda passagem muda para uma estratégia orientada para fidelidade para aprimorar detalhes. Se você mudar a estratégia do amostrador, mantenha a primeira passagem rápida e a segunda passagem precisa para que LTX 2.3 Close-Up Shots mantenha seu polimento cinematográfico.LTX2_NAG(#342) Introduz orientação sensível ao ruído que equilibra o condicionamento de vídeo e áudio. Aumentar a ênfase no vídeo pode firmar o enquadramento e a pose; aumentar a ênfase no áudio pode fortalecer a sincronização labial. Ajuste de forma conservadora e em conjunto comCFGGuiderpara evitar super-constrangimento.LTXVConditioning(#107 e #22) Vincula seus prompts e taxa de quadros à linha do tempo latente. Mantenha um prompt positivo de nível de cena único e um prompt negativo compacto para o alinhamento mais limpo. A taxa de quadros anexada garante que o ritmo da fala e a cadência do movimento permaneçam em sincronia.VHS_VideoCombine(#140) Codifica o resultado final para MP4 com configurações de reprodução padrão. Para entrega, aumente a qualidade diminuindocrf; para editorial, habilitetrim_to_audiopara que o comprimento do clipe corresponda exatamente ao discurso gerado.
Extras opcionais#
- Dicas de enquadramento para LTX 2.3 Close-Up Shots Corte para que os olhos fiquem perto do terço superior, permita um pouco de espaço para a cabeça e mantenha a boca totalmente visível para melhorar a sincronização labial. Evite luz de fundo forte ou filtros pesados na referência.
- Prompting que funciona Escreva o que acontece ao longo do tempo, incluindo momentos audíveis como respirações, risos e tom ambiente. Deixe de fora atributos já presentes na imagem. Mantenha a lista negativa curta e prática.
- Tamanho e desempenho Se você tem pouca VRAM, experimente tamanhos base moderados primeiro, depois deixe a segunda passagem aumentar a escala. Dimensões que seguem as restrições de grade do LTX amostrarão de forma mais previsível, e taxas de quadros mais altas exigem mais computação.
- Fluxo de trabalho de iteração Trave imagem e prompt, itere a primeira passagem até que o movimento e a leitura estejam corretos, depois passe para a segunda passagem para detalhes. Use o VAE de pré-visualização pequeno para acelerar as verificações, e apenas ative a decodificação completa quando estiver pronto para exportar.
- Quando usar T2V Mude para o modo texto-para-vídeo para B-roll e close-ups abstratos impulsionados puramente pela narração. Para tomadas direcionadas à identidade, mantenha o caminho do retrato ligado para preservar a estética LTX 2.3 Close-Up Shots.
Agradecimentos#
Este fluxo de trabalho implementa e se baseia nos seguintes trabalhos e recursos. Agradecemos à Lightricks pelo modelo LTX‑2.3, LTX Docs pelo Guia de Fluxo de Trabalho de Imagem‑para‑Vídeo, QuantStack pelas quantizações LTX‑2.3‑GGUF, e iiTzMYUNG pelo showcase da fonte LTX 2.3 por suas contribuições e manutenção. Para detalhes autoritativos, consulte a documentação original e repositórios vinculados abaixo.
Recursos#
- Lightricks/LTX-2.3
- GitHub: Lightricks/LTX-2
- Hugging Face: Lightricks/LTX-2.3
- arXiv: arXiv:2601.03233
- LTX Docs/Guia de Fluxo de Trabalho de Imagem-para-Vídeo
- GitHub: Lightricks/ComfyUI-LTXVideo
- Docs / Notas de Lançamento: Guia de Fluxo de Trabalho de Imagem-para-Vídeo
- QuantStack/LTX-2.3-GGUF
- Hugging Face: QuantStack/LTX-2.3-GGUF
- iiTzMYUNG/LTX 2.3 Close-Up Shots Are Absolutely Insane!
- Docs / Notas de Lançamento: LTX 2.3 Close-Up Shots Are Absolutely Insane!
Nota: O uso dos modelos, conjuntos de dados e código referenciados está sujeito às respectivas licenças e termos fornecidos por seus autores e mantenedores.

