ComfyUI>Fluxos de Trabalho>LTX 2.3 Close-Up Shots - Imagem para Vídeo Cinematográfico

LTX 2.3 Close-Up Shots - Imagem para Vídeo Cinematográfico

Workflow Name: RunComfy/LTX-2.3-Close-Up
Workflow ID: 0000...1469
Transforme seu retrato em um vídeo cinematográfico voltado para o rosto. Obtenha movimento facial natural e áudio nativo sincronizado. Enquadre moda, diálogos ou clipes sociais de forma precisa. Dois estágios latentes preservam detalhes. Aumento de escala 2x aprimora cada quadro. Comece rapidamente com esta configuração LTX pronta para uso.

ComfyUI LTX 2.3 Close-Up Shots Workflow

LTX 2.3 Close-Up Shots in ComfyUI - Audio and 2x Upscale
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

ComfyUI LTX 2.3 Close-Up Shots Examples

LTX 2.3 Close-Up Shots: imagem de retrato para vídeo com áudio nativo#

LTX 2.3 Close-Up Shots é um fluxo de trabalho ComfyUI pronto para RunComfy que transforma um único retrato em um clipe cinematográfico voltado para o rosto com áudio nativo gerado em conjunto. "Close-Up Shots" descreve o objetivo de enquadramento e estilo de prompt, não uma variante de modelo LTX separada ou LoRA. O gráfico executa o caminho LTX 2.3 v1.1 GGUF destilado sem detalhador LoRA ativo, usando um pipeline latente de dois estágios e um upscaler espacial x2 para entregar identidade estável, sincronização labial natural e enquadramento nítido.

Projetado para retratos de moda, ritmos de diálogo, entrevistas e clipes sociais polidos, esta construção ComfyUI enfatiza composição precisa e movimento áudio-vídeo coerente. Com LTX 2.3 Close-Up Shots, você fornece uma imagem estática e uma descrição de cena concisa; o fluxo de trabalho lida com movimento, tempo e voz para produzir um MP4 pronto para compartilhar.

Modelos principais no fluxo de trabalho Comfyui LTX 2.3 Close-Up Shots#

  • LTX-2.3 22B Distilled 1.1 (Apenas Transformer). O gerador de vídeo-áudio central destilado para inferência mais rápida e menor memória enquanto preserva a qualidade. Fonte: Lightricks/LTX-2.3.
  • LTX-2.3 x2 Spatial Upscaler 1.1. Um upscaler latente nativo que aprimora detalhes e melhora a estabilidade do movimento durante a segunda passagem. Empacotado no lançamento LTX 2.3: Lightricks/LTX-2.3.
  • LTX-2.3 Video VAE (bf16) e LTX-2.3 Audio VAE (bf16). Decodificadores que transformam latentes de vídeo e áudio em quadros e forma de onda enquanto mantêm a sincronização apertada. Pesos curados: Kijai/LTX2.3_comfy.
  • Pesos GGUF quantizados para LTX 2.3 22B 1.1. UNet/transformer e pilha de texto eficientes em memória, otimizados para descarregamento em CPU ou GPUs de baixa VRAM. Distribuição: QuantStack/LTX-2.3-GGUF.
  • Codificador de texto Gemma 3 12B Instruct com projeção de texto LTX. Fornece compreensão robusta de prompt e tokens de tempo para ambas as modalidades, conectado à interface CLIP do ComfyUI. Incluído via o pacote GGUF: QuantStack/LTX-2.3-GGUF.
  • VAE pequeno opcional para pré-visualizações rápidas. Útil para pré-visualizações de amostra durante a iteração: madebyollin/taehv.

Como usar o fluxo de trabalho Comfyui LTX 2.3 Close-Up Shots#

Este fluxo de trabalho é executado em dois estágios coordenados. A primeira passagem estabelece movimento de close-up e áudio nativo em um tamanho base. A segunda passagem aumenta espacialmente e refina a identidade e a sincronização labial, depois decodifica e mescla vídeo com áudio.

  • MODELOS Carrega o modelo destilado LTX 2.3 22B 1.1 em GGUF, a pilha de texto baseada em Gemma 3 e os VAEs de vídeo e áudio LTX. Também habilita auxiliares de sequência-paralela e pré-visualização para uma iteração mais suave. Nenhum detalhador LoRA está ativo por padrão, o que mantém o visual LTX 2.3 Close-Up Shots limpo e consistente.
  • Configurações de Vídeo Defina aqui sua largura, altura, taxa de quadros e duração do clipe alvo. O gráfico aplica dimensões válidas internamente, mas escolher valores amigáveis à produção gera resultados mais estáveis e reprodução mais suave. Se você planeja iterar rapidamente, comece modestamente e aumente na segunda passagem.
  • T2V — Modo de texto para vídeo Quando quiser gerar apenas a partir de texto, alterne o comutador fornecido de texto para vídeo. Para LTX 2.3 Close-Up Shots, o caminho padrão é imagem para vídeo, que mantém identidade e enquadramento ancorados ao seu retrato.
  • Imagem de Entrada Forneça um retrato limpo com o rosto desobstruído. O fluxo de trabalho pré-processa e redimensiona a imagem, depois usa LTXVImgToVideoInplace (#161) para ancorar identidade e geometria da lente. Mantenha a desordem de fundo mínima e permita um pouco de espaço para que o movimento lento pareça natural.
  • Prompt Use um prompt positivo conciso para descrever a cena ao longo do tempo, incluindo leituras de linha, respirações, micro-gestos e eventos audíveis. Mantenha o prompt negativo focado na remoção de artefatos em vez de policiamento de estilo. Não repita detalhes já visíveis na imagem de referência, pois isso pode reduzir a fidelidade e a estabilidade.
  • Prepare LTX Latent O gráfico cria latentes de vídeo e áudio vazios que correspondem às suas configurações, mescla-os em um único AV latente e anexa seu condicionamento positivo e negativo com a taxa de quadros escolhida. Isso mantém tempo, movimento e áudio em sincronia desde o início.
  • Amostrador — Primeira Passagem A primeira passagem usa CFGGuider (#129) com um amostrador otimizado para velocidade para gerar um AV latente de baixa resolução coerente. Este estágio trava o comportamento da câmera de close-up, cadência de fala e sincronização labial básica. Pense nisso como a passagem narrativa que estabelece o que acontece.
  • Amostrador — Segunda Passagem Upscale O AV latente é dividido, e o caminho de vídeo é ampliado x2 usando LTXVLatentUpsampler (#118). Identidade é re-projetada com LTXVImgToVideoInplace (#160) para manter o rosto estável no tamanho maior, depois áudio e vídeo são reunidos e refinados com um amostrador focado em fidelidade. Esta passagem melhora detalhes, reduz tremulação e aprimora o visual LTX 2.3 Close-Up Shots.
  • Decodificar Quadros de vídeo são decodificados com um VAE em mosaico para eficiência de memória, áudio é decodificado via o VAE de áudio, e VHS_VideoCombine mescla tudo em um H.264 MP4 com formato de pixel padrão 4:2:0. Você pode pré-visualizar áudio durante a iteração e ajustar a duração final para corresponder ao discurso gerado.
  • Opcional Se a VRAM estiver limitada, ative a opção de feed-forward em pedaços para trocar um pouco de velocidade por estabilidade. Para desenvolvimento rápido, use o VAE de pré-visualização pequeno. Usuários de multi-GPU podem se beneficiar do patcher de sequência-paralela para manter sequências longas suaves.

Nós principais no fluxo de trabalho Comfyui LTX 2.3 Close-Up Shots#

  • LTXVImgToVideoInplace (#161 e #160) Ancoras o retrato no vídeo latente para que o rosto permaneça estável enquanto movimentos sutis e micro-movimentos se desenrolam. Mantenha-o ativo para imagem-para-vídeo; alterne seu bypass apenas ao usar o modo texto-para-vídeo. Para os melhores resultados de LTX 2.3 Close-Up Shots, comece com uma referência nítida e bem iluminada e evite obstrução sobre a boca.
  • LTXVLatentUpsampler (#118) Aplica o upscaler espacial x2 nativo LTX 2.3 no espaço latente antes do refinamento de segunda passagem. Isso preserva a coerência do movimento enquanto aumenta o detalhe. Para close-ups, manter o upscaling em x2 geralmente oferece o melhor equilíbrio de nitidez e estabilidade.
  • CFGGuider (#129 e #103) Combina seu condicionamento positivo e negativo em um sinal de orientação unificado para ambas as modalidades. Pequenos ajustes na força de orientação podem apertar ou afrouxar a aderência ao seu roteiro e enquadramento. Se aumentar a orientação, considere suavizar ligeiramente a lista negativa para evitar restringir excessivamente as expressões.
  • SamplerCustomAdvanced (#113 e #119) A primeira passagem favorece uma estratégia orientada para velocidade para estabelecer movimento e áudio rapidamente, enquanto a segunda passagem muda para uma estratégia orientada para fidelidade para aprimorar detalhes. Se você mudar a estratégia do amostrador, mantenha a primeira passagem rápida e a segunda passagem precisa para que LTX 2.3 Close-Up Shots mantenha seu polimento cinematográfico.
  • LTX2_NAG (#342) Introduz orientação sensível ao ruído que equilibra o condicionamento de vídeo e áudio. Aumentar a ênfase no vídeo pode firmar o enquadramento e a pose; aumentar a ênfase no áudio pode fortalecer a sincronização labial. Ajuste de forma conservadora e em conjunto com CFGGuider para evitar super-constrangimento.
  • LTXVConditioning (#107 e #22) Vincula seus prompts e taxa de quadros à linha do tempo latente. Mantenha um prompt positivo de nível de cena único e um prompt negativo compacto para o alinhamento mais limpo. A taxa de quadros anexada garante que o ritmo da fala e a cadência do movimento permaneçam em sincronia.
  • VHS_VideoCombine (#140) Codifica o resultado final para MP4 com configurações de reprodução padrão. Para entrega, aumente a qualidade diminuindo crf; para editorial, habilite trim_to_audio para que o comprimento do clipe corresponda exatamente ao discurso gerado.

Extras opcionais#

  • Dicas de enquadramento para LTX 2.3 Close-Up Shots Corte para que os olhos fiquem perto do terço superior, permita um pouco de espaço para a cabeça e mantenha a boca totalmente visível para melhorar a sincronização labial. Evite luz de fundo forte ou filtros pesados na referência.
  • Prompting que funciona Escreva o que acontece ao longo do tempo, incluindo momentos audíveis como respirações, risos e tom ambiente. Deixe de fora atributos já presentes na imagem. Mantenha a lista negativa curta e prática.
  • Tamanho e desempenho Se você tem pouca VRAM, experimente tamanhos base moderados primeiro, depois deixe a segunda passagem aumentar a escala. Dimensões que seguem as restrições de grade do LTX amostrarão de forma mais previsível, e taxas de quadros mais altas exigem mais computação.
  • Fluxo de trabalho de iteração Trave imagem e prompt, itere a primeira passagem até que o movimento e a leitura estejam corretos, depois passe para a segunda passagem para detalhes. Use o VAE de pré-visualização pequeno para acelerar as verificações, e apenas ative a decodificação completa quando estiver pronto para exportar.
  • Quando usar T2V Mude para o modo texto-para-vídeo para B-roll e close-ups abstratos impulsionados puramente pela narração. Para tomadas direcionadas à identidade, mantenha o caminho do retrato ligado para preservar a estética LTX 2.3 Close-Up Shots.

Agradecimentos#

Este fluxo de trabalho implementa e se baseia nos seguintes trabalhos e recursos. Agradecemos à Lightricks pelo modelo LTX‑2.3, LTX Docs pelo Guia de Fluxo de Trabalho de Imagem‑para‑Vídeo, QuantStack pelas quantizações LTX‑2.3‑GGUF, e iiTzMYUNG pelo showcase da fonte LTX 2.3 por suas contribuições e manutenção. Para detalhes autoritativos, consulte a documentação original e repositórios vinculados abaixo.

Recursos#

Nota: O uso dos modelos, conjuntos de dados e código referenciados está sujeito às respectivas licenças e termos fornecidos por seus autores e mantenedores.

RunComfy
Copyright 2026 RunComfy. Todos os Direitos Reservados.

RunComfy é a principal ComfyUI plataforma, oferecendo ComfyUI online ambiente e serviços, juntamente com fluxos de trabalho do ComfyUI apresentando visuais impressionantes. RunComfy também oferece AI Models, permitindo que artistas utilizem as mais recentes ferramentas de AI para criar arte incrível.