LTX 2.5 ComfyUI Imagem para Vídeo com Áudio Sincronizado#
Este fluxo de trabalho LTX 2.5 ComfyUI pronto para RunComfy transforma um único primeiro quadro e um prompt de movimento em um vídeo cinematográfico curto com áudio coerente e em modelo. É alimentado pela família Lightricks LTX-2.5, combinando Pixel Diffusion, um aprimorador de prompt baseado em Gemma, VAEs de vídeo e áudio, e upscaling latente para movimento nítido e forte aderência ao prompt.
Use este gráfico LTX 2.5 ComfyUI para animar retratos, locais atmosféricos, produtos, animais e fotos conceituais enquanto permanece dentro do ComfyUI. Forneça uma imagem inicial, descreva a ação e a câmera, defina duração e taxa de quadros, e renderize uma cena que mantenha o caráter, iluminação e estilo através dos quadros.
Modelos chave no fluxo de trabalho Comfyui LTX 2.5 ComfyUI#
- Lightricks LTX-2.5 transformador destilado. O gerador principal de imagem para vídeo produz movimento consistente temporalmente e funde latentes áudio-visuais. Model card: Lightricks/LTX-2.5.
- LTX-2.5 Vídeo VAE. Decodifica latentes de vídeo em quadros com maior fidelidade e menos borrões em movimento rápido. Pesos: ltx-2.5-video-vae-bf16.safetensors.
- LTX-2.5 Áudio VAE. Gera áudio sincronizado para corresponder à ação visual e ao tempo. Pesos: ltx-2.5-audio-vae-bf16.safetensors.
- Gemma 4 12B codificador de texto com projeção LTX. Interpreta prompts ricos e multi-entidades e direções de câmera. Pesos: gemma4-12b-with-proj-ltx-2.5-comfy-int8-convrot.safetensors.
- Variante de instrução Gemma 4 E2B para Prompt Enhancer. Expande prompts curtos em direções cinematográficas a baixo custo computacional. Pesos: gemma4_e2b_it_bf16.safetensors.
- LTX-2.5 Latent Spatial Upscaler x2. Aumenta os detalhes ampliando no espaço latente antes da decodificação. Pesos: ltx-2.5-latent-spatial-upscaler-x2-bf16-1.0.safetensors.
- Implementação de referência para pipelines e agendadores: LTX-2.5 Diffusers.
Como usar o fluxo de trabalho Comfyui LTX 2.5 ComfyUI#
Este fluxo de trabalho expande e condiciona seu prompt, constrói latentes de vídeo e áudio, amostra uma passagem de baixa resolução, realiza upscaling latente, então decodifica para quadros e áudio sincronizado para muxing final. O controlador de nível superior é Image to Video (LTX-2.5) (#398), que pega seu primeiro quadro, prompt de texto e configurações principais, então encaminha para o subgráfico.
Pré-processamento de Imagem#
Forneça sua imagem inicial para Load First Frame (#395). O quadro é padronizado em LTXVPreprocess (#350) para uma base limpa e amigável ao modelo. Use ResolutionSelector (#403) para escolher aspecto e escala; ele fornece largura e altura alinhadas a múltiplos amigáveis ao modelo. Bons primeiros quadros são nítidos, bem iluminados e compostos para o movimento que você planeja descrever. O pré-processador evita mudanças destrutivas enquanto prepara a imagem para amostragem latente.
Aprimoramento de Prompt#
Escreva seu prompt de movimento e câmera em Prompt (#376). Se você habilitar o aprimorador interno, TextGenerateLTX2Prompt (#380) enriquece seu texto com detalhes sobre batidas de ação, continuidade e enquadramento usando um modelo baseado em Gemma. O comutador ComfySwitchNode (#382) permite que você direcione seu texto bruto ou a versão aprimorada para o condicionamento. Esta etapa melhora a aderência ao prompt para entradas curtas e ajuda a manter assuntos e estilo através dos quadros. Você pode visualizar o texto expandido em PreviewAny (#381) antes da renderização.
Modelo#
O subgráfico carrega o gerador destilado em UNETLoader (#384) e os decodificadores em VAELoader para vídeo (#385) e áudio (#386). O modelo de upscaler latente é preparado por LatentUpscaleModelLoader (#371) para uma passagem de detalhes limpa x2 mais tarde. Este bloco garante que a mesma família de modelos LTX-2.5 seja usada em toda a codificação, amostragem e decodificação, o que preserva a coerência temporal.
Prompt#
CLIPLoader (#387) e CLIPTextEncode positivo (#364) transformam seu prompt descritivo em condicionamento. Um codificador negativo dedicado (#373) suprime características indesejadas como baixa qualidade ou artefatos. LTXVConditioning (#365) mescla o condicionamento de texto com sua taxa de quadros escolhida para que a orientação de tempo flua para o fluxo latente áudio-visual. Manter a linguagem de câmera e ação clara leva a um movimento mais estável e latitude de edição.
Configurações de Vídeo#
Duração, largura, altura, taxa de quadros e seed são configurados no grupo Video Settings (e.g., Duration (#362) e Frame Rate (#361)). Auxiliares matemáticos simples calculam a contagem total de quadros e fornecem valores uniformes quando necessário. Escolha uma taxa de quadros que corresponda à sensação que você deseja; ação mais lenta pode parecer melhor em fps mais baixo, enquanto movimento rápido se beneficia de fps mais alto. Para tomadas reprodutíveis, fixe o seed; varie-o para explorar alternativas.
Latente Vazio#
EmptyLTXVLatentVideo (#356) cria um latente de vídeo do tamanho e comprimento corretos, enquanto LTXVEmptyLatentAudio (#366) constrói um latente de áudio alinhado no tempo. Isso garante que os fluxos de vídeo e áudio compartilhem o tempo desde o início. Com o comprimento derivado da duração e taxa de quadros, o sampler recebe tensores corretamente moldados. O resultado é uma base sincronizada para a remoção conjunta de ruído áudio-visual.
Gerar Baixa Resolução#
Uma primeira passagem de amostragem constrói movimento coerente em uma resolução gerenciável. LTXVDualCFGGuider (#388) aplica orientação de modalidade dupla para que tanto texto quanto tempo moldem os latentes de vídeo e áudio juntos. SamplerCustomAdvanced (#344) executa as etapas de difusão com seu sampler escolhido e agendamento, semeado por RandomNoise (#339). A restrição do primeiro quadro é aplicada por LTXVImgToVideoInplace (#357), que mantém identidade, iluminação e composição ancoradas à sua imagem fornecida. Após a amostragem, LTXVConcatAVLatent e LTXVSeparateAVLatent embaralham latentes de áudio e vídeo conforme necessário para as próximas etapas.
Upscale Latente#
LTXVLatentUpsampler (#348) realiza um upscaling de espaço latente x2 para aumentar texturas e microdetalhes antes da decodificação. LTXVImgToVideoInplace (#349) realinha o latente ampliado com o quadro inicial para que identidade e layout permaneçam estáveis. Fazer isso no espaço latente preserva a suavidade temporal melhor do que redimensionamento em pixel. Este estágio é um grande contribuinte para a nitidez final.
Gerar Alta Resolução#
Um sampler de refinamento (KSamplerSelect (#341) mais SamplerCustomAdvanced (#368)) roda no latente ampliado com um cronograma mais curto, estabilizando bordas e enriquecendo detalhes. LTXVDualCFGGuider (#391) mantém a orientação consistente com seu texto enquanto preserva o movimento definido na primeira passagem. O latente combinado é então dividido por LTXVSeparateAVLatent (#369) para decodificação. VAEDecodeTiled (#374) transforma o latente de vídeo em quadros e LTXVAudioVAEDecode (#358) produz áudio sincronizado.
Renderizar e Salvar#
CreateVideo (#370) combina quadros e áudio gerados em um único fluxo de vídeo na sua taxa de quadros selecionada. No gráfico externo, SaveVideo (#75) grava o resultado na saída normal do ComfyUI. Você também pode experimentar o áudio sozinho através de um nó de pré-visualização no wrapper de nível superior antes das renderizações completas.
Nós chave no fluxo de trabalho Comfyui LTX 2.5 ComfyUI#
Image to Video (LTX-2.5) (#398)#
Este é o controlador único para todo o pipeline. Forneça o primeiro quadro, seu prompt, duração, resolução, taxa de quadros e se deseja habilitar o aprimoramento de prompt. Use-o para iterar rapidamente; quando estiver pronto para ajustar, clique em Enter subgraph para ajustar amostradores, orientação e decodificação. Se precisar de vídeo apenas de texto, abra o subgráfico e alterne o bypass interno de texto para vídeo nos nós de imagem para vídeo.
LTXVDualCFGGuider (#388)#
Aplica orientação livre de classificador no latente áudio-visual conjunto, equilibrando aderência ao prompt com estabilidade temporal. Aumente a orientação para seguir o prompt mais fortemente e obter movimento mais impactante; reduza-a para diminuir o flicker ou preservar mais das nuances do quadro inicial. Mantenha a orientação de vídeo e áudio na mesma faixa para que a trilha sonora permaneça alinhada com a ação na tela.
SamplerCustomAdvanced (#344)#
Dirige a difusão com seu sampler escolhido e um cronograma sigma personalizado. Use este nó para explorar a qualidade do movimento versus a estabilidade mudando variantes de sampler ou editando cronogramas. Emparelhe-o com um seed fixo para comparar configurações de forma consistente, depois randomize o seed para buscar a melhor tomada.
LTXVLatentUpsampler (#348)#
Realiza upscaling no espaço latente com o modelo dedicado LTX-2.5 x2, melhorando detalhes sem introduzir oscilação temporal. Se você planeja cortes pesados ou close-ups apertados, mantenha isso habilitado para que pequenos recursos sobrevivam à decodificação. Para limites extremos de VRAM, você pode ignorar o upscaling ao custo de alguma nitidez.
VAEDecodeTiled (#374)#
Decodifica latentes de vídeo de alta resolução em quadros usando tiling para controlar o uso de memória. Em VRAM menor, prefira tiles menores para evitar erros de falta de memória. Em VRAM maior, tiles maiores podem reduzir emendas e acelerar a decodificação.
CreateVideo (#370)#
Combina os quadros decodificados com o áudio gerado em um único fluxo de vídeo na sua taxa de quadros selecionada. Ajuste o fps aqui para corresponder à intenção criativa ou para atender aos requisitos da plataforma. A saída multiplexada é então passada para o salvador no gráfico externo.
Extras opcionais#
- Mantenha os prompts concisos mas concretos: quem/o que, ação, movimento de câmera, iluminação, humor. Deixe o Prompt Enhancer adicionar fraseado cinematográfico.
- Evite direções de câmera conflitantes. Um movimento forte (zoom in, pan, dolly) tende a produzir resultados mais estáveis do que empilhar vários.
- Use quadros iniciais limpos e de alto contraste para retratos e fotos de produtos; o modelo preservará melhor identidade e bordas.
- Comece com durações moderadas para ajustar movimento e enquadramento; estenda apenas depois de gostar do comportamento.
- Se as saídas parecerem suaves, verifique se a largura e altura são múltiplos de 32 e mantenha o upscaler latente ativado.
- Para iterações consistentes, fixe o seed. Ao explorar alternativas, varie o seed enquanto mantém outras configurações intactas.
Agradecimentos#
Este fluxo de trabalho implementa e constrói sobre os seguintes trabalhos e recursos. Agradecemos profundamente à Comfy Org pelo modelo de fluxo de trabalho LTX-2.5: Image to Video ComfyUI, à Lightricks pelos pesos do modelo LTX-2.5, à Lightricks pelo projeto LTX-2.5 Diffusers, e à Lightricks pelos recursos da organização Hugging Face por suas contribuições e manutenção. Para detalhes autoritativos, consulte a documentação original e os repositórios vinculados abaixo.
Recursos#
- Comfy.org/Source workflow template
- GitHub: Comfy-Org
- Docs / Release Notes: Source workflow template
- Lightricks/LTX-2.5 model weights
- GitHub: Lightricks/LTX-2
- Hugging Face: Lightricks/LTX-2.5
- arXiv: 2601.03233
- Lightricks/LTX-2.5 Diffusers project
- Hugging Face: Lightricks/LTX-2.5-Diffusers
- arXiv: 2601.03233
- Lightricks/Hugging Face organization
- GitHub: Lightricks
- Hugging Face: Lightricks
Nota: O uso dos modelos, conjuntos de dados e código referenciados está sujeito às respectivas licenças e termos fornecidos por seus autores e mantenedores.



