ComfyUI>Fluxos de Trabalho>LTX 2.5 ComfyUI Imagem para Vídeo | Movimento Realista & Áudio Nativo

LTX 2.5 ComfyUI Imagem para Vídeo | Movimento Realista & Áudio Nativo

Workflow Name: RunComfy/LTX-2.5-ComfyUI
Workflow ID: 0000...1489
Você pode transformar uma imagem em um curta-metragem cinematográfico. Guie o movimento com um prompt em linguagem natural. Obtenha movimento mais nítido e áudio sincronizado. Use a melhoria de prompt para melhor controle de cena. Anime retratos, produtos, animais ou locais. Execute o fluxo de trabalho LTX-2.5 no RunComfy sem configuração extra.

LTX 2.5 ComfyUI Workflow

LTX 2.5 ComfyUI Image to Video | Synced Audio
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

LTX 2.5 ComfyUI Examples

LTX 2.5 ComfyUI Imagem para Vídeo com Áudio Sincronizado#

Este fluxo de trabalho LTX 2.5 ComfyUI pronto para RunComfy transforma um único primeiro quadro e um prompt de movimento em um vídeo cinematográfico curto com áudio coerente e em modelo. É alimentado pela família Lightricks LTX-2.5, combinando Pixel Diffusion, um aprimorador de prompt baseado em Gemma, VAEs de vídeo e áudio, e upscaling latente para movimento nítido e forte aderência ao prompt.

Use este gráfico LTX 2.5 ComfyUI para animar retratos, locais atmosféricos, produtos, animais e fotos conceituais enquanto permanece dentro do ComfyUI. Forneça uma imagem inicial, descreva a ação e a câmera, defina duração e taxa de quadros, e renderize uma cena que mantenha o caráter, iluminação e estilo através dos quadros.

Modelos chave no fluxo de trabalho Comfyui LTX 2.5 ComfyUI#

Como usar o fluxo de trabalho Comfyui LTX 2.5 ComfyUI#

Este fluxo de trabalho expande e condiciona seu prompt, constrói latentes de vídeo e áudio, amostra uma passagem de baixa resolução, realiza upscaling latente, então decodifica para quadros e áudio sincronizado para muxing final. O controlador de nível superior é Image to Video (LTX-2.5) (#398), que pega seu primeiro quadro, prompt de texto e configurações principais, então encaminha para o subgráfico.

Pré-processamento de Imagem#

Forneça sua imagem inicial para Load First Frame (#395). O quadro é padronizado em LTXVPreprocess (#350) para uma base limpa e amigável ao modelo. Use ResolutionSelector (#403) para escolher aspecto e escala; ele fornece largura e altura alinhadas a múltiplos amigáveis ao modelo. Bons primeiros quadros são nítidos, bem iluminados e compostos para o movimento que você planeja descrever. O pré-processador evita mudanças destrutivas enquanto prepara a imagem para amostragem latente.

Aprimoramento de Prompt#

Escreva seu prompt de movimento e câmera em Prompt (#376). Se você habilitar o aprimorador interno, TextGenerateLTX2Prompt (#380) enriquece seu texto com detalhes sobre batidas de ação, continuidade e enquadramento usando um modelo baseado em Gemma. O comutador ComfySwitchNode (#382) permite que você direcione seu texto bruto ou a versão aprimorada para o condicionamento. Esta etapa melhora a aderência ao prompt para entradas curtas e ajuda a manter assuntos e estilo através dos quadros. Você pode visualizar o texto expandido em PreviewAny (#381) antes da renderização.

Modelo#

O subgráfico carrega o gerador destilado em UNETLoader (#384) e os decodificadores em VAELoader para vídeo (#385) e áudio (#386). O modelo de upscaler latente é preparado por LatentUpscaleModelLoader (#371) para uma passagem de detalhes limpa x2 mais tarde. Este bloco garante que a mesma família de modelos LTX-2.5 seja usada em toda a codificação, amostragem e decodificação, o que preserva a coerência temporal.

Prompt#

CLIPLoader (#387) e CLIPTextEncode positivo (#364) transformam seu prompt descritivo em condicionamento. Um codificador negativo dedicado (#373) suprime características indesejadas como baixa qualidade ou artefatos. LTXVConditioning (#365) mescla o condicionamento de texto com sua taxa de quadros escolhida para que a orientação de tempo flua para o fluxo latente áudio-visual. Manter a linguagem de câmera e ação clara leva a um movimento mais estável e latitude de edição.

Configurações de Vídeo#

Duração, largura, altura, taxa de quadros e seed são configurados no grupo Video Settings (e.g., Duration (#362) e Frame Rate (#361)). Auxiliares matemáticos simples calculam a contagem total de quadros e fornecem valores uniformes quando necessário. Escolha uma taxa de quadros que corresponda à sensação que você deseja; ação mais lenta pode parecer melhor em fps mais baixo, enquanto movimento rápido se beneficia de fps mais alto. Para tomadas reprodutíveis, fixe o seed; varie-o para explorar alternativas.

Latente Vazio#

EmptyLTXVLatentVideo (#356) cria um latente de vídeo do tamanho e comprimento corretos, enquanto LTXVEmptyLatentAudio (#366) constrói um latente de áudio alinhado no tempo. Isso garante que os fluxos de vídeo e áudio compartilhem o tempo desde o início. Com o comprimento derivado da duração e taxa de quadros, o sampler recebe tensores corretamente moldados. O resultado é uma base sincronizada para a remoção conjunta de ruído áudio-visual.

Gerar Baixa Resolução#

Uma primeira passagem de amostragem constrói movimento coerente em uma resolução gerenciável. LTXVDualCFGGuider (#388) aplica orientação de modalidade dupla para que tanto texto quanto tempo moldem os latentes de vídeo e áudio juntos. SamplerCustomAdvanced (#344) executa as etapas de difusão com seu sampler escolhido e agendamento, semeado por RandomNoise (#339). A restrição do primeiro quadro é aplicada por LTXVImgToVideoInplace (#357), que mantém identidade, iluminação e composição ancoradas à sua imagem fornecida. Após a amostragem, LTXVConcatAVLatent e LTXVSeparateAVLatent embaralham latentes de áudio e vídeo conforme necessário para as próximas etapas.

Upscale Latente#

LTXVLatentUpsampler (#348) realiza um upscaling de espaço latente x2 para aumentar texturas e microdetalhes antes da decodificação. LTXVImgToVideoInplace (#349) realinha o latente ampliado com o quadro inicial para que identidade e layout permaneçam estáveis. Fazer isso no espaço latente preserva a suavidade temporal melhor do que redimensionamento em pixel. Este estágio é um grande contribuinte para a nitidez final.

Gerar Alta Resolução#

Um sampler de refinamento (KSamplerSelect (#341) mais SamplerCustomAdvanced (#368)) roda no latente ampliado com um cronograma mais curto, estabilizando bordas e enriquecendo detalhes. LTXVDualCFGGuider (#391) mantém a orientação consistente com seu texto enquanto preserva o movimento definido na primeira passagem. O latente combinado é então dividido por LTXVSeparateAVLatent (#369) para decodificação. VAEDecodeTiled (#374) transforma o latente de vídeo em quadros e LTXVAudioVAEDecode (#358) produz áudio sincronizado.

Renderizar e Salvar#

CreateVideo (#370) combina quadros e áudio gerados em um único fluxo de vídeo na sua taxa de quadros selecionada. No gráfico externo, SaveVideo (#75) grava o resultado na saída normal do ComfyUI. Você também pode experimentar o áudio sozinho através de um nó de pré-visualização no wrapper de nível superior antes das renderizações completas.

Nós chave no fluxo de trabalho Comfyui LTX 2.5 ComfyUI#

Image to Video (LTX-2.5) (#398)#

Este é o controlador único para todo o pipeline. Forneça o primeiro quadro, seu prompt, duração, resolução, taxa de quadros e se deseja habilitar o aprimoramento de prompt. Use-o para iterar rapidamente; quando estiver pronto para ajustar, clique em Enter subgraph para ajustar amostradores, orientação e decodificação. Se precisar de vídeo apenas de texto, abra o subgráfico e alterne o bypass interno de texto para vídeo nos nós de imagem para vídeo.

LTXVDualCFGGuider (#388)#

Aplica orientação livre de classificador no latente áudio-visual conjunto, equilibrando aderência ao prompt com estabilidade temporal. Aumente a orientação para seguir o prompt mais fortemente e obter movimento mais impactante; reduza-a para diminuir o flicker ou preservar mais das nuances do quadro inicial. Mantenha a orientação de vídeo e áudio na mesma faixa para que a trilha sonora permaneça alinhada com a ação na tela.

SamplerCustomAdvanced (#344)#

Dirige a difusão com seu sampler escolhido e um cronograma sigma personalizado. Use este nó para explorar a qualidade do movimento versus a estabilidade mudando variantes de sampler ou editando cronogramas. Emparelhe-o com um seed fixo para comparar configurações de forma consistente, depois randomize o seed para buscar a melhor tomada.

LTXVLatentUpsampler (#348)#

Realiza upscaling no espaço latente com o modelo dedicado LTX-2.5 x2, melhorando detalhes sem introduzir oscilação temporal. Se você planeja cortes pesados ou close-ups apertados, mantenha isso habilitado para que pequenos recursos sobrevivam à decodificação. Para limites extremos de VRAM, você pode ignorar o upscaling ao custo de alguma nitidez.

VAEDecodeTiled (#374)#

Decodifica latentes de vídeo de alta resolução em quadros usando tiling para controlar o uso de memória. Em VRAM menor, prefira tiles menores para evitar erros de falta de memória. Em VRAM maior, tiles maiores podem reduzir emendas e acelerar a decodificação.

CreateVideo (#370)#

Combina os quadros decodificados com o áudio gerado em um único fluxo de vídeo na sua taxa de quadros selecionada. Ajuste o fps aqui para corresponder à intenção criativa ou para atender aos requisitos da plataforma. A saída multiplexada é então passada para o salvador no gráfico externo.

Extras opcionais#

  • Mantenha os prompts concisos mas concretos: quem/o que, ação, movimento de câmera, iluminação, humor. Deixe o Prompt Enhancer adicionar fraseado cinematográfico.
  • Evite direções de câmera conflitantes. Um movimento forte (zoom in, pan, dolly) tende a produzir resultados mais estáveis do que empilhar vários.
  • Use quadros iniciais limpos e de alto contraste para retratos e fotos de produtos; o modelo preservará melhor identidade e bordas.
  • Comece com durações moderadas para ajustar movimento e enquadramento; estenda apenas depois de gostar do comportamento.
  • Se as saídas parecerem suaves, verifique se a largura e altura são múltiplos de 32 e mantenha o upscaler latente ativado.
  • Para iterações consistentes, fixe o seed. Ao explorar alternativas, varie o seed enquanto mantém outras configurações intactas.

Agradecimentos#

Este fluxo de trabalho implementa e constrói sobre os seguintes trabalhos e recursos. Agradecemos profundamente à Comfy Org pelo modelo de fluxo de trabalho LTX-2.5: Image to Video ComfyUI, à Lightricks pelos pesos do modelo LTX-2.5, à Lightricks pelo projeto LTX-2.5 Diffusers, e à Lightricks pelos recursos da organização Hugging Face por suas contribuições e manutenção. Para detalhes autoritativos, consulte a documentação original e os repositórios vinculados abaixo.

Recursos#

Nota: O uso dos modelos, conjuntos de dados e código referenciados está sujeito às respectivas licenças e termos fornecidos por seus autores e mantenedores.

RunComfy
Copyright 2026 RunComfy. Todos os Direitos Reservados.

RunComfy é a principal ComfyUI plataforma, oferecendo ComfyUI online ambiente e serviços, juntamente com fluxos de trabalho do ComfyUI apresentando visuais impressionantes. RunComfy também oferece AI Models, permitindo que artistas utilizem as mais recentes ferramentas de AI para criar arte incrível.