LTX 2.5 Primeira e Última Quadro para Vídeo: clipes cinematográficos ancorados em dois quadros, com áudio sincronizado#
Este fluxo de trabalho pronto para RunComfy transforma uma imagem de início e fim combinada em um vídeo cinematográfico curto com áudio sincronizado. Ao orientar a geração a partir das âncoras do primeiro e último quadro, ele preserva a composição, iluminação, identidade do sujeito e estilo enquanto cria movimento coerente entre os dois. LTX 2.5 Primeira e Última Quadro para Vídeo é ideal para ações de personagens controladas, batidas de produtos, movimentos de câmera e transições de cena dentro do ComfyUI.
Sob o capô, ele combina o transformador LTX-2.5 da Lightricks com VAEs de vídeo e áudio dedicados, além de um aprimorador de prompts baseado em Gemma. O gráfico é fornecido com grupos claros para Prompt, Configurações de Vídeo, Preparação de Primeiro/Último Quadro, Condicionamento, Amostragem e Decodificação, para que você possa obter resultados confiáveis e repetíveis sem mexer na fiação de baixo nível.
Modelos principais no fluxo de trabalho Comfyui LTX 2.5 Primeira e Última Quadro para Vídeo#
- Lightricks LTX-2.5 transformador destilado. O gerador de vídeo principal que aprende movimento, aparência e consistência temporal a partir de guias textuais e visuais. Página do modelo
- LTX-2.5 Video VAE. Comprime e decodifica latentes de vídeo para quadros nítidos enquanto mantém o uso de memória prático. Incluído no repositório LTX-2.5. Página do modelo
- LTX-2.5 Audio VAE. Gera e reconstrói latentes de áudio sincronizados para corresponder a eventos visuais. Incluído no repositório LTX-2.5. Página do modelo
- Gemma 4 12B codificador de texto com projeção para LTX-2.5. Codifica seu prompt em um condicionamento rico que abrange sujeitos, ações, iluminação e direção de câmera. Incluído nos ativos do LTX-2.5. Página do modelo
- Variante ajustada por instrução Gemma 4 E2B para aprimoramento de prompt. Expande entradas curtas em direções cinematográficas quando o aprimoramento está ativado. Página do modelo
- Referência opcional de Difusores para pipelines e comportamento de agendamento LTX-2.5. Útil para entender compensações de amostragem. Página do projeto
Como usar o fluxo de trabalho Comfyui LTX 2.5 Primeira e Última Quadro para Vídeo#
O fluxo de trabalho pega duas imagens como âncoras, transforma-as em orientação, então remove ruídos de vídeo e áudio latentes sob controle de texto antes de decodificar para um clipe pronto para compartilhar. Cada grupo abaixo desempenha um papel específico; a maioria dos usuários tocará apenas no Prompt, Aprimoramento de Prompt e Configurações de Vídeo.
Prompt#
Escreva uma instrução concisa, mas descritiva, no nó Prompt (#252). O texto positivo é codificado por CLIPTextEncode (#222) usando o codificador Gemma 4 12B para que o modelo entenda sujeitos, ações, iluminação e intenção de câmera. Mantenha o estado final descrito assim como a batida de abertura para ajudar o modelo a respeitar ambas as âncoras. Se você precisar de redação rigorosa ou termos de marca, escreva-os explicitamente no prompt.
Aprimoramento de Prompt#
Prompts curtos podem ser automaticamente expandidos com TextGenerateLTX2Prompt (#247). O ComfySwitchNode (#248) encaminha seu prompt bruto ou o texto aprimorado para o codificador, e PreviewAny (#249) permite que você inspecione o texto final. Ative o aprimoramento quando quiser uma redação cinematográfica e pistas de movimento mais ricas; desative-o quando a redação do prompt precisar permanecer exata.
Configurações de Vídeo#
Defina a duração do clipe, taxa de quadros e resolução com Duration (#198), Frame Rate(int) (#205), Width (#215) e height (#216). O gráfico calcula a contagem total de quadros via ComfyMathExpression (#226) e aloca latentes de vídeo em EmptyLTXVLatentVideo (#201) e latentes de áudio em LTXVEmptyLatentAudio (#197). Resolução ou taxa de quadros mais alta aumenta o uso de VRAM e tempo; comece modestamente, então escale uma vez que você gostar do movimento.
Primeiro Quadro#
Carregue sua imagem inicial, que é redimensionada em ResizeImageMaskNode (#213) para corresponder à resolução alvo. LTXVPreprocess (#199) normaliza tom e detalhe para orientação estável. Imagens limpas, bem expostas e composicionalmente claras fazem o modelo travar mais rápido e reduzem desvios indesejados da âncora.
Último Quadro#
Carregue sua imagem final; ela é redimensionada em ResizeImageMaskNode (#214) e normalizada em LTXVPreprocess (#195). Procure por correspondência de proporção de aspecto, perspectiva e escala do sujeito em relação ao primeiro quadro para que a transição pareça fisicamente plausível e a âncora seja preservada no final.
Condicionamento#
O condicionamento de texto é composto em LTXVConditioning (#202), que também recebe a taxa de quadros alvo para que o tempo se alinhe entre os ramos. A orientação da imagem é anexada em duas passagens com LTXVAddGuide (#206) para o primeiro quadro e LTXVAddGuide (#204) para o último quadro, garantindo que ambas as âncoras influenciem a trajetória. LTXVCropGuides (#200) reconcilia quaisquer diferenças de tamanho residuais para que a orientação se alinhe perfeitamente com a tela latente.
Amostragem#
O ruído é semeado em RandomNoise (#196), e a remoção de ruído é conduzida por SamplerCustomAdvanced (#211) com SamplerEulerAncestral (#208) e um agendamento ManualSigmas (#239) para atualizações nítidas e estáveis em movimento. A orientação vem de LTXVDualCFGGuider (#235) alimentada pelo UNETLoader (#230), misturando condições positivas e negativas para direcionar aparência e movimento. Latentes de áudio e vídeo são concatenados e posteriormente separados com LTXVConcatAVLatent (#210) e LTXVSeparateAVLatent (#221) para que movimento e som evoluam juntos.
Decodificação e saída#
Latentes são decodificados para quadros com VAEDecodeTiled (#219) usando o VAE de vídeo e para áudio com LTXVAudioVAEDecode (#220) usando o VAE de áudio. CreateVideo (#218) multiplica imagens e áudio na sua FPS escolhida para produzir um clipe final. De volta ao gráfico superior, SaveVideo (#68) escreve o resultado; renomeie ou altere o local lá se desejar.
Nós principais no fluxo de trabalho Comfyui LTX 2.5 Primeira e Última Quadro para Vídeo#
TextGenerateLTX2Prompt (#247)#
Expande entradas breves em um prompt cinematográfico compatível com LTX. Use-o quando quiser verbos mais ricos, iluminação e linguagem de câmera com esforço mínimo. Se você precisar de redação exata ou redação segura para a marca, desative o aprimoramento via ComfySwitchNode (#248) e forneça o texto final você mesmo.
LTXVDualCFGGuider (#235)#
Combina o modelo LTX-2.5 com condicionamento positivo e negativo para equilibrar aderência e liberdade. Aumente a orientação para maior fidelidade ao prompt e à âncora; diminua-a para um movimento mais solto e orgânico. Orientação extremamente alta pode restringir demais o movimento ou introduzir saturação, então ajuste em conjunto com a força do prompt negativo.
SamplerCustomAdvanced (#211)#
Executa o loop de remoção de ruído usando SamplerEulerAncestral (#208) e o agendamento de sigmas escolhido. Use agendamentos mais curtos para testes de velocidade e mais longos quando precisar de mais retenção de detalhes em movimento. Se o movimento parecer trêmulo, experimente uma rampa de sigma mais suave ou reduza um pouco a orientação para reduzir a supercorreção entre os passos.
ManualSigmas (#239)#
Define o agendamento de ruído que troca nitidez por suavidade temporal. Ruído carregado na frente pode encorajar movimentos maiores no início, enquanto uma cauda mais suave pode preservar detalhes perto da âncora final. Ajuste apenas depois de estar satisfeito com o prompt e âncoras.
VAEDecodeTiled (#219)#
Decodifica latentes de vídeo em imagens usando processamento em blocos para ajustar resoluções maiores na memória. Blocos menores reduzem o uso de VRAM, mas podem arriscar costuras de blocos; blocos maiores são mais limpos, mas mais pesados. Mantenha resolução e tamanho de bloco em equilíbrio para sua GPU.
LTXVAudioVAEDecode (#220)#
Reconstrói a faixa de áudio sincronizada a partir de latentes de áudio. Para exportar um clipe silencioso, desative temporariamente o ramo de áudio dentro do subgráfico antes de CreateVideo (#218). Se o som final parecer muito ocupado, reduza a densidade de ação no prompt para que o modelo de áudio siga uma batida mais simples.
RandomNoise (#196)#
Semeia a geração. Para resultados reprodutíveis, abra o subgráfico e defina uma semente fixa em vez de randomizar. Ao explorar opções de movimento a partir das mesmas âncoras e prompt, varie a semente para amostrar diferentes trajetórias.
Extras opcionais#
- Para transições mais limpas, mantenha os primeiros e últimos quadros alinhados em proporção de aspecto, horizonte e escala do sujeito; desajustes forçam o modelo a distorcer a geometria.
- Descreva o movimento explicitamente: “começa virado para a esquerda, vira para a câmera, mão se abre, cristal azul sobe acima da palma” é melhor do que um prompt apenas de estilo.
- Duração e FPS interagem; aumentar ambos eleva o uso de memória e tempo de renderização. Estique um de cada vez e visualize antes de escalar.
- Se as bordas piscarem, reduza adjetivos de textura fina no prompt ou diminua um pouco a orientação para favorecer a estabilidade temporal.
- Para acelerar a iteração, teste em uma resolução menor, depois aumente largura e altura uma vez que o movimento e a composição estejam travados.
- Quando precisar de quadros finais perfeitos para a marca, enfatize-os no prompt e mantenha o último quadro limpo e de alto contraste para que LTX 2.5 Primeira e Última Quadro para Vídeo possa travar com confiabilidade.
Agradecimentos#
Este fluxo de trabalho implementa e constrói sobre os seguintes trabalhos e recursos. Agradecemos a Comfy.org pelo modelo de fluxo de trabalho Source, a Lightricks pelos pesos do modelo LTX-2.5 e a Lightricks pelo projeto LTX-2.5 Diffusers por suas contribuições e manutenção. Para detalhes autoritativos, consulte a documentação original e repositórios vinculados abaixo.
Recursos#
- Comfy.org/Source modelo de fluxo de trabalho
- Documentos / Notas de Lançamento: Source modelo de fluxo de trabalho
- Lightricks/LTX-2.5
- Hugging Face: Lightricks/LTX-2.5
- Lightricks/LTX-2.5-Diffusers
- Hugging Face: Lightricks/LTX-2.5-Diffusers
- Lightricks/organização Hugging Face
- Hugging Face: Lightricks
Nota: O uso dos modelos, conjuntos de dados e código referenciados está sujeito às respectivas licenças e termos fornecidos por seus autores e mantenedores.

