ComfyUI>Fluxos de Trabalho>LTX 2.5 GGUF ComfyUI | Imagem-para-Vídeo Cinematográfico

LTX 2.5 GGUF ComfyUI | Imagem-para-Vídeo Cinematográfico

Workflow Name: RunComfy/LTX-2.5-GGUF-ComfyUI
Workflow ID: 0000...1501
Transforme uma imagem fonte em um vídeo curto cinematográfico. Guie o movimento de personagens, máquinas ou ambientes com um prompt de texto. Gere áudio sincronizado para cada cena. Use a inferência LTX-2.5 GGUF para reduzir as demandas de memória. Adicione upscaling latente para resultados mais limpos. Crie mais rápido com o gráfico pronto.

LTX 2.5 GGUF ComfyUI Workflow

LTX 2.5 GGUF ComfyUI | Image-to-Video with Synced Audio
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

LTX 2.5 GGUF ComfyUI Examples

LTX 2.5 GGUF ComfyUI imagem‑para‑vídeo com áudio sincronizado#

Este fluxo de trabalho LTX 2.5 GGUF ComfyUI transforma uma única imagem fonte e um prompt em linguagem natural em um vídeo curto com uma faixa de áudio gerada e sincronizada. Ele usa a família de modelos oficial LTX‑2.5 para geração de vídeo e áudio, roteados através de um caminho UNet quantizado GGUF para reduzir o uso de VRAM mantendo o movimento cinematográfico e a coerência da cena.

O gráfico é projetado para iteração rápida em cenas de personagens, movimentos de máquinas e ambientes. Inclui um interruptor para imagem‑para‑vídeo ou texto‑para‑vídeo, um pipeline latente de duas etapas (passagem grosseira e depois upscaling latente), e decodificação em blocos para manter a pressão de memória baixa. Se você precisa de um caminho compacto e pronto para produção, este fluxo de trabalho LTX 2.5 GGUF ComfyUI é um ponto de partida prático.

Modelos principais no fluxo de trabalho ComfyUI LTX 2.5 GGUF ComfyUI#

  • LTX‑2.5 (oficial, por Lightricks). Modelo gerativo de vídeo e áudio usado para síntese de movimento e orientação multimodal. Model card
  • LTX‑2.5 Video VAE (bf16). Codifica e decodifica latentes de vídeo para geração eficiente, emparelhado com o modelo principal. Incluído no repositório LTX‑2.5 sob vae/. Video VAE
  • LTX‑2.5 Audio VAE (bf16). Lida com o caminho latente de áudio para que a renderização final inclua som sincronizado. Incluído no repositório LTX‑2.5 sob vae/. Audio VAE
  • Codificador de texto baseado em Gemma 12B com projeção LTX‑2.5. Fornece embeddings de prompt correspondentes a LTX‑2.5, embalado pelo repositório LTX sob text_encoders/. Text encoder
  • LTX‑2.5 Latent Spatial Upscaler x2 1.0. Um modelo de super‑resolução em espaço latente que adiciona detalhes após a passagem grosseira. Upscaler
  • LTX‑2.5 Distilled UNet (GGUF quantized). Pesos UNet quantizados carregados via o carregador ComfyUI‑GGUF para reduzir o uso de memória enquanto mantém a qualidade aceitável. GGUF é o formato de inferência, não um nome de modelo oficial. ComfyUI‑GGUF

Como usar o fluxo de trabalho ComfyUI LTX 2.5 GGUF ComfyUI#

O pipeline funciona em duas etapas: uma passagem guiada em baixa resolução para estabelecer movimento e tempo, seguida de upscaling latente e refinamento em alta resolução. O áudio é carregado como um latente emparelhado ao longo do processo, depois decodificado e muxado com os quadros finais.

Modelo#

Carregue o UNet quantizado GGUF com UnetLoaderGGUF (#406). Os VAEs de vídeo e áudio são selecionados com VAELoader (#385, #386), e o codificador de texto baseado em Gemma é fornecido por CLIPLoader (#387). O upscaler é escolhido com LatentUpscaleModelLoader (#371). Este grupo define a espinha dorsal que todos os outros grupos dependem.

Prompt#

Escreva a descrição da sua cena no campo Prompt, focando em assuntos, movimento e um movimento de câmera claro. O codificador de texto incorpora prompts positivos e negativos através de LTXVConditioning (#365), que também aceita a taxa de quadros escolhida para alinhar o tempo. Se você quiser áudio semelhante a fala, inclua linhas curtas entre aspas; o caminho de áudio responderá ao contexto textual enquanto permanece ciente da cena. Mantenha os prompts concisos e específicos para evitar orientações conflitantes.

Configurações de Vídeo#

Defina a duração, taxa de quadros e tamanho alvo. Utilitários convertem segundos e fps em contagens de quadros para que o gráfico aloque o comprimento temporal correto. Mantenha tamanhos que sejam múltiplos de 32 para estabilidade e velocidade. Use o seletor de resolução para escolher uma proporção comum, depois ajuste para sua escala desejada.

Pré-processamento de Imagem#

Carregue o primeiro quadro (referência) e deixe LTXVPreprocess (#350) normalizá-lo para LTX‑2.5. O interruptor Switch to Text to Video? (#363) controla se a imagem é usada como uma âncora espacial ou ignorada para puro texto‑para‑vídeo. O auxiliar de redimensionamento mantém sua entrada consistente com a resolução de trabalho. Um bom pré-processamento melhora a preservação de identidade e layout.

Latente Vazio#

EmptyLTXVLatentVideo (#356) e LTXVEmptyLatentAudio (#366) pré-alocam a tela temporal para vídeo e áudio. Esses comprimentos vêm de suas escolhas de duração e fps. Esta separação garante que os caminhos de vídeo e áudio permaneçam sincronizados à medida que se movem através da amostragem e refinamento.

Gerar Baixa Resolução#

O primeiro bloco de amostragem usa LTXVDualCFGGuider (#388) com seu condicionamento de prompt para conduzir o movimento e a dinâmica da cena, depois sintetiza um latente grosseiro com SamplerCustomAdvanced (#344). Se você estiver fazendo imagem‑para‑vídeo, LTXVImgToVideoInplace (#357) injeta o quadro de referência no latente para estabilizar identidade e composição; ele é ignorado para texto‑para‑vídeo. Esta passagem é propositalmente mais leve para estabelecer movimento e tempo antes do upscaling.

Upscaling Latente#

LTXVSeparateAVLatent (#367) separa áudio e vídeo para que o latente de vídeo possa ser aprimorado por LTXVLatentUpsampler (#348) com o modelo x2. A imagem pré-processada é opcionalmente reaplicada com LTXVImgToVideoInplace (#349) para manter detalhes consistentes após o upscaling. O latente de áudio é então reanexado via LTXVConcatAVLatent (#340), preservando a sincronização.

Gerar Alta Resolução#

Um segundo bloco de amostragem (LTXVDualCFGGuider (#391) mais SamplerCustomAdvanced (#368)) refina detalhes e consistência temporal na escala mais alta. LTXVSeparateAVLatent (#369) passa áudio para LTXVAudioVAEDecode (#358) enquanto o latente de vídeo é decodificado com VAEDecodeTiled (#374) para reduzir picos de VRAM. CreateVideo (#370) monta quadros e áudio no MP4 final na sua taxa de fps alvo.

Nós principais no fluxo de trabalho ComfyUI LTX 2.5 GGUF ComfyUI#

UnetLoaderGGUF (#406)#

Carrega o UNet destilado LTX‑2.5 no formato GGUF. Escolha o arquivo quantizado que corresponde ao seu orçamento de VRAM; quantização mais leve reduz a memória e acelera a inferência com algum custo de qualidade. Se você atualizar para um arquivo menos quantizado, espere texturas mais nítidas e movimento fino mais estável.

LTXVImgToVideoInplace (#357 e #349)#

Injeta o primeiro quadro no latente para que o movimento evolua a partir da sua imagem em vez de se afastar. Alterne a entrada bypass ao alternar entre imagem‑para‑vídeo e texto‑para‑vídeo. Use o nó de baixa resolução (#357) para estabilização inicial e o nó de alta resolução (#349) para reancorar detalhes após o upscaling.

LTXVLatentUpsampler (#348)#

Aplica o LTX‑2.5 Latent Spatial Upscaler para adicionar detalhes sem decodificar para pixels. Use-o quando desejar mais definição com quase o mesmo custo de memória que a passagem grosseira. Se você ver cintilação após o upscaling, fortaleça ligeiramente a orientação na próxima etapa de refinamento.

ManualSigmas (#397 e #396)#

Controla a programação de desnoise usada pelos amostradores. Programações mais curtas são mais rápidas, mas podem reduzir a adesão ou suavidade temporal; programações mais longas ou carregadas na frente adicionam estabilidade a um custo extra. Combine isso com a escolha do amostrador para equilibrar velocidade e qualidade para sua cena.

VAEDecodeTiled (#374)#

Decodifica o latente de vídeo em alta resolução para quadros usando blocos para limitar o uso de VRAM. Se você ficar sem memória, reduza o tamanho do bloco ou ative uma tiling mais forte; se você ver costuras, aumente a sobreposição ou experimente um bloco maior. Mantenha sua seleção de VAE alinhada com o VAE de vídeo oficial LTX‑2.5.

CreateVideo (#370)#

Muxa a sequência de imagens e o áudio decodificado em um arquivo de vídeo final. Defina fps para corresponder à sua taxa de quadros de geração para evitar estiramento de tempo. Use isso como o único ponto de renderização para saídas consistentes em iterações.

Extras opcionais#

  • Para imagem‑para‑vídeo, descreva apenas um movimento de câmera claro e a ação do sujeito; evite movimentos concorrentes.
  • Para texto‑para‑vídeo, mantenha os prompts concisos e adicione linhas curtas entre aspas para áudio semelhante a fala quando apropriado.
  • Dicas de resolução: mantenha múltiplos de 32; tamanhos comuns 16:9 incluem 960x544 (rápido) e 1344x768 ou 1504x832 (mais nítido). Aumente apenas se tiver espaço de VRAM.
  • Se os resultados ignorarem o prompt, aumente a orientação no bloco de amostragem ou simplifique a linguagem do prompt.
  • Para reprodutibilidade entre execuções, defina uma semente fixa no nó de ruído; sementes aleatórias são melhores para exploração.
  • Se a VRAM estiver apertada, prefira o nível Q do GGUF que você pode pagar e mantenha o upscaler ativado; ele adiciona detalhes com custo mínimo de memória.

Links para referência: os modelos e ativos oficiais LTX‑2.5 estão no Hugging Face, e o carregador GGUF UNet vem do ComfyUI‑GGUF.

Agradecimentos#

Este fluxo de trabalho implementa e se baseia nos seguintes trabalhos e recursos. Agradecemos a Lightricks por LTX-2.5 e city96 por ComfyUI-GGUF por suas contribuições e manutenção. Para detalhes autoritativos, consulte a documentação e repositórios originais vinculados abaixo.

Recursos#

Nota: O uso dos modelos, datasets e código referenciados está sujeito às respectivas licenças e termos fornecidos por seus autores e mantenedores.

RunComfy
Copyright 2026 RunComfy. Todos os Direitos Reservados.

RunComfy é a principal ComfyUI plataforma, oferecendo ComfyUI online ambiente e serviços, juntamente com fluxos de trabalho do ComfyUI apresentando visuais impressionantes. RunComfy também oferece AI Models, permitindo que artistas utilizem as mais recentes ferramentas de AI para criar arte incrível.