LTX 2.5 GGUF ComfyUI imagem‑para‑vídeo com áudio sincronizado#
Este fluxo de trabalho LTX 2.5 GGUF ComfyUI transforma uma única imagem fonte e um prompt em linguagem natural em um vídeo curto com uma faixa de áudio gerada e sincronizada. Ele usa a família de modelos oficial LTX‑2.5 para geração de vídeo e áudio, roteados através de um caminho UNet quantizado GGUF para reduzir o uso de VRAM mantendo o movimento cinematográfico e a coerência da cena.
O gráfico é projetado para iteração rápida em cenas de personagens, movimentos de máquinas e ambientes. Inclui um interruptor para imagem‑para‑vídeo ou texto‑para‑vídeo, um pipeline latente de duas etapas (passagem grosseira e depois upscaling latente), e decodificação em blocos para manter a pressão de memória baixa. Se você precisa de um caminho compacto e pronto para produção, este fluxo de trabalho LTX 2.5 GGUF ComfyUI é um ponto de partida prático.
Modelos principais no fluxo de trabalho ComfyUI LTX 2.5 GGUF ComfyUI#
- LTX‑2.5 (oficial, por Lightricks). Modelo gerativo de vídeo e áudio usado para síntese de movimento e orientação multimodal. Model card
- LTX‑2.5 Video VAE (bf16). Codifica e decodifica latentes de vídeo para geração eficiente, emparelhado com o modelo principal. Incluído no repositório LTX‑2.5 sob vae/. Video VAE
- LTX‑2.5 Audio VAE (bf16). Lida com o caminho latente de áudio para que a renderização final inclua som sincronizado. Incluído no repositório LTX‑2.5 sob vae/. Audio VAE
- Codificador de texto baseado em Gemma 12B com projeção LTX‑2.5. Fornece embeddings de prompt correspondentes a LTX‑2.5, embalado pelo repositório LTX sob text_encoders/. Text encoder
- LTX‑2.5 Latent Spatial Upscaler x2 1.0. Um modelo de super‑resolução em espaço latente que adiciona detalhes após a passagem grosseira. Upscaler
- LTX‑2.5 Distilled UNet (GGUF quantized). Pesos UNet quantizados carregados via o carregador ComfyUI‑GGUF para reduzir o uso de memória enquanto mantém a qualidade aceitável. GGUF é o formato de inferência, não um nome de modelo oficial. ComfyUI‑GGUF
Como usar o fluxo de trabalho ComfyUI LTX 2.5 GGUF ComfyUI#
O pipeline funciona em duas etapas: uma passagem guiada em baixa resolução para estabelecer movimento e tempo, seguida de upscaling latente e refinamento em alta resolução. O áudio é carregado como um latente emparelhado ao longo do processo, depois decodificado e muxado com os quadros finais.
Modelo#
Carregue o UNet quantizado GGUF com UnetLoaderGGUF (#406). Os VAEs de vídeo e áudio são selecionados com VAELoader (#385, #386), e o codificador de texto baseado em Gemma é fornecido por CLIPLoader (#387). O upscaler é escolhido com LatentUpscaleModelLoader (#371). Este grupo define a espinha dorsal que todos os outros grupos dependem.
Prompt#
Escreva a descrição da sua cena no campo Prompt, focando em assuntos, movimento e um movimento de câmera claro. O codificador de texto incorpora prompts positivos e negativos através de LTXVConditioning (#365), que também aceita a taxa de quadros escolhida para alinhar o tempo. Se você quiser áudio semelhante a fala, inclua linhas curtas entre aspas; o caminho de áudio responderá ao contexto textual enquanto permanece ciente da cena. Mantenha os prompts concisos e específicos para evitar orientações conflitantes.
Configurações de Vídeo#
Defina a duração, taxa de quadros e tamanho alvo. Utilitários convertem segundos e fps em contagens de quadros para que o gráfico aloque o comprimento temporal correto. Mantenha tamanhos que sejam múltiplos de 32 para estabilidade e velocidade. Use o seletor de resolução para escolher uma proporção comum, depois ajuste para sua escala desejada.
Pré-processamento de Imagem#
Carregue o primeiro quadro (referência) e deixe LTXVPreprocess (#350) normalizá-lo para LTX‑2.5. O interruptor Switch to Text to Video? (#363) controla se a imagem é usada como uma âncora espacial ou ignorada para puro texto‑para‑vídeo. O auxiliar de redimensionamento mantém sua entrada consistente com a resolução de trabalho. Um bom pré-processamento melhora a preservação de identidade e layout.
Latente Vazio#
EmptyLTXVLatentVideo (#356) e LTXVEmptyLatentAudio (#366) pré-alocam a tela temporal para vídeo e áudio. Esses comprimentos vêm de suas escolhas de duração e fps. Esta separação garante que os caminhos de vídeo e áudio permaneçam sincronizados à medida que se movem através da amostragem e refinamento.
Gerar Baixa Resolução#
O primeiro bloco de amostragem usa LTXVDualCFGGuider (#388) com seu condicionamento de prompt para conduzir o movimento e a dinâmica da cena, depois sintetiza um latente grosseiro com SamplerCustomAdvanced (#344). Se você estiver fazendo imagem‑para‑vídeo, LTXVImgToVideoInplace (#357) injeta o quadro de referência no latente para estabilizar identidade e composição; ele é ignorado para texto‑para‑vídeo. Esta passagem é propositalmente mais leve para estabelecer movimento e tempo antes do upscaling.
Upscaling Latente#
LTXVSeparateAVLatent (#367) separa áudio e vídeo para que o latente de vídeo possa ser aprimorado por LTXVLatentUpsampler (#348) com o modelo x2. A imagem pré-processada é opcionalmente reaplicada com LTXVImgToVideoInplace (#349) para manter detalhes consistentes após o upscaling. O latente de áudio é então reanexado via LTXVConcatAVLatent (#340), preservando a sincronização.
Gerar Alta Resolução#
Um segundo bloco de amostragem (LTXVDualCFGGuider (#391) mais SamplerCustomAdvanced (#368)) refina detalhes e consistência temporal na escala mais alta. LTXVSeparateAVLatent (#369) passa áudio para LTXVAudioVAEDecode (#358) enquanto o latente de vídeo é decodificado com VAEDecodeTiled (#374) para reduzir picos de VRAM. CreateVideo (#370) monta quadros e áudio no MP4 final na sua taxa de fps alvo.
Nós principais no fluxo de trabalho ComfyUI LTX 2.5 GGUF ComfyUI#
UnetLoaderGGUF (#406)#
Carrega o UNet destilado LTX‑2.5 no formato GGUF. Escolha o arquivo quantizado que corresponde ao seu orçamento de VRAM; quantização mais leve reduz a memória e acelera a inferência com algum custo de qualidade. Se você atualizar para um arquivo menos quantizado, espere texturas mais nítidas e movimento fino mais estável.
LTXVImgToVideoInplace (#357 e #349)#
Injeta o primeiro quadro no latente para que o movimento evolua a partir da sua imagem em vez de se afastar. Alterne a entrada bypass ao alternar entre imagem‑para‑vídeo e texto‑para‑vídeo. Use o nó de baixa resolução (#357) para estabilização inicial e o nó de alta resolução (#349) para reancorar detalhes após o upscaling.
LTXVLatentUpsampler (#348)#
Aplica o LTX‑2.5 Latent Spatial Upscaler para adicionar detalhes sem decodificar para pixels. Use-o quando desejar mais definição com quase o mesmo custo de memória que a passagem grosseira. Se você ver cintilação após o upscaling, fortaleça ligeiramente a orientação na próxima etapa de refinamento.
ManualSigmas (#397 e #396)#
Controla a programação de desnoise usada pelos amostradores. Programações mais curtas são mais rápidas, mas podem reduzir a adesão ou suavidade temporal; programações mais longas ou carregadas na frente adicionam estabilidade a um custo extra. Combine isso com a escolha do amostrador para equilibrar velocidade e qualidade para sua cena.
VAEDecodeTiled (#374)#
Decodifica o latente de vídeo em alta resolução para quadros usando blocos para limitar o uso de VRAM. Se você ficar sem memória, reduza o tamanho do bloco ou ative uma tiling mais forte; se você ver costuras, aumente a sobreposição ou experimente um bloco maior. Mantenha sua seleção de VAE alinhada com o VAE de vídeo oficial LTX‑2.5.
CreateVideo (#370)#
Muxa a sequência de imagens e o áudio decodificado em um arquivo de vídeo final. Defina fps para corresponder à sua taxa de quadros de geração para evitar estiramento de tempo. Use isso como o único ponto de renderização para saídas consistentes em iterações.
Extras opcionais#
- Para imagem‑para‑vídeo, descreva apenas um movimento de câmera claro e a ação do sujeito; evite movimentos concorrentes.
- Para texto‑para‑vídeo, mantenha os prompts concisos e adicione linhas curtas entre aspas para áudio semelhante a fala quando apropriado.
- Dicas de resolução: mantenha múltiplos de 32; tamanhos comuns 16:9 incluem 960x544 (rápido) e 1344x768 ou 1504x832 (mais nítido). Aumente apenas se tiver espaço de VRAM.
- Se os resultados ignorarem o prompt, aumente a orientação no bloco de amostragem ou simplifique a linguagem do prompt.
- Para reprodutibilidade entre execuções, defina uma semente fixa no nó de ruído; sementes aleatórias são melhores para exploração.
- Se a VRAM estiver apertada, prefira o nível Q do GGUF que você pode pagar e mantenha o upscaler ativado; ele adiciona detalhes com custo mínimo de memória.
Links para referência: os modelos e ativos oficiais LTX‑2.5 estão no Hugging Face, e o carregador GGUF UNet vem do ComfyUI‑GGUF.
- Modelos e ativos LTX‑2.5: Lightricks/LTX‑2.5
- Carregador GGUF: city96/ComfyUI‑GGUF
Agradecimentos#
Este fluxo de trabalho implementa e se baseia nos seguintes trabalhos e recursos. Agradecemos a Lightricks por LTX-2.5 e city96 por ComfyUI-GGUF por suas contribuições e manutenção. Para detalhes autoritativos, consulte a documentação e repositórios originais vinculados abaixo.
Recursos#
- Lightricks/LTX-2.5
- Hugging Face: Lightricks/LTX-2.5
- city96/ComfyUI-GGUF
- GitHub: city96/ComfyUI-GGUF
Nota: O uso dos modelos, datasets e código referenciados está sujeito às respectivas licenças e termos fornecidos por seus autores e mantenedores.

