LTX 2.5 GGUF ComfyUI da immagine a video con audio sincronizzato#
Questo flusso di lavoro LTX 2.5 GGUF ComfyUI trasforma un'unica immagine di origine e un prompt in linguaggio naturale in un breve video con una traccia audio generata e sincronizzata. Utilizza la famiglia di modelli ufficiale LTX-2.5 per la generazione di video e audio, instradati attraverso un percorso UNet quantizzato GGUF per ridurre la VRAM mantenendo il movimento cinematografico e la coerenza della scena.
Il grafico è progettato per una rapida iterazione su riprese di personaggi, movimenti di macchinari e ambienti. Include un interruttore per immagine a video o testo a video, una pipeline latente a due stadi (passaggio grezzo poi upscaling latente), e decodifica a tasselli per mantenere bassa la pressione della memoria. Se hai bisogno di un percorso compatto, pronto per la produzione, questo flusso di lavoro LTX 2.5 GGUF ComfyUI è un punto di partenza pratico.
Modelli chiave nel flusso di lavoro ComfyUI LTX 2.5 GGUF ComfyUI#
- LTX-2.5 (ufficiale, di Lightricks). Modello generativo di base per video e audio utilizzato per la sintesi del movimento e la guida multimodale. Model card
- LTX-2.5 Video VAE (bf16). Codifica e decodifica latenze video per una generazione efficiente, associata al modello principale. Incluso nel repository LTX-2.5 sotto vae/. Video VAE
- LTX-2.5 Audio VAE (bf16). Gestisce il percorso latente audio in modo che il rendering finale includa suono sincronizzato. Incluso nel repository LTX-2.5 sotto vae/. Audio VAE
- Codificatore di testo basato su Gemma 12B con proiezione LTX-2.5. Fornisce incorporamenti di prompt abbinati a LTX-2.5, confezionati dal repository LTX sotto text_encoders/. Text encoder
- LTX-2.5 Latent Spatial Upscaler x2 1.0. Un modello di super-risoluzione nello spazio latente che aggiunge dettagli dopo il passaggio grezzo. Upscaler
- LTX-2.5 Distilled UNet (GGUF quantizzato). Pesi UNet quantizzati caricati tramite il caricatore ComfyUI-GGUF per ridurre l'uso della memoria mantenendo una qualità accettabile. GGUF è il formato di inferenza, non un nome di modello ufficiale. ComfyUI-GGUF
Come utilizzare il flusso di lavoro ComfyUI LTX 2.5 GGUF ComfyUI#
La pipeline si esegue in due fasi: un passaggio a bassa risoluzione guidato per stabilire movimento e tempistica, seguito da upscaling latente e un raffinamento ad alta risoluzione. L'audio viene mantenuto come latente associato per tutta la durata, poi decodificato e muxato con i fotogrammi finali.
Modello#
Carica l'UNet quantizzato GGUF con UnetLoaderGGUF (#406). I VAE video e audio sono selezionati con VAELoader (#385, #386), e il codificatore di testo basato su Gemma è fornito da CLIPLoader (#387). L'upscaler è scelto con LatentUpscaleModelLoader (#371). Questo gruppo definisce la spina dorsale su cui si basano tutti gli altri gruppi.
Prompt#
Scrivi la descrizione della tua scena nel campo Prompt, concentrandoti su soggetti, movimento e un unico movimento di camera chiaro. Il codificatore di testo incorpora prompt positivi e negativi attraverso LTXVConditioning (#365), che accetta anche il frame rate scelto per allineare la tempistica. Se desideri audio simile a un discorso, includi brevi frasi tra virgolette; il percorso audio risponderà al contesto testuale mantenendo la consapevolezza della scena. Mantieni i prompt concisi e specifici per evitare indicazioni contrastanti.
Impostazioni Video#
Imposta durata, frame rate e dimensione target. Le utilità convertono secondi e fps in conteggi di fotogrammi così che il grafico allochi la lunghezza temporale corretta. Attieniti a dimensioni che sono multipli di 32 per stabilità e velocità. Usa il selettore di risoluzione per scegliere un rapporto d'aspetto comune, poi regola alla scala desiderata.
Pre-elaborazione Immagine#
Carica il primo fotogramma (di riferimento) e lascia che LTXVPreprocess (#350) lo normalizzi per LTX-2.5. L'interruttore Switch to Text to Video? (#363) controlla se l'immagine viene usata come ancoraggio spaziale o bypassata per puro testo a video. L'aiuto per il ridimensionamento mantiene il tuo input coerente con la risoluzione di lavoro. Una buona pre-elaborazione migliora la conservazione dell'identità e il layout.
Latente Vuoto#
EmptyLTXVLatentVideo (#356) e LTXVEmptyLatentAudio (#366) pre-allocano la tela temporale per video e audio. Queste lunghezze derivano dalle tue scelte di durata e fps. Questa separazione garantisce che i percorsi video e audio rimangano sincronizzati mentre attraversano campionamento e raffinamento.
Generare Bassa Risoluzione#
Il primo blocco di campionamento utilizza LTXVDualCFGGuider (#388) con il tuo condizionamento del prompt per guidare movimento e dinamiche della scena, poi sintetizza un latente grezzo con SamplerCustomAdvanced (#344). Se stai facendo immagine a video, LTXVImgToVideoInplace (#357) inietta il fotogramma di riferimento nel latente per stabilizzare identità e composizione; viene bypassato per testo a video. Questo passaggio è volutamente più leggero per stabilire movimento e tempistica prima dell'upscaling.
Upscale Latente#
LTXVSeparateAVLatent (#367) divide audio e video così che il latente video possa essere migliorato da LTXVLatentUpsampler (#348) con il modello x2. L'immagine pre-elaborata è opzionalmente riapplicata con LTXVImgToVideoInplace (#349) per mantenere i dettagli coerenti dopo l'upscale. Il latente audio è poi riattaccato tramite LTXVConcatAVLatent (#340), preservando la sincronizzazione.
Generare Alta Risoluzione#
Un secondo blocco di campionamento (LTXVDualCFGGuider (#391) più SamplerCustomAdvanced (#368)) affina dettaglio e coerenza temporale alla scala superiore. LTXVSeparateAVLatent (#369) passa l'audio a LTXVAudioVAEDecode (#358) mentre il latente video viene decodificato con VAEDecodeTiled (#374) per ridurre i picchi di VRAM. CreateVideo (#370) assembla fotogrammi e audio nel video MP4 finale al tuo fps target.
Nodi chiave nel flusso di lavoro ComfyUI LTX 2.5 GGUF ComfyUI#
UnetLoaderGGUF (#406)#
Carica l'UNet distillato LTX-2.5 in formato GGUF. Scegli il file quantizzato che corrisponde al tuo budget VRAM; una quantizzazione più leggera riduce la memoria e accelera l'inferenza a qualche costo di qualità. Se aggiorni a un file meno quantizzato, aspettati trame più nitide e movimenti fini più stabili.
LTXVImgToVideoInplace (#357 e #349)#
Inietta il primo fotogramma nel latente così che il movimento evolva dalla tua immagine piuttosto che allontanarsi. Attiva l'input bypass quando passi da immagine a video e testo a video. Usa il nodo a bassa risoluzione (#357) per la stabilizzazione iniziale e il nodo ad alta risoluzione (#349) per riancorare i dettagli dopo l'upscaling.
LTXVLatentUpsampler (#348)#
Applica il LTX-2.5 Latent Spatial Upscaler per aggiungere dettagli senza decodificare a pixel. Usalo quando vuoi più definizione a quasi lo stesso costo di memoria del passaggio grezzo. Se vedi sfarfallio dopo l'upscaling, rinforza leggermente la guida nella fase di raffinamento successiva.
ManualSigmas (#397 e #396)#
Controlla il programma di denoise utilizzato dai campionatori. Programmi più brevi sono più veloci ma possono ridurre l'aderenza o la fluidità temporale; programmi più lunghi o caricati frontalmente aggiungono stabilità a costo aggiuntivo. Abbinalo alla scelta del campionatore per bilanciare velocità e qualità per la tua scena.
VAEDecodeTiled (#374)#
Decodifica il latente video ad alta risoluzione in fotogrammi usando tasselli per limitare l'uso della VRAM. Se esaurisci la memoria, riduci la dimensione del tassello o abilita il tiling più forte; se vedi cuciture, aumenta la sovrapposizione o prova un tassello più grande. Mantieni la tua selezione VAE allineata con il VAE video ufficiale LTX-2.5.
CreateVideo (#370)#
Muxa la sequenza di immagini e l'audio decodificato in un file video finale. Imposta fps per abbinare il tuo frame rate di generazione per evitare lo stiramento del tempo. Usalo come unico punto di rendering per output coerenti attraverso le iterazioni.
Extra opzionali#
- Per immagine a video, descrivi solo un chiaro movimento di camera e l'azione del soggetto; evita movimenti multipli e contrastanti.
- Per testo a video, mantieni i prompt concisi e aggiungi brevi frasi tra virgolette per audio simile a un discorso quando appropriato.
- Consigli di risoluzione: attieniti ai multipli di 32; le dimensioni comuni 16:9 includono 960x544 (veloce) e 1344x768 o 1504x832 (più nitido). Aumenta solo se hai margine di VRAM.
- Se i risultati ignorano il prompt, aumenta la guida nel blocco del campionatore o semplifica il linguaggio del prompt.
- Per la riproducibilità tra esecuzioni, imposta un seme fisso nel nodo del rumore; i semi casuali sono migliori per l'esplorazione.
- Se la VRAM è stretta, preferisci il livello Q di GGUF che puoi permetterti e mantieni l'upscaler abilitato; aggiunge dettagli a un costo di memoria minimo.
Link di riferimento: i modelli e le risorse ufficiali LTX-2.5 sono su Hugging Face, e il caricatore UNet GGUF proviene da ComfyUI-GGUF.
- Modelli e risorse LTX-2.5: Lightricks/LTX-2.5
- Caricatore GGUF: city96/ComfyUI-GGUF
Riconoscimenti#
Questo flusso di lavoro implementa e si basa sui seguenti lavori e risorse. Ringraziamo calorosamente Lightricks per LTX-2.5 e city96 per ComfyUI-GGUF per i loro contributi e la manutenzione. Per dettagli autorevoli, si prega di fare riferimento alla documentazione originale e ai repository collegati di seguito.
Risorse#
- Lightricks/LTX-2.5
- Hugging Face: Lightricks/LTX-2.5
- city96/ComfyUI-GGUF
- GitHub: city96/ComfyUI-GGUF
Nota: L'uso dei modelli, set di dati e codice di riferimento è soggetto alle rispettive licenze e condizioni fornite dai loro autori e manutentori.

