LTX 2.5 First Last Frame to Video: clip cinematografiche ancorate a due fotogrammi con audio sincronizzato#
Questo flusso di lavoro pronto per RunComfy trasforma un'immagine iniziale e finale abbinata in un breve video cinematografico con audio sincronizzato. Guidando la generazione dai tuoi ancoraggi di primo e ultimo fotogramma, preserva composizione, illuminazione, identità del soggetto e stile creando un movimento coerente tra i due. LTX 2.5 First Last Frame to Video è ideale per azioni di personaggi controllate, ritmi di prodotto, movimenti di telecamera e transizioni di scena all'interno di ComfyUI.
Sotto il cofano, abbina il trasformatore LTX-2.5 di Lightricks con VAE video e audio dedicati più un potenziatore di prompt basato su Gemma. Il grafico viene fornito con gruppi chiari per Prompt, Impostazioni Video, Preparazione Primo/Ultimo Fotogramma, Condizionamento, Campionamento e Decodifica in modo da ottenere risultati affidabili e ripetibili senza toccare il cablaggio di basso livello.
Modelli chiave nel flusso di lavoro Comfyui LTX 2.5 First Last Frame to Video#
- Trasformatore distillato Lightricks LTX-2.5. Il generatore video principale che apprende movimento, aspetto e coerenza temporale da guide testuali e visive. Pagina del modello
- LTX-2.5 Video VAE. Comprimi e decodifica latenze video per fotogrammi nitidi mantenendo l'uso della memoria pratico. Incluso nel repository LTX-2.5. Pagina del modello
- LTX-2.5 Audio VAE. Genera e ricostruisce latenze audio sincronizzate per abbinare eventi visivi. Incluso nel repository LTX-2.5. Pagina del modello
- Gemma 4 12B codificatore di testo con proiezione per LTX-2.5. Codifica il tuo prompt in un condizionamento ricco che copre soggetti, azioni, illuminazione e direzione della telecamera. Incluso negli asset LTX-2.5. Pagina del modello
- Variante istruita Gemma 4 E2B per potenziamento del prompt. Espande input brevi in direzioni cinematografiche quando il potenziamento è abilitato. Pagina del modello
- Riferimento opzionale Diffusers per pipeline e comportamento di pianificazione LTX-2.5. Utile per comprendere compromessi del campionatore. Pagina del progetto
Come usare il flusso di lavoro Comfyui LTX 2.5 First Last Frame to Video#
Il flusso di lavoro prende due immagini come ancoraggi, le trasforma in guide, quindi denoisa latenze video e audio sotto controllo testuale prima di decodificare in una clip pronta per la condivisione. Ogni gruppo sottostante svolge un ruolo specifico; la maggior parte degli utenti toccherà solo Prompt, Potenziamento del Prompt e Impostazioni Video.
Prompt#
Scrivi un'istruzione concisa ma descrittiva nel nodo Prompt (#252). Il testo positivo è codificato da CLIPTextEncode (#222) utilizzando il codificatore Gemma 4 12B in modo che il modello comprenda soggetti, azioni, illuminazione e intento della telecamera. Mantieni descritto lo stato finale così come il ritmo di apertura per aiutare il modello a rispettare entrambi gli ancoraggi. Se hai bisogno di una formulazione rigorosa o termini di marca, scrivili esplicitamente nel prompt.
Potenziamento del Prompt#
I prompt brevi possono essere espansi automaticamente con TextGenerateLTX2Prompt (#247). Il ComfySwitchNode (#248) instrada il tuo prompt grezzo o il testo potenziato al codificatore, e PreviewAny (#249) ti consente di ispezionare il testo finale. Abilita il potenziamento quando vuoi una formulazione cinematografica e indizi di movimento più ricchi; disabilitalo quando la formulazione del prompt deve rimanere esatta.
Impostazioni Video#
Imposta la lunghezza della clip, il frame rate e la risoluzione con Duration (#198), Frame Rate(int) (#205), Width (#215) e height (#216). Il grafico calcola il conteggio totale dei fotogrammi tramite ComfyMathExpression (#226) e alloca latenze video in EmptyLTXVLatentVideo (#201) e latenze audio in LTXVEmptyLatentAudio (#197). Una risoluzione o un frame rate più alti aumentano VRAM e tempo; inizia con modestia, poi scala una volta che ti piace il movimento.
Primo Fotogramma#
Carica la tua immagine iniziale, che viene ridimensionata in ResizeImageMaskNode (#213) per adattarsi alla risoluzione target. LTXVPreprocess (#199) normalizza tono e dettaglio per una guida stabile. Immagini pulite, ben esposte e chiaramente composte fanno sì che il modello si blocchi più velocemente e riducano la deriva involontaria dall'ancoraggio.
Ultimo Fotogramma#
Carica la tua immagine finale; viene ridimensionata in ResizeImageMaskNode (#214) e normalizzata in LTXVPreprocess (#195). Punta a un rapporto d'aspetto, prospettiva e scala del soggetto corrispondenti rispetto al primo fotogramma in modo che la transizione sembri fisicamente plausibile e l'ancoraggio sia preservato alla fine.
Condizionamento#
Il condizionamento testuale è composto in LTXVConditioning (#202), che riceve anche il frame rate target in modo che il tempismo si allinei tra i rami. La guida delle immagini è attaccata in due passaggi con LTXVAddGuide (#206) per il primo fotogramma e LTXVAddGuide (#204) per l'ultimo fotogramma, assicurando che entrambi gli ancoraggi influenzino la traiettoria. LTXVCropGuides (#200) riconcilia eventuali differenze di dimensioni residue in modo che le guide si allineino perfettamente con la tela latente.
Campionamento#
Il rumore è seminato in RandomNoise (#196), e la denoising è guidata da SamplerCustomAdvanced (#211) con SamplerEulerAncestral (#208) e un programma ManualSigmas (#239) per aggiornamenti nitidi e stabili nel movimento. La guida proviene da LTXVDualCFGGuider (#235) alimentata dal UNETLoader (#230), fondendo condizioni positive e negative per orientare aspetto e movimento. Le latenze audio e video sono concatenate e successivamente separate con LTXVConcatAVLatent (#210) e LTXVSeparateAVLatent (#221) in modo che movimento e suono evolvano insieme.
Decodifica e output#
Le latenze sono decodificate in fotogrammi con VAEDecodeTiled (#219) utilizzando il VAE video e in audio con LTXVAudioVAEDecode (#220) utilizzando il VAE audio. CreateVideo (#218) muxa immagini e audio al tuo FPS scelto per produrre una clip finale. Indietro nel grafico principale, SaveVideo (#68) scrive il risultato; rinomina o cambia posizione lì se desiderato.
Nodi chiave nel flusso di lavoro Comfyui LTX 2.5 First Last Frame to Video#
TextGenerateLTX2Prompt (#247)#
Espande input brevi in un prompt cinematografico, compatibile con LTX. Usalo quando vuoi verbi più ricchi, illuminazione e linguaggio della telecamera con il minimo sforzo. Se hai bisogno di una formulazione esatta o di una formulazione sicura per il marchio, disattiva il potenziamento tramite ComfySwitchNode (#248) e fornisci tu stesso il testo finale.
LTXVDualCFGGuider (#235)#
Combina il modello LTX-2.5 con condizionamento positivo e negativo per bilanciare aderenza e libertà. Aumenta la guida per una maggiore fedeltà al prompt e all'ancoraggio; abbassala per un movimento più organico e libero. Una guida estremamente alta può sovracostringere il movimento o introdurre saturazione, quindi regola in tandem con la forza del tuo prompt negativo.
SamplerCustomAdvanced (#211)#
Esegue il ciclo di denoising utilizzando SamplerEulerAncestral (#208) e il programma sigma scelto. Utilizza programmi più brevi per test di velocità e più lunghi quando hai bisogno di maggiore ritenzione dei dettagli attraverso il movimento. Se il movimento sembra tremolante, prova una rampa sigma più fluida o abbassa leggermente la guida per ridurre l'overcorrection tra i passaggi.
ManualSigmas (#239)#
Definisce il programma del rumore che scambia nitidezza contro fluidità temporale. Il rumore frontale può incoraggiare movimenti più grandi all'inizio, mentre una coda più dolce può preservare i dettagli vicino all'ancoraggio finale. Regola solo dopo che sei soddisfatto del prompt e degli ancoraggi.
VAEDecodeTiled (#219)#
Decodifica latenze video in immagini utilizzando l'elaborazione a piastrelle per adattare risoluzioni più grandi nella memoria. Piastrelle più piccole riducono VRAM ma possono rischiare cuciture di piastrelle; piastrelle più grandi sono più pulite ma più pesanti. Mantieni la risoluzione e la dimensione delle piastrelle in equilibrio per la tua GPU.
LTXVAudioVAEDecode (#220)#
Ricostruisce la traccia audio sincronizzata dalle latenze audio. Per esportare una clip silenziosa, disabilita temporaneamente il ramo audio all'interno del sottografo prima di CreateVideo (#218). Se il suono finale sembra troppo occupato, riduci la densità delle azioni nel prompt in modo che il modello audio segua un ritmo più semplice.
RandomNoise (#196)#
Semina la generazione. Per risultati riproducibili, apri il sottografo e imposta un seme fisso invece di randomizzare. Quando esplori opzioni di movimento dagli stessi ancoraggi e prompt, varia il seme per campionare diverse traiettorie.
Extra opzionali#
- Per le transizioni più pulite, mantieni primo e ultimo fotogramma allineati nel rapporto d'aspetto, orizzonte e scala del soggetto; disallineamenti costringono il modello a distorcere la geometria.
- Descrivi il movimento in modo esplicito: “inizia girato a sinistra, si gira verso la telecamera, la mano si apre, il cristallo blu sale sopra il palmo” è meglio di un prompt solo stilistico.
- Durata e FPS interagiscono; aumentare entrambi aumenta memoria e tempo di rendering. Allunga uno alla volta e visualizza in anteprima prima di aumentare.
- Se i bordi scintillano, riduci gli aggettivi di texture fine nel prompt o abbassa leggermente la guida per favorire la stabilità temporale.
- Per velocizzare l'iterazione, prova a una risoluzione più piccola, poi aumenta larghezza e altezza una volta che il movimento e l'inquadratura sono bloccati.
- Quando hai bisogno di fotogrammi finali perfetti per il marchio, enfatizzali nel prompt e mantieni l'ultimo fotogramma pulito e ad alto contrasto in modo che LTX 2.5 First Last Frame to Video possa bloccarsi in modo affidabile.
Riconoscimenti#
Questo flusso di lavoro implementa e si basa sui seguenti lavori e risorse. Ringraziamo Comfy.org per il modello di flusso di lavoro Source, Lightricks per i pesi del modello LTX-2.5 e Lightricks per il progetto LTX-2.5 Diffusers per i loro contributi e manutenzione. Per dettagli autorevoli, si prega di fare riferimento alla documentazione originale e ai repository collegati di seguito.
Risorse#
- Modello di flusso di lavoro Comfy.org/Source
- Documenti / Note di rilascio: Modello di flusso di lavoro Source
- Lightricks/LTX-2.5
- Hugging Face: Lightricks/LTX-2.5
- Lightricks/LTX-2.5-Diffusers
- Hugging Face: Lightricks/LTX-2.5-Diffusers
- Lightricks/Organizzazione Hugging Face
- Hugging Face: Lightricks
Nota: L'uso dei modelli, dei set di dati e del codice di riferimento è soggetto alle rispettive licenze e condizioni fornite dai loro autori e manutentori.


