LTX 2.5 Erste Letzte Bild zu Video: zweibildverankerte, filmische Clips mit synchronisiertem Audio#
Dieser RunComfy-fähige Workflow verwandelt ein abgestimmtes Start- und Endbild in ein kurzes filmisches Video mit synchronisiertem Audio. Durch die Führung der Erstellung von Ihren ersten und letzten Bildankern bewahrt er Komposition, Beleuchtung, Subjektidentität und Stil, während er kohärente Bewegungen zwischen den beiden erzeugt. LTX 2.5 Erste Letzte Bild zu Video ist ideal für kontrollierte Charakteraktionen, Produktbeats, Kamerabewegungen und Szenenübergänge innerhalb von ComfyUI.
Unter der Haube kombiniert es Lightricks’ LTX-2.5-Transformer mit dedizierten Video- und Audio-VAEs sowie einem Gemma-basierten Eingabeaufforderungs-Enhancer. Der Graph wird mit klaren Gruppen für Eingabeaufforderung, Videoeinstellungen, Erste/Letzte Bildvorbereitung, Konditionierung, Sampling und Dekodierung geliefert, sodass Sie zuverlässige, wiederholbare Ergebnisse erzielen können, ohne die Low-Level-Verkabelung zu berühren.
Schlüsselmodelle im Comfyui LTX 2.5 Erste Letzte Bild zu Video Workflow#
- Lightricks LTX-2.5 destillierter Transformer. Der Kern-Videogenerator, der Bewegung, Erscheinung und zeitliche Konsistenz aus Text- und visuellen Leitfäden lernt. Model page
- LTX-2.5 Video VAE. Komprimiert und dekodiert Videolatents für scharfe Bilder bei gleichzeitig praktischem Speicherverbrauch. Inklusive im LTX-2.5-Repository. Model page
- LTX-2.5 Audio VAE. Erzeugt und rekonstruiert synchronisierte Audio-Latents, um visuelle Ereignisse zu begleiten. Inklusive im LTX-2.5-Repository. Model page
- Gemma 4 12B Text-Encoder mit Projektion für LTX-2.5. Kodiert Ihre Eingabeaufforderung in reichhaltige Konditionierung, die Themen, Aktionen, Beleuchtung und Kamerarichtung abdeckt. In LTX-2.5-Assets enthalten. Model page
- Gemma 4 E2B instruktionstuning-Variante für Eingabeaufforderungs-Enhancement. Erweitert kurze Eingaben in filmische Richtungen, wenn Enhancement aktiviert ist. Model page
- Optionale Diffusers-Referenz für LTX-2.5-Pipelines und Zeitplanverhalten. Nützlich zum Verständnis von Samplerkompromissen. Project page
So verwenden Sie den Comfyui LTX 2.5 Erste Letzte Bild zu Video Workflow#
Der Workflow nimmt zwei Bilder als Anker, verwandelt sie in Leitlinien, dann entrauscht Video- und Audio-Latents unter Textkontrolle, bevor er zu einem teilbaren Clip dekodiert wird. Jede Gruppe unten spielt eine spezifische Rolle; die meisten Benutzer werden nur Eingabeaufforderung, Eingabeaufforderungs-Enhancement und Videoeinstellungen berühren.
Eingabeaufforderung#
Schreiben Sie eine prägnante, aber beschreibende Anweisung im Prompt (#252) Knoten. Der positive Text wird von CLIPTextEncode (#222) unter Verwendung des Gemma 4 12B Encoders kodiert, sodass das Modell Themen, Aktionen, Beleuchtung und Kameraziel versteht. Beschreiben Sie sowohl den Endzustand als auch den Eröffnungstakt, um dem Modell zu helfen, beide Anker zu respektieren. Wenn Sie strikte Formulierungen oder Markenbegriffe benötigen, schreiben Sie diese explizit in die Eingabeaufforderung.
Eingabeaufforderungs-Enhancement#
Kurze Eingabeaufforderungen können mit TextGenerateLTX2Prompt (#247) automatisch erweitert werden. Der ComfySwitchNode (#248) leitet entweder Ihre rohe Eingabeaufforderung oder den erweiterten Text an den Encoder weiter, und PreviewAny (#249) ermöglicht es Ihnen, den finalen Text zu inspizieren. Aktivieren Sie Enhancement, wenn Sie filmische Formulierungen und reichhaltigere Bewegungshinweise wünschen; deaktivieren Sie es, wenn die Formulierung der Eingabeaufforderung exakt bleiben muss.
Videoeinstellungen#
Legen Sie Clip-Länge, Bildrate und Auflösung mit Duration (#198), Frame Rate(int) (#205), Width (#215) und height (#216) fest. Der Graph berechnet die Gesamtbildanzahl über ComfyMathExpression (#226) und weist Videolatents in EmptyLTXVLatentVideo (#201) und Audiolatents in LTXVEmptyLatentAudio (#197) zu. Höhere Auflösung oder Bildrate erhöht VRAM und Zeit; beginnen Sie bescheiden, dann skalieren Sie, sobald Ihnen die Bewegung gefällt.
Erstes Bild#
Laden Sie Ihr Startbild, das in ResizeImageMaskNode (#213) auf die Zielauflösung skaliert wird. LTXVPreprocess (#199) normalisiert Ton und Detail für stabile Führung. Saubere, gut belichtete und kompositionell klare Bilder lassen das Modell schneller anvisieren und reduzieren unbeabsichtigtes Abweichen vom Anker.
Letztes Bild#
Laden Sie Ihr Endbild; es wird in ResizeImageMaskNode (#214) skaliert und in LTXVPreprocess (#195) normalisiert. Streben Sie nach passendem Seitenverhältnis, Perspektive und Subjektskala relativ zum ersten Bild, damit der Übergang physisch plausibel wirkt und der Anker am Ende erhalten bleibt.
Konditionierung#
Textkonditionierung wird in LTXVConditioning (#202) zusammengesetzt, das auch die Zielbildrate erhält, sodass das Timing über die Zweige hinweg ausgerichtet ist. Bildführung wird in zwei Durchgängen mit LTXVAddGuide (#206) für das erste Bild und LTXVAddGuide (#204) für das letzte Bild angehängt, um sicherzustellen, dass beide Anker die Trajektorie beeinflussen. LTXVCropGuides (#200) gleicht eventuelle Restgrößenunterschiede aus, sodass die Führung perfekt mit der latenten Leinwand übereinstimmt.
Sampling#
Rauschen wird in RandomNoise (#196) gesät, und das Denoising wird von SamplerCustomAdvanced (#211) mit SamplerEulerAncestral (#208) und einem ManualSigmas (#239) Zeitplan für klare, bewegungsstabile Updates gesteuert. Die Führung kommt von LTXVDualCFGGuider (#235), das von dem UNETLoader (#230) angetrieben wird und positive und negative Bedingungen mischt, um Aussehen und Bewegung zu steuern. Audio- und Videolatents werden mit LTXVConcatAVLatent (#210) verbunden und später mit LTXVSeparateAVLatent (#221) getrennt, sodass Bewegung und Klang zusammen entstehen.
Dekodierung und Ausgabe#
Latents werden mit VAEDecodeTiled (#219) unter Verwendung des Video-VAE in Bilder dekodiert und mit LTXVAudioVAEDecode (#220) unter Verwendung des Audio-VAE in Audio dekodiert. CreateVideo (#218) mischt Bilder und Audio bei Ihrer gewählten FPS, um einen finalen Clip zu erzeugen. Im oberen Graphen schreibt SaveVideo (#68) das Ergebnis; benennen Sie es um oder ändern Sie den Speicherort dort, wenn gewünscht.
Schlüsselnoten im Comfyui LTX 2.5 Erste Letzte Bild zu Video Workflow#
TextGenerateLTX2Prompt (#247)#
Erweitert kurze Eingaben in eine filmische, LTX-freundliche Eingabeaufforderung. Verwenden Sie es, wenn Sie reichhaltigere Verben, Beleuchtung und Kamerasprache mit minimalem Aufwand wünschen. Wenn Sie exakte Formulierungen oder markengeeignete Formulierungen benötigen, deaktivieren Sie das Enhancement über ComfySwitchNode (#248) und liefern Sie den finalen Text selbst.
LTXVDualCFGGuider (#235)#
Kombiniert das LTX-2.5-Modell mit positiver und negativer Konditionierung, um die Balance zwischen Adhärenz und Freiheit zu wahren. Erhöhen Sie die Führung für stärkere Eingabeaufforderungs- und Anker-Treue; reduzieren Sie sie für lockerere, organischere Bewegungen. Extrem hohe Führung kann Bewegung übermäßig einschränken oder Sättigung einführen, also stimmen Sie sie im Einklang mit Ihrer negativen Eingabeaufforderungsstärke ab.
SamplerCustomAdvanced (#211)#
Führt die Denoising-Schleife mit SamplerEulerAncestral (#208) und dem gewählten Sigma-Zeitplan aus. Verwenden Sie kürzere Zeitpläne für Geschwindigkeitstests und längere, wenn Sie mehr Detailerhaltung über die Bewegung hinweg benötigen. Wenn die Bewegung ruckartig aussieht, versuchen Sie eine glattere Sigma-Rampe oder leicht niedrigere Führung, um Überkorrekturen zwischen den Schritten zu reduzieren.
ManualSigmas (#239)#
Definiert den Rauschzeitplan, der Schärfe gegen zeitliche Glätte eintauscht. Vorbeladenes Rauschen kann größere Bewegungen früh fördern, während ein sanfterer Schwanz Details nahe dem Endanker bewahren kann. Passen Sie nur an, nachdem Sie mit der Eingabeaufforderung und den Ankern zufrieden sind.
VAEDecodeTiled (#219)#
Dekodiert Videolatents zu Bildern unter Verwendung von gekachelter Verarbeitung, um größere Auflösungen in den Speicher zu passen. Kleinere Kacheln reduzieren VRAM, können aber Kachelnaht-Risiken darstellen; größere Kacheln sind sauberer, aber schwerer. Halten Sie Auflösung und Kachelgröße im Gleichgewicht für Ihre GPU.
LTXVAudioVAEDecode (#220)#
Rekonstruiert die synchronisierte Audiospur aus Audiolatents. Um einen stummen Clip zu exportieren, deaktivieren Sie vorübergehend den Audiopfad im Subgraphen vor CreateVideo (#218). Wenn der endgültige Klang zu beschäftigt wirkt, reduzieren Sie die Aktionsdichte in der Eingabeaufforderung, sodass das Audiomodell einem einfacheren Beat folgt.
RandomNoise (#196)#
Sät die Erstellung. Für reproduzierbare Ergebnisse öffnen Sie den Subgraphen und setzen einen festen Seed anstelle von Zufälligkeit. Wenn Sie Bewegungsoptionen von den gleichen Ankern und der gleichen Eingabeaufforderung erforschen, variieren Sie den Seed, um verschiedene Trajektorien zu probieren.
Optionale Extras#
- Für die saubersten Übergänge halten Sie erste und letzte Bilder im Seitenverhältnis, Horizont und Subjektskala ausgerichtet; Diskrepanzen zwingen das Modell, Geometrie zu verzerren.
- Beschreiben Sie die Bewegung explizit: "beginnt nach links blickend, dreht sich zur Kamera, Hand öffnet sich, blauer Kristall erhebt sich über der Handfläche" liest sich besser als eine nur stilistische Eingabeaufforderung.
- Dauer und FPS interagieren; die Erhöhung beider erhöht Speicher und Renderzeit. Dehnen Sie jeweils einen aus und Vorschau, bevor Sie skalieren.
- Wenn Kanten flimmern, reduzieren Sie feine Textur-Adjektive in der Eingabeaufforderung oder senken Sie die Führung leicht, um zeitliche Stabilität zu begünstigen.
- Um Iterationen zu beschleunigen, testen Sie in kleinerer Auflösung, dann erhöhen Sie Breite und Höhe, sobald die Bewegung und das Framing festgelegt sind.
- Wenn Sie markenperfekte Endbilder benötigen, betonen Sie sie in der Eingabeaufforderung und halten Sie das letzte Bild sauber und kontrastreich, damit LTX 2.5 Erste Letzte Bild zu Video zuverlässig anvisieren kann.
Danksagungen#
Dieser Workflow implementiert und baut auf den folgenden Arbeiten und Ressourcen auf. Wir danken Comfy.org für die Source-Workflow-Vorlage, Lightricks für die LTX-2.5-Modellgewichte und Lightricks für das LTX-2.5-Diffusers-Projekt für ihre Beiträge und Wartung. Für autoritative Details verweisen wir auf die Originaldokumentation und Repositories, die unten verlinkt sind.
Ressourcen#
- Comfy.org/Source Workflow-Vorlage
- Docs / Release Notes: Source Workflow Template
- Lightricks/LTX-2.5
- Hugging Face: Lightricks/LTX-2.5
- Lightricks/LTX-2.5-Diffusers
- Hugging Face: Lightricks/LTX-2.5-Diffusers
- Lightricks/Hugging Face Organisation
- Hugging Face: Lightricks
Hinweis: Die Nutzung der referenzierten Modelle, Datensätze und Codes unterliegt den jeweiligen Lizenzen und Bedingungen, die von ihren Autoren und Wartungspersonal bereitgestellt werden.

