LTX 2.5 ComfyUI Bild zu Video mit Synchronisiertem Ton#
Dieser RunComfy-fähige LTX 2.5 ComfyUI-Workflow verwandelt einen einzelnen ersten Frame und eine Bewegungsaufforderung in ein kurzes filmisches Video mit kohärentem, im Modell integriertem Ton. Er wird von der Lightricks LTX-2.5 Familie angetrieben, die Pixel Diffusion, einen auf Gemma basierenden Prompt-Verstärker, Video- und Audio-VAEs sowie latentes Upscaling für scharfe Bewegungen und starke Prompt-Einhaltung kombiniert.
Verwenden Sie diesen LTX 2.5 ComfyUI-Graphen, um Porträts, atmosphärische Orte, Produkte, Tiere und Konzeptaufnahmen zu animieren, während Sie innerhalb von ComfyUI bleiben. Stellen Sie ein Startbild bereit, beschreiben Sie die Aktion und die Kamera, legen Sie Dauer und Bildrate fest und rendern Sie eine Aufnahme, die Charakter, Beleuchtung und Stil über die Frames hinweg beibehält.
Wichtige Modelle im ComfyUI LTX 2.5 ComfyUI-Workflow#
- Lightricks LTX-2.5 destillierter Transformator. Der Kernbild-zu-Video-Generator produziert zeitlich konsistente Bewegungen und fusioniert audio-visuelle Latents. Modellkarte: Lightricks/LTX-2.5.
- LTX-2.5 Video VAE. Dekodiert Video-Latents in Frames mit höherer Treue und weniger Schlieren bei schnellen Bewegungen. Gewichte: ltx-2.5-video-vae-bf16.safetensors.
- LTX-2.5 Audio VAE. Generiert synchronisierten Ton, um die visuelle Aktion und das Timing zu matchen. Gewichte: ltx-2.5-audio-vae-bf16.safetensors.
- Gemma 4 12B Text-Encoder mit LTX-Projektion. Interpretiert reichhaltige, mehrfache Entitäts-Prompts und Kamerarichtungen. Gewichte: gemma4-12b-with-proj-ltx-2.5-comfy-int8-convrot.safetensors.
- Gemma 4 E2B Instruct-Variante für Prompt-Enhancer. Erweitert kurze Prompts in filmische Richtungen bei geringem Rechenaufwand. Gewichte: gemma4_e2b_it_bf16.safetensors.
- LTX-2.5 Latent Spatial Upscaler x2. Schärft Details, indem es im latenten Raum vor der Dekodierung hochskaliert. Gewichte: ltx-2.5-latent-spatial-upscaler-x2-bf16-1.0.safetensors.
- Referenzimplementierung für Pipelines und Scheduler: LTX-2.5 Diffusers.
Wie man den ComfyUI LTX 2.5 ComfyUI-Workflow verwendet#
Dieser Workflow erweitert und konditioniert Ihren Prompt, konstruiert Video- und Audio-Latents, sampelt einen Low-Resolution-Pass, führt latentes Upscaling durch und dekodiert dann in Frames und synchronisierten Ton für das finale Muxing. Der Top-Level-Controller ist Image to Video (LTX-2.5) (#398), der Ihren ersten Frame, Text-Prompt und wichtige Einstellungen nimmt und dann in den Subgraphen leitet.
Bildvorverarbeitung#
Stellen Sie Ihr Startbild in Load First Frame (#395) bereit. Der Frame wird in LTXVPreprocess (#350) zu einer sauberen, modellfreundlichen Basis standardisiert. Verwenden Sie ResolutionSelector (#403), um das Seitenverhältnis und die Skalierung auszuwählen; es gibt Breite und Höhe aus, die auf modellfreundliche Vielfache abgestimmt sind. Gute erste Frames sind scharf, gut beleuchtet und für die Bewegung, die Sie beschreiben möchten, komponiert. Der Vorprozessor vermeidet zerstörerische Änderungen, während er das Bild für latentes Sampling vorbereitet.
Prompt-Enhancement#
Schreiben Sie Ihren Bewegungs- und Kameraprompt in Prompt (#376). Wenn Sie den integrierten Enhancer aktivieren, bereichert TextGenerateLTX2Prompt (#380) Ihren Text mit Details zu Aktionsschlägen, Kontinuität und Framing mithilfe eines Gemma-basierten Modells. Der Switcher ComfySwitchNode (#382) ermöglicht es Ihnen, entweder Ihren Rohtext oder die erweiterte Version zur Konditionierung zu leiten. Dieser Schritt verbessert die Prompt-Einhaltung für kurze Eingaben und hilft, Subjekte und Stil über die Frames hinweg beizubehalten. Sie können den erweiterten Text in PreviewAny (#381) vor dem Rendern anzeigen.
Modell#
Der Subgraph lädt den destillierten Generator in UNETLoader (#384) und die Decoder in VAELoader für Video (#385) und Audio (#386). Das latente Upscaler-Modell wird von LatentUpscaleModelLoader (#371) für einen sauberen x2-Detail-Pass später vorbereitet. Dieser Block stellt sicher, dass dieselbe Familie von LTX-2.5-Modellen über Kodierung, Sampling und Dekodierung hinweg verwendet wird, was die zeitliche Kohärenz bewahrt.
Prompt#
CLIPLoader (#387) und CLIPTextEncode positiv (#364) verwandeln Ihren beschreibenden Prompt in Konditionierung. Ein dedizierter negativer Encoder (#373) unterdrückt unerwünschte Eigenschaften wie niedrige Qualität oder Artefakte. LTXVConditioning (#365) kombiniert Textkonditionierung mit Ihrer gewählten Bildrate, sodass Timing-Anleitung in den audio-visuellen latenten Stream fließt. Eine klare Kamerasprache und Aktionssprache führt zu stabileren Bewegungen und mehr Bearbeitungsspielraum.
Videoeinstellungen#
Dauer, Breite, Höhe, Bildrate und Seed werden in der Gruppe Video Settings festgelegt (z.B. Duration (#362) und Frame Rate (#361)). Einfache Mathe-Helfer berechnen die Gesamtbildanzahl und speisen einheitliche Werte, wo nötig. Wählen Sie eine Bildrate, die dem gewünschten Gefühl entspricht; langsamere Aktionen können bei niedriger fps besser aussehen, während schnelle Bewegungen von höherer fps profitieren. Für reproduzierbare Aufnahmen fixieren Sie den Seed; variieren Sie ihn, um Alternativen zu erkunden.
Leeres Latent#
EmptyLTXVLatentVideo (#356) erstellt ein Video-Latent der richtigen Größe und Länge, während LTXVEmptyLatentAudio (#366) ein zeitlich abgestimmtes Audio-Latent konstruiert. Dies stellt sicher, dass Video- und Audiostreams von Anfang an das Timing teilen. Mit der Länge, die sich aus Dauer und Bildrate ergibt, erhält der Sampler korrekt geformte Tensoren. Das Ergebnis ist eine synchronisierte Basis für die gemeinsame audio-visuelle Rauschunterdrückung.
Low Resolution Generieren#
Ein erster Sampling-Pass baut kohärente Bewegungen bei einer handhabbaren Auflösung auf. LTXVDualCFGGuider (#388) wendet Dual-Modality-Leitlinien an, sodass sowohl Text als auch Timing die Video- und Audio-Latents zusammen formen. SamplerCustomAdvanced (#344) führt die Diffusionsschritte mit Ihrem gewählten Sampler und Zeitplan aus, gesät von RandomNoise (#339). Die erste Frame-Beschränkung wird von LTXVImgToVideoInplace (#357) durchgesetzt, das Identität, Beleuchtung und Komposition an Ihr bereitgestelltes Bild anheftet. Nach dem Sampling mischen LTXVConcatAVLatent und LTXVSeparateAVLatent Audio- und Video-Latents nach Bedarf für die nächsten Phasen.
Latentes Upscale#
LTXVLatentUpsampler (#348) führt ein x2-Latent-Space-Upscaling durch, um Texturen und Mikrodetails vor dem Dekodieren zu schärfen. LTXVImgToVideoInplace (#349) richtet das hochskalierte Latent mit dem Startframe neu aus, sodass Identität und Layout stabil bleiben. Dies im latenten Raum zu tun, bewahrt die zeitliche Glätte besser als Pixel-Space-Resizing. Diese Stufe trägt wesentlich zur endgültigen Schärfe bei.
High Resolution Generieren#
Ein Verfeinerungssampler (KSamplerSelect (#341) plus SamplerCustomAdvanced (#368)) läuft auf dem hochskalierten Latent mit einem kürzeren Zeitplan, stabilisiert Kanten und bereichert Details. LTXVDualCFGGuider (#391) hält die Anleitung konsistent mit Ihrem Text, während die im ersten Durchgang festgelegte Bewegung erhalten bleibt. Das kombinierte Latent wird dann von LTXVSeparateAVLatent (#369) zur Dekodierung aufgeteilt. VAEDecodeTiled (#374) verwandelt das Video-Latent in Frames und LTXVAudioVAEDecode (#358) erzeugt synchronisierten Ton.
Rendern und Speichern#
CreateVideo (#370) muxiert Frames und Ton bei Ihrer gewählten fps in einen einzigen Videostream. Zurück auf dem äußeren Graphen schreibt SaveVideo (#75) das Ergebnis in Ihren normalen ComfyUI-Ausgang. Sie können den Ton auch alleine über einen Vorschauknoten im Top-Level-Wrapper vor vollständigen Rendern anhören.
Wichtige Knoten im ComfyUI LTX 2.5 ComfyUI-Workflow#
Image to Video (LTX-2.5) (#398)#
Dies ist der All-in-One-Controller für die gesamte Pipeline. Stellen Sie den ersten Frame, Ihren Prompt, Dauer, Auflösung, Bildrate und ob die Prompt-Verbesserung aktiviert werden soll, bereit. Verwenden Sie es, um schnell zu iterieren; wenn Sie bereit sind, feinabzustimmen, klicken Sie auf Enter subgraph, um Sampler, Leitlinien und Dekodierung anzupassen. Wenn Sie nur Text-Video benötigen, öffnen Sie den Subgraphen und schalten Sie den internen Text-zu-Video-Bypass auf den Bild-zu-Video-Knoten um.
LTXVDualCFGGuider (#388)#
Wendet classifier-free guidance über das gemeinsame audio-visuelle Latent an, balanciert die Einhaltung des Prompts mit der zeitlichen Stabilität. Erhöhen Sie die Anleitung für stärkere Prompt-Befolgung und dynamischere Bewegungen; verringern Sie sie, um Flackern zu reduzieren oder um mehr von den Nuancen des Ausgangsframes zu bewahren. Halten Sie die Video- und Audioleitung im gleichen Bereich, damit der Soundtrack mit der Bildschirmaktion abgestimmt bleibt.
SamplerCustomAdvanced (#344)#
Treibtdie Diffusion mit Ihrem gewählten Sampler und einem benutzerdefinierten Sigma-Zeitplan. Verwenden Sie diesen Knoten, um Bewegungsqualität vs. Stabilität zu erkunden, indem Sie Sampler-Varianten wechseln oder Zeitpläne bearbeiten. Paaren Sie es mit einem festen Seed, um Einstellungen vergleichbar zu machen, dann randomisieren Sie den Seed, um nach der besten Aufnahme zu suchen.
LTXVLatentUpsampler (#348)#
Skaliert im latenten Raum mit dem dedizierten LTX-2.5 x2 Modell hoch, verbessert Details, ohne zeitliche Wackel zu verursachen. Wenn Sie starkes Zuschneiden oder enge Nahaufnahmen planen, halten Sie dies aktiviert, damit kleine Merkmale das Dekodieren überleben. Bei extremen VRAM-Grenzen können Sie das Upscaling auf Kosten einiger Schärfe umgehen.
VAEDecodeTiled (#374)#
Dekodiert hochauflösende Video-Latents in Frames unter Verwendung von Tiling zur Kontrolle des Speicherverbrauchs. Bei niedrigem VRAM bevorzugen Sie kleinere Tiles, um Speicherfehler zu vermeiden. Bei höherem VRAM können größere Tiles Nähte reduzieren und das Dekodieren beschleunigen.
CreateVideo (#370)#
Kombiniert die dekodierten Frames mit dem generierten Ton in einen einzigen Videostream bei Ihrer gewählten Bildrate. Passen Sie die fps hier an, um das kreative Ziel zu erreichen oder um Plattformanforderungen zu erfüllen. Der gemuxte Ausgang wird dann an den Speicher im äußeren Graphen übergeben.
Optionale Extras#
- Halten Sie Prompts knapp, aber konkret: wer/was, Aktion, Kamerabewegung, Beleuchtung, Stimmung. Lassen Sie den Prompt-Enhancer filmische Formulierungen hinzufügen.
- Vermeiden Sie widersprüchliche Kamerarichtungen. Eine starke Bewegung (Push-in, Schwenk, Dolly) tendiert dazu, stabilere Ergebnisse zu erzeugen als das Stapeln mehrerer.
- Verwenden Sie saubere, kontrastreiche erste Frames für Porträts und Produktaufnahmen; das Modell wird besser Identität und Kanten bewahren.
- Beginnen Sie mit moderaten Dauern, um Bewegung und Framing zu justieren; verlängern Sie erst, nachdem Ihnen das Verhalten gefällt.
- Wenn Ausgaben weich aussehen, verifizieren Sie, dass Breite und Höhe Vielfache von 32 sind und halten Sie den latenten Upscaler aktiviert.
- Für konsistente Iterationen fixieren Sie den Seed. Beim Erkunden von Alternativen variieren Sie den Seed, während Sie andere Einstellungen beibehalten.
Danksagungen#
Dieser Workflow implementiert und baut auf den folgenden Arbeiten und Ressourcen auf. Wir danken Comfy Org für die LTX-2.5: Image to Video ComfyUI-Workflow-Vorlage, Lightricks für die LTX-2.5 Modellgewichte, Lightricks für das LTX-2.5 Diffusers-Projekt und Lightricks für die Hugging Face-Organisationsressourcen für ihre Beiträge und Wartung. Für autoritative Details verweisen Sie bitte auf die Originaldokumentation und Repositories, die unten verlinkt sind.
Ressourcen#
- Comfy.org/Source Workflow-Vorlage
- GitHub: Comfy-Org
- Docs / Release Notes: Source Workflow-Vorlage
- Lightricks/LTX-2.5 Modellgewichte
- GitHub: Lightricks/LTX-2
- Hugging Face: Lightricks/LTX-2.5
- arXiv: 2601.03233
- Lightricks/LTX-2.5 Diffusers-Projekt
- Hugging Face: Lightricks/LTX-2.5-Diffusers
- arXiv: 2601.03233
- Lightricks/Hugging Face Organisation
- GitHub: Lightricks
- Hugging Face: Lightricks
Hinweis: Die Nutzung der referenzierten Modelle, Datensätze und Codes unterliegt den jeweiligen Lizenzen und Bedingungen der Autoren und Betreuer.

