LTX 2.3 Nahaufnahmen: Porträtbild-zu-Video mit nativem Audio#
LTX 2.3 Nahaufnahmen ist ein RunComfy-bereiter ComfyUI-Workflow, der ein einzelnes Porträt in einen kinoreifen, nach vorne gerichteten Clip mit gemeinsam generiertem nativem Audio verwandelt. "Nahaufnahmen" beschreibt das Framing-Ziel und den Prompt-Stil, nicht eine separate LTX-Modellvariante oder LoRA. Der Graph läuft den destillierten LTX 2.3 v1.1 GGUF-Pfad mit keinem aktiven Detailer LoRA, nutzt eine zweistufige latente Pipeline und einen x2 räumlichen Upscaler, um stabile Identität, natürliche Lippen-Synchronisation und scharfes Nahframing zu liefern.
Entworfen für Mode-Porträts, Dialoge, Interviews und polierte soziale Clips, betont dieser ComfyUI-Aufbau enge Komposition und kohärente Audio-Video-Bewegung. Mit LTX 2.3 Nahaufnahmen liefern Sie ein Standbild und eine prägnante Szenenbeschreibung; der Workflow übernimmt Bewegung, Timing und Stimme, um eine teilfertige MP4 zu erstellen.
Wichtige Modelle im ComfyUI LTX 2.3 Nahaufnahmen-Workflow#
- LTX-2.3 22B Destilliert 1.1 (Nur Transformer). Der Kern-Video-Audio-Generator, destilliert für schnellere Inferenz und geringeren Speicherverbrauch bei gleichzeitiger Erhaltung der Qualität. Quelle: Lightricks/LTX-2.3.
- LTX-2.3 x2 Räumlicher Upscaler 1.1. Ein nativer latenter Upscaler, der Details schärft und die Bewegungsstabilität während des zweiten Durchgangs verbessert. Verpackt in der LTX 2.3 Version: Lightricks/LTX-2.3.
- LTX-2.3 Video VAE (bf16) und LTX-2.3 Audio VAE (bf16). Decoder, die Video- und Audio-Latenten in Bilder und Wellenformen umwandeln und dabei die Synchronisation straff halten. Kuratierte Gewichte: Kijai/LTX2.3_comfy.
- Quantisierte GGUF-Gewichte für LTX 2.3 22B 1.1. Speicheroptimierter UNet/Transformer und Text-Stack, optimiert für CPU-Auslagerung oder Low-VRAM-GPUs. Distribution: QuantStack/LTX-2.3-GGUF.
- Gemma 3 12B Instruct Text-Encoder mit LTX-Textprojektion. Bietet robustes Verständnis von Prompts und Timing-Tokens für beide Modalitäten, verdrahtet in ComfyUI’s CLIP-Schnittstelle. Enthalten über das GGUF-Paket: QuantStack/LTX-2.3-GGUF.
- Optionales kleines VAE für schnelle Vorschauen. Nützlich für Sampler-Vorschauen während der Iteration: madebyollin/taehv.
So verwenden Sie den ComfyUI LTX 2.3 Nahaufnahmen-Workflow#
Dieser Workflow läuft in zwei koordinierten Stufen. Der erste Durchgang etabliert Nahbewegungen und natives Audio in einer Basisgröße. Der zweite Durchgang skaliert räumlich hoch und verfeinert Identität und Lippen-Synchronisation, dekodiert dann und multiplexiert Video mit Audio.
- MODELS Lädt das destillierte LTX 2.3 22B 1.1 Modell in GGUF, den auf Gemma 3 basierenden Text-Stack und die LTX-Video- und Audio-VAEs. Es aktiviert auch Sequenz-Parallel- und Vorschau-Helfer für reibungslosere Iterationen. Kein Detailer LoRA ist standardmäßig aktiv, was den LTX 2.3 Nahaufnahmen-Look sauber und konsistent hält.
- Videoeinstellungen Stellen Sie hier Ihre Zielbreite, -höhe, Bildrate und Clip-Länge ein. Der Graph erzwingt intern gültige Abmessungen, aber die Wahl produktionsfreundlicher Werte führt zu stabileren Ergebnissen und flüssigerer Wiedergabe. Wenn Sie planen, schnell zu iterieren, beginnen Sie bescheiden und skalieren im zweiten Durchgang hoch.
- T2V — Text-zu-Video-Modus Wenn Sie nur aus Text generieren möchten, schalten Sie den bereitgestellten Text-zu-Video-Schalter um. Für LTX 2.3 Nahaufnahmen ist der Standardpfad Bild-zu-Video, der Identität und Framing an Ihrem Porträt verankert hält.
- Eingabebild Liefern Sie ein sauberes Porträtbild mit unbehinderter Sicht auf das Gesicht. Der Workflow verarbeitet und skaliert das Bild vor, verwendet dann
LTXVImgToVideoInplace(#161), um Identität und Linsengeometrie zu verankern. Halten Sie Hintergrundstörungen minimal und lassen Sie etwas Freiraum, damit sich das langsame Hereinzoomen natürlich anfühlt. - Prompt Verwenden Sie einen prägnanten positiven Prompt, um den Shot über die Zeit zu beschreiben, einschließlich Lesezeilen, Atemzügen, Mikrogesten und hörbaren Ereignissen. Halten Sie den negativen Prompt auf die Entfernung von Artefakten fokussiert, anstatt den Stil zu polizieren. Wiederholen Sie keine Details, die bereits im Referenzbild sichtbar sind, da dies die Treue und Stabilität verringern kann.
- Bereiten Sie LTX Latent vor Der Graph erstellt leere Video- und Audio-Latenten, die zu Ihren Einstellungen passen, fügt sie zu einem einzigen AV-Latenten zusammen und fügt Ihre positive und negative Konditionierung mit der gewählten Bildrate hinzu. Dies hält Timing, Bewegung und Audio von Anfang an im Gleichschritt.
- Sampler — Erster Durchgang Der erste Durchgang verwendet
CFGGuider(#129) mit einem geschwindigkeitsoptimierten Sampler, um einen kohärenten Low-Res-AV-Latenten zu erzeugen. Diese Phase fixiert das Nahkamera-Verhalten, die Sprechkadenz und die grundlegende Lippen-Synchronisation. Denken Sie daran als den narrativen Durchgang, der festlegt, was passiert. - Sampler — Zweiter Durchgang Upscale Der AV-Latent wird geteilt und der Videopfad wird x2 mit
LTXVLatentUpsampler(#118) hochskaliert. Die Identität wird mitLTXVImgToVideoInplace(#160) neu projiziert, um das Gesicht bei höherer Größe stabil zu halten, dann werden Audio und Video wieder zusammengefügt und mit einem auf Treue fokussierten Sampler verfeinert. Dieser Durchgang verbessert Details, reduziert Flackern und poliert den LTX 2.3 Nahaufnahmen-Look. - Dekodieren Videobilder werden mit einem gekachelten VAE für Speicher-Effizienz dekodiert, Audio wird über das Audio-VAE dekodiert und
VHS_VideoCombinemultiplexiert alles in ein H.264 MP4 mit standardmäßigem 4:2:0-Pixel-Format. Sie können Audio während der Iteration vorschauen und die endgültige Dauer auf die generierte Sprache zuschneiden. - Optional Wenn VRAM knapp ist, aktivieren Sie die chunked feed-forward-Option, um ein wenig Geschwindigkeit gegen Stabilität einzutauschen. Für schnellere Look-Entwicklung verwenden Sie die kleine Vorschau-VAE. Multi-GPU-Nutzer können von dem Sequenz-Parallel-Patcher profitieren, um lange Sequenzen glatt zu halten.
Wichtige Knoten im ComfyUI LTX 2.3 Nahaufnahmen-Workflow#
LTXVImgToVideoInplace(#161 und #160) Verankert das Porträt im latenten Video, sodass das Gesicht stabil bleibt, während subtile Hereinzoomen und Mikrobewegungen ablaufen. Halten Sie es für Bild-zu-Video aktiv; schalten Sie seinenbypassnur um, wenn Sie den Text-zu-Video-Modus verwenden. Für die besten LTX 2.3 Nahaufnahmen-Ergebnisse beginnen Sie mit einer scharfen, gleichmäßig beleuchteten Referenz und vermeiden Sie Verdeckung über dem Mund.LTXVLatentUpsampler(#118) Wendet den nativen LTX 2.3 x2 räumlichen Upscaler im latenten Raum vor der zweiten Pass-Verfeinerung an. Dies bewahrt Bewegungskoherenz und erhöht gleichzeitig die Detailgenauigkeit. Für Nahaufnahmen bietet das Halten des Upscales bei x2 typischerweise das beste Gleichgewicht zwischen Schärfe und Stabilität.CFGGuider(#129 und #103) Kombiniert Ihre positive und negative Konditionierung in ein einheitliches Führungssignal für beide Modalitäten. Kleine Anpassungen der Führungskraft können die Einhaltung Ihres Skripts und Framings straffen oder lockern. Wenn Sie die Führung erhöhen, erwägen Sie, die negative Liste leicht zu mildern, um Überbeschränkungen von Ausdrücken zu vermeiden.SamplerCustomAdvanced(#113 und #119) Der erste Durchgang bevorzugt eine geschwindigkeitsorientierte Strategie, um Bewegung und Audio schnell zu etablieren, während der zweite Durchgang zu einer auf Treue orientierten Strategie wechselt, um Details zu schärfen. Wenn Sie die Sampler-Strategie ändern, halten Sie den ersten Durchgang schnell und den zweiten Durchgang präzise, damit LTX 2.3 Nahaufnahmen seinen kinoreifen Glanz behält.LTX2_NAG(#342) Führt eine rauschbewusste Führung ein, die Video- und Audio-Konditionierung ausbalanciert. Die Erhöhung der Video-Betonung kann das Framing und die Pose festigen; die Erhöhung der Audio-Betonung kann die Lippen-Synchronisation verstärken. Stimmen Sie konservativ und im Tandem mitCFGGuiderab, um Überbeschränkungen zu vermeiden.LTXVConditioning(#107 und #22) Bindet Ihre Prompts und die Bildrate an die latente Zeitleiste. Halten Sie einen einzigen, szenenbezogenen positiven Prompt und einen kompakten negativen Prompt für die sauberste Ausrichtung. Die angehängte Bildrate stellt sicher, dass das Sprachtempo und die Bewegungsabfolge im Gleichklang bleiben.VHS_VideoCombine(#140) Kodiert das Endergebnis zu MP4 mit standardmäßigen Wiedergabeeinstellungen. Für die Auslieferung erhöhen Sie die Qualität, indem Siecrfsenken; für redaktionelle Zwecke aktivieren Sietrim_to_audio, damit die Cliplänge genau zur generierten Sprache passt.
Optionale Extras#
- Framing-Tipps für LTX 2.3 Nahaufnahmen Beschneiden Sie so, dass die Augen sich in der Nähe des oberen Drittels befinden, lassen Sie etwas Freiraum und halten Sie den Mund vollständig sichtbar, um die Lippen-Synchronisation zu verbessern. Vermeiden Sie starkes Gegenlicht oder starke Filter in der Referenz.
- Prompting, das funktioniert Schreiben Sie, was im Laufe der Zeit passiert, einschließlich hörbarer Momente wie Atemzüge, Lachen und Raumklang. Lassen Sie Attribute weg, die bereits im Bild vorhanden sind. Halten Sie die Negativliste kurz und praktisch.
- Größe und Leistung Wenn Sie wenig VRAM haben, versuchen Sie zuerst moderate Basisgrößen, und lassen Sie den zweiten Durchgang hochskalieren. Abmessungen, die den Gitterbeschränkungen von LTX folgen, werden vorhersehbarer gesampelt, und höhere Bildraten erfordern mehr Rechenleistung.
- Iterations-Workflow Sperren Sie Bild und Prompt, iterieren Sie den ersten Durchgang, bis sich die Bewegung und das Lesen richtig anfühlen, und wechseln Sie dann zum zweiten Durchgang für Details. Verwenden Sie die kleine Vorschau-VAE, um Checks zu beschleunigen, und aktivieren Sie die vollständige Dekodierung erst, wenn Sie bereit sind, zu exportieren.
- Wann T2V verwenden Wechseln Sie in den Text-zu-Video-Modus für B-Roll und abstrakte Nahaufnahmen, die rein durch Erzählung gesteuert werden. Für identitätsgesteuerte Aufnahmen halten Sie den Porträtpfad eingeschaltet, um die LTX 2.3 Nahaufnahmen-Ästhetik zu bewahren.
Danksagungen#
Dieser Workflow implementiert und baut auf den folgenden Arbeiten und Ressourcen auf. Wir danken Lightricks für das LTX-2.3-Modell, LTX Docs für den Bild-zu-Video-Workflow-Leitfaden, QuantStack für die LTX-2.3-GGUF-Quantisierungen und iiTzMYUNG für die LTX 2.3 Quellenshowcase für ihre Beiträge und Wartung. Für autoritative Details verweisen wir auf die Originaldokumentation und -repositories, die unten verlinkt sind.
Ressourcen#
- Lightricks/LTX-2.3
- GitHub: Lightricks/LTX-2
- Hugging Face: Lightricks/LTX-2.3
- arXiv: arXiv:2601.03233
- LTX Docs/Image-to-Video Workflow Guide
- GitHub: Lightricks/ComfyUI-LTXVideo
- Docs / Release Notes: Image-to-Video Workflow Guide
- QuantStack/LTX-2.3-GGUF
- Hugging Face: QuantStack/LTX-2.3-GGUF
- iiTzMYUNG/LTX 2.3 Nahaufnahmen sind absolut verrückt!
- Docs / Release Notes: LTX 2.3 Nahaufnahmen sind absolut verrückt!
Hinweis: Die Verwendung der referenzierten Modelle, Datensätze und Codes unterliegt den jeweiligen Lizenzen und Bedingungen, die von ihren Autoren und Betreuern bereitgestellt werden.


