ComfyUI>Workflows>LTX 2.3 Sprechen und Singen Lip Sync Video Maker

LTX 2.3 Sprechen und Singen Lip Sync Video Maker

Workflow Name: RunComfy/LTX-2.3-Talking-Sync
Workflow ID: 0000...1461
Dieser Workflow ermöglicht es Ihnen, Porträtbilder in sprechende oder singende Videos mit natürlicher Mundsynchronisation zu verwandeln. Er hilft Designern und Kreativen, statische Charaktere für Geschichtenerzählen, Musikvideos oder interaktive Inhalte zum Leben zu erwecken. Aufbauend auf fortgeschrittener Audio-Trennung sorgt er für klare Vocals und präzise Lippenbewegungen. Sie können mühelos Ergebnisse in Kinoqualität erzeugen, die Gesichtsausdruck und Sprachrhythmus entsprechen. Ideal für digitale Mensch-Animation, virtuelle Sänger und Leistungstests.

ComfyUI LTX 2.3 Talking and Singing Lip Sync Workflow

LTX 2.3 Talking and Singing Lip Sync in ComfyUI | Portrait2Video Sync
Want to run this workflow?
  • Fully operational workflows
  • No missing nodes or models
  • No manual setups required
  • Features stunning visuals

ComfyUI LTX 2.3 Talking and Singing Lip Sync Examples

LTX 2.3 Sprechen und Singen Lip Sync: Portrait-to-Performance ComfyUI Workflow#

LTX 2.3 Sprechen und Singen Lip Sync verwandelt ein klares, frontales Porträt und eine Stimme oder ein Lied in ein digitales Mensch-Video in Kinoqualität mit ausdrucksstarken, synchronisierten Mundbewegungen. Entwickelt für RunComfy, nutzt es die LTX 2.3 Videoerzeugung mit LTXV ComfyUI-Knoten und Mel-Band RoFormer Audio-Trennung, um das Gesicht lesbar zu halten, während es mit Sprache oder Lyrics übereinstimmt.

Dieser ComfyUI-Workflow eignet sich für AI-Musikvideos, virtuelle Sänger, Charakterleistungstests und Creator-Demos, bei denen sowohl der Bildschirmdarsteller als auch das endgültige Audio verwendbar bleiben müssen. Sie liefern ein Porträtbild und eine Audiospur, wählen eine Bildrate und Dauer, und die Pipeline rendert ein mp4 mit Lip Sync, das mit Ihrer Spur übereinstimmt.

Hinweis: Für besonders beeindruckende Ergebnisse empfehlen wir dringend, das Lied mit Ace Step Model zu erzeugen und dann ein klares, filmisches Porträt mit Seedream 5.0 Pro zu erstellen. Verwenden Sie diese beiden Ressourcen als Audio- und Porträteingaben für diesen Workflow, um eine poliertere singende digitale Mensch-Performance zu erzielen.

Wichtige Modelle im ComfyUI LTX 2.3 Sprechen und Singen Lip Sync Workflow#

  • LTX-2.3 Videoerzeugungsmodell von Lightricks. Ein transformerbasiertes Audio-Video-Generator, das Audioeigenschaften mit visueller Bewegung koppelt, um zeitlich kohärente Frames zu produzieren, die für Sprechen und Singen geeignet sind. Modellkarte und offizielles Repository.
  • LTX-2.3 Video VAE und Audio VAE. Latentencodierer/Decoder, die Video und Audio in den AV-Latentenraum packen, der von LTX-2.3 verwendet wird, um effizientes Sampling und saubere Rekonstruktion zu gewährleisten. Implementiert in der LTX ComfyUI-Integration. ComfyUI-LTXVideo.
  • MelBandRoFormer. Ein modernes Musikquellentrennungsmodell, das hier verwendet wird, um optional Vocals zu extrahieren, um eine sauberere Lippenkonditionierung zu erreichen, während Ihr originales Mix für den finalen Render beibehalten wird. Gewichte und ComfyUI-Knoten.

So verwenden Sie den ComfyUI LTX 2.3 Sprechen und Singen Lip Sync Workflow#

Der Workflow läuft in drei Phasen: Eingabe, LTX 2.3-Erzeugung und Export. Gruppen arbeiten Ende-zu-Ende zusammen, um Ihr Porträt und Audio in eine synchronisierte Performance zu verwandeln.

EINGABE#

Laden Sie ein frontales Porträt mit Character Image (front view + 9:16, recommended) (#444) hoch. Das Bild wird für das Modell in der Größe angepasst und leicht vorverarbeitet, um Identität und Mundbereichdetails zu bewahren. Laden Sie Ihr Lied oder Ihre Stimme mit Upload Song or Voice (#1755) hoch und legen Sie dann fest, Start lip-sync from which second? e.g. 10.0 (seconds) (#1776), wenn Sie Intro-Takte oder Stille überspringen möchten. Wählen Sie eine Dauer mit Duration in seconds (best under 35s; enter 0 for full audio) (#1583) und setzen Sie Frame Rate (#1586) für den Render. Schreiben Sie ein Intent-Prompt in Prompt (#1624), um Ausdruck und Kameraverhalten zu leiten; der Workflow injiziert auch hilfreiche negative Hinweise, um Untertitel, Wasserzeichen und statische Frames zu vermeiden.

LTX2.3 Digitaler Mensch Sprechen/Singen Lip-Sync#

Ihr Porträt wird in einen Start-Latentclip durch LTXV Preprocess (#446) und LTXVImgToVideoInplaceKJ (#1762) umgewandelt. Kontrollieren Sie, wie stark das Porträt durch IMG STRENGTH. Set 0 for T2I mode (#1722) gefestigt wird: Höhere Werte sperren das Foto, während niedrigere Werte mehr generative Bewegung zulassen. Der Audiopfad schneidet Ihren Upload, trennt optional Vocals mit Mel-Band RoFormer Sampler (#1599) und kodiert den gewählten Track durch LTXV Audio VAE Encode (#1605). Audio- und Videolatenten werden durch LTXV Concat AV Latent (#350) fusioniert, und Textkonditionierung von CLIP Text Encode-Knoten treibt den Gesamtszene-Intent und die Sauberkeit über LTXVConditioning (#164). Das LTX-2.3-Modell wird mit LTX2 NAG (#508) gepatcht und für Lippenpräzision geführt, dann mit SamplerCustomAdvanced (#161) unter dem gewählten Scheduler und Sampler abgetastet.

Export und speichern#

Nach dem Sampling wird das Videolatent durch VAE Decode (#1318) in Frames dekodiert. Video Combine 🎥🅥🅗🅢 (#1747) muxed diese Frames mit Ihrem geschnittenen Originalaudio, um ein mp4 in Ihrer gewählten Bildrate zu produzieren. Wenn Sie Vocals-only für die Konditionierung aktiviert haben, verwendet der finale Export dennoch das vollständige Mix, sodass Ihr Ergebnis bereit bleibt, geteilt zu werden. Der Output wird mit einem klaren Präfix gespeichert, um eine einfache Versionierung zu ermöglichen.

Wichtige Knoten im ComfyUI LTX 2.3 Sprechen und Singen Lip Sync Workflow#

LTXVImgToVideoInplaceKJ (#1762)#

Konvertiert das Referenzporträt in ein initiales Latentvideo. Passen Sie IMG STRENGTH. Set 0 for T2I mode (#1722) an, um das Gleichgewicht zwischen Identitätssperre und Bewegungsfreiheit zu halten. Für enge Ähnlichkeit und stabile Kopfposition halten Sie die Stärke höher; für mehr performative Bewegung reduzieren Sie sie. Wenn Sie es auf 0 setzen, behandeln Sie den Workflow wie Text-to-Video und verlassen Sie sich mehr auf das Prompt und Audio.

Mel-Band RoFormer Sampler (#1599)#

Trennt Vocals von einem Lied, um sauberere Sprachmerkmale in das Modell einzuspeisen. Verwenden Sie USE VOCALS ONLY (#1616), wenn das Instrumental dominant ist oder Konsonanten verloren gehen; lassen Sie es aus, wenn Sie möchten, dass das vollständige Mix die Ausdruckskraft beeinflusst. Der finale Render verwendet das originale geschnittene Audio, um Ihren beabsichtigten Soundtrack zu bewahren. Siehe die Modelldetails in der ComfyUI-Erweiterung und die oben verlinkten Gewichte.

LTXV Audio VAE Encode (#1605)#

Kodiert das ausgewählte Audio in den LTX Audio-Latentenraum, der Mundformen und Mikroausdrücke antreibt. Schneiden Sie offensichtliche Stille vor dem Kodieren, um eine schnellere Ausrichtung zu erreichen. Paaren Sie dies mit dem Startzeit-Offset, wenn Ihr Lyric-Eintrag nicht bei 0 Sekunden beginnt.

LTX2 NAG (#508)#

Wendet rauschverstärkte Führung an, die für LTX 2.3 maßgeschneidert ist, um die Kopplung von Audio und Lippen zu schärfen. Wenn sich die Lippen zu wenig animiert anfühlen, erhöhen Sie die Führung leicht; wenn Zähne oder Mundformen übertrieben wirken, reduzieren Sie den Effekt. Kleine, inkrementelle Änderungen funktionieren am besten, da diese Kontrolle mit Ihrer Promptstärke und Samplereinstellungen interagiert. Die Referenzimplementierung befindet sich in den LTX-Repositories.

SamplerCustomAdvanced (#161)#

Führt den Entrauschungsprozess mit Ihrem gewählten KSamplerSelect (#154), CFG Guider (#153) und Scheduler aus. Niedrigere klassifikatorfreie Führung begünstigt natürliche Bewegung und Identitätsbewahrung; höhere Werte erhöhen die Promptdominanz, können aber die Lippen versteifen. Wenn Sie Sampler wechseln, halten Sie die restlichen Einstellungen intakt für einen fairen A/B-Vergleich.

Video Combine 🎥🅥🅗🅢 (#1747)#

Schreibt das finale mp4, indem Frames und das geschnittene Audio kombiniert werden. Lassen Sie die Standardeinstellungen für breite Kompatibilität oder erhöhen Sie die Qualität, wenn Sie später Farbkorrekturen planen. Stellen Sie sicher, dass die frame_rate Ihrer kreativen Absicht entspricht und mit dem übereinstimmt, was Sie zuvor festgelegt haben.

Optionale Extras#

  • Verwenden Sie ein klares, frontales Porträt mit neutraler Beleuchtung und einem 9:16-Zuschnitt für die überzeugendsten LTX 2.3 Sprechen und Singen Lip Sync-Ergebnisse.
  • Wenn Instrumente Konsonanten maskieren, aktivieren Sie USE VOCALS ONLY (#1616), sodass das Modell auf einen saubereren Vokalstamm konditioniert, während Ihr Export das vollständige Mix behält.
  • Halten Sie Clips unter etwa 35 Sekunden für schnellere Iterationen; fügen Sie Takes extern zusammen, wenn Sie ein langes Musikvideo erstellen.
  • Wenn die Bewegung zu statisch ist, senken Sie IMG STRENGTH; wenn die Identität driftet, erhöhen Sie sie und vereinfachen Sie das Prompt.
  • Richten Sie Lyrics durch das Schneiden von Einführungsstille aus und verwenden Sie die Startzeit-Offset-Steuerung, sodass Lippenformen genau bei Ihrem ersten Wort beginnen.
  • Setzen Sie einen festen Start Seed, um einen Take zu reproduzieren, und variieren Sie den Seed für Alternativen.
  • Respektieren Sie Ähnlichkeits- und Musikrechte bei der Verwendung dieses LTX 2.3 Sprechen und Singen Lip Sync Workflows in öffentlichen Projekten.

Links zu offiziellen Ressourcen

Anerkennungen#

Dieser Workflow implementiert und baut auf den folgenden Arbeiten und Ressourcen auf. Wir danken Lightricks für LTX-Video (einschließlich des LTX 2.3 Modells und der ComfyUI-LTXVideo-Knoten), Kijai für MelBandRoFormer (ComfyUI-Knoten und Modellgewichte) und RunningHub für den Workflow-Quellartikel für ihre Beiträge und Wartung. Für autoritative Details konsultieren Sie bitte die ursprüngliche Dokumentation und die unten verlinkten Repositories.

Ressourcen#

Hinweis: Die Nutzung der referenzierten Modelle, Datensätze und Codes unterliegt den jeweiligen Lizenzen und Bedingungen, die von ihren Autoren und Wartungsmitarbeitern bereitgestellt werden.

RunComfy
Urheberrecht 2026 RunComfy. Alle Rechte vorbehalten.

RunComfy ist die führende ComfyUI Plattform, die ComfyUI online Umgebung und Services bietet, zusammen mit ComfyUI Workflows mit atemberaubenden Visualisierungen. RunComfy bietet auch AI Models, Künstlern ermöglichen, die neuesten AI-Tools zu nutzen, um unglaubliche Kunst zu schaffen.