Erstellen Sie ein lippensynchrones Video aus den erforderlichen Video- und Audio-URLs mit fünf Modi für den Umgang mit nicht übereinstimmenden Eingabedauern.
LTX 2.5 Fast Audio To Video erstellt einen Clip, dessen Bild-Timing einem bereitgestellten Audiobett – Dialog, Musik oder SFX – in einem geschwindigkeitsoptimierten Modus folgt. Laden Sie Audio hoch (2–20 Sekunden), fügen Sie optional ein Startbild und eine Eingabeaufforderung hinzu und generieren Sie ein 1080p-Video, das auf den Track ausgerichtet ist. Verwenden Sie die Text-zu-Video- oder Bild-zu-Video-Fast-Seiten, wenn Sie den Schnitt nicht aus Audio steuern.
| Vorteil | Was es für Sie bedeutet |
|---|---|
| Audiogesteuertes Timing | Bildlänge und -phrasierung folgen dem hochgeladenen Clip – nützlich für Musikspots, VO-Kurzfilme und Titel-gebundene Werbung. |
| Optionaler visueller Anker | Fügen Sie ein Startbild hinzu, um die Identität oder das Erscheinungsbild des Produkts festzulegen. Lassen Sie es weg und verlassen Sie sich allein auf die Eingabeaufforderung. |
| Schnelle Vorschau | Geschwindigkeitsorientierter Modus zum Iterieren von Schnittideen vor einem aufwändigeren endgültigen Rendering an anderer Stelle. |
| Einfache Versandkontrollen | Seitenverhältnis „auto“ / „16:9“ / „9:16“, plus Orientierungsskala zur Verbesserung der sofortigen Haftung. |
Steuerelemente auf dieser LTX 2.5 Fast Audio To Video-Seite:
| Parameter | Erforderlich | Geben Sie | ein Standard | Sortiment / Optionen | So wählen Sie |
|---|---|---|---|---|---|
audio_url* | Ja (*) | Audio-URL | Beispielclip | MP3, OGG, WAV, M4A, AAC; 2–20 Sekunden | Verwenden Sie ein sauberes Bett. Die Ausgabelänge folgt diesem Clip. |
image_url | Nein | Bild-URL | — | JPG, JPEG, PNG, WEBP, GIF, AVIF | Ankeridentität oder -produkt; Für eine reine Eingabeaufforderung leer lassen. |
| „prompt“ | Bedingt | Zeichenfolge | Beispielaufforderung | Bis zu 5.000 Zeichen | Erforderlich, wenn kein Bild bereitgestellt wird; Beschreiben Sie die zeitlich auf den Ton abgestimmte Bewegung. |
guidance_scale | Nein | Nummer | 5 | 1–50 | Höhere Werte folgen der Eingabeaufforderung genauer (standardmäßig nahe 9, wenn auf der Anbieterseite ein Bild vorhanden ist). |
aspect_ratio | Nein | Zeichenfolge | auto | auto, 16:9, 9:16 | „auto“ folgt dem Bild, sofern vorhanden; andernfalls wird standardmäßig „16:9“ verwendet. |
LTX 2.5 Fast Audio To Video wird pro Sekunde Eingangsaudio mit 1080p abgerechnet:
| Audioeingabe | Preis bei 0,14 $/s |
|---|---|
| 5s | 0,70 $ |
| 10s | 1,40 $ |
| 15s | 2,10 $ |
| 20er Jahre | 2,80 $ |
Für Stapel beträgt die Gesamtsumme ≈ „audio_seconds × 0,14 $ × Ausgabeanzahl“.
Tipps für LTX 2.5 Fast Audio To Video:
Verbessertes Eingabeaufforderungsbeispiel
> Ein Sänger in einem schwarzen Rollkragenpullover singt in einer schummrigen Kabine in ein Vintage-Bändchenmikrofon, Kopfhörer auf. Sanftes seitliches Tastenlicht, langsames Eindrücken, passend zur Gesangsphrasierung. Sauberer Studiorealismus, kein Text, kein Wasserzeichen.
Erstellen Sie ein lippensynchrones Video aus den erforderlichen Video- und Audio-URLs mit fünf Modi für den Umgang mit nicht übereinstimmenden Eingabedauern.
Stellen Sie ein erforderliches Video wieder her und skalieren Sie es hoch. Steuern Sie Ausgabebreite, Frame-Limit, Bildrate, Seed, Restaurierungsstärke und Stapelgröße.
Erzeugt aus Referenzbildern und einem Prompt ein flüssiges Video in 720P oder 1080P.
Seedance 2.5: Kinoartiges KI-Video mit stärkerer Konsistenz und längeren Clips
Verlängern Sie vorhandene Clips mit szenenkonsistenter Bewegung über das letzte Bild hinaus
Erstellen Sie aus Referenzbildern und einem Prompt ein kurzes Video mit synchronisiertem Ton.
LTX 2.5 Fast Audio To Video generiert ein Video, das auf einen bereitgestellten Audioclip abgestimmt ist. Es passt zu musikgesteuerten Kurzfilmen, Dialog-Teasern, VO-Spots und auf einen Titel abgestimmten Werbespots, bei denen das Bild dem Ton folgen muss.
Eine Audio-URL ist erforderlich (2–20 Sekunden; MP3, WAV, M4A, AAC oder OGG). Ein optionales Startbild kann die Identität sperren und eine Eingabeaufforderung beschreibt die Bewegung; Die Eingabeaufforderung ist erforderlich, wenn Sie kein Bild bereitstellen.
Auf dieser Seite wird die Erzeugung für 1080p abgerechnet und geliefert. Die Cliplänge richtet sich nach der Dauer des Eingabeaudios und nicht nach einer separaten Dauersteuerung. Das Seitenverhältnis kann auto, 16:9 oder 9:16 sein.
Die Orientierungsskala (1–50, Standard 5) steuert, wie genau das Ergebnis der Eingabeaufforderung folgt. Erhöhen Sie den Wert schrittweise, wenn der Text ignoriert wird. Sehr hohe Werte können den Eindruck einer Überbeschränkung erwecken.
Ja. Fügen Sie optional einen image_url als ersten Frame hinzu, um die Gesichts-, Produkt- oder Verpackungsidentität zu stabilisieren, während der Ton das Timing steuert. Verlassen Sie sich ohne Bild auf eine klare Aufforderung.
Ja. Konfigurieren Sie eine Ausführung in der RunComfy-Web-Benutzeroberfläche und rufen Sie dann dasselbe LTX 2.5 Fast Audio To Video-Modell über HTTP API mit identischen Parametern für automation auf.
Bei 1080p beträgt die Abrechnung 0,14 $ pro Sekunde Eingangsaudio. Beispielsweise kosten 10 Sekunden Audio 1,40 US-Dollar pro Ausgabe. Generationen verbrauchen USD/Credits; Neue Benutzer erhalten in der Regel einen kostenlosen Testbetrag.
Wählen Sie LTX 2.5 Fast Audio To Video, wenn ein fertiges Musikbett, eine fertige Sprachausgabe oder ein Dialog-Take das Schnitt-Timing festlegen muss. Verwenden Sie Text-to-Video Fast, wenn Sie noch dabei sind, Ton und Bild zusammen aus einer Eingabeaufforderung zu erfinden.
RunComfy ist die führende ComfyUI Plattform, die ComfyUI online Umgebung und Services bietet, zusammen mit ComfyUI Workflows mit atemberaubenden Visualisierungen. RunComfy bietet auch AI Models, Künstlern ermöglichen, die neuesten AI-Tools zu nutzen, um unglaubliche Kunst zu schaffen.





