logo
RunComfy
  • ComfyUI
  • TrainerNeu
  • Modelle
  • API
  • Preise
discord logo
MODELLE
Erkunden
Alle Modelle
BIBLIOTHEK
Generierungen
MODELL-APIS
API-Dokumentation
API-Schlüssel
KONTO
Nutzung

Wan 2.2 S2V: Speech-to-Video-Generator | RunComfy

wan-ai/wan-2-2/speech-to-video

Kombinieren Sie ein Bild und eine Audiodatei, um ein sprechendes, singendes oder darstellendes Charaktervideo in 480P oder 720P zu erstellen.

Erforderliches JPG-, JPEG-, PNG-, BMP- oder WEBP-Bild. Breite und Höhe müssen jeweils über 400 liegen und dürfen 7000 Pixel nicht überschreiten.
0:00
0:00
Erforderliches WAV- oder MP3-Audio, kürzer als 20 Sekunden und kleiner als 15 MB.
Wählen Sie Sprechen, Gesang oder Performance; Standard: Sprechen.
Wählen Sie 480P- oder 720P-Ausgabe; Standard: 480P.
Idle
The rate is $0.10 per second for 480P, and $0.20 per second for 720P.

Wan 2.2 S2V im Überblick

Wan 2.2 S2V verwandelt ein erforderliches Standbild und eine erforderliche Audiospur in ein Charaktervideo. Wählen Sie passend zur Aufnahme Sprechen, Gesang oder Performance und anschließend die Auflösung 480P oder 720P. Für Bild und Audio gelten Vorgaben zu Format, Abmessungen, Dauer und Dateigröße.

Funktionen von Wan 2.2 S2V

Bild- und Audioeingang

Erstellen Sie aus einem erforderlichen Bild und einer erforderlichen Audiodatei ein Video – ganz ohne Text-Prompt.

Audiogesteuerte Charakterbewegung

Verwenden Sie die Aufnahme, um ein Charaktervideo anzusteuern, wobei ein Modus für Sprache, Gesang oder eine umfassendere Darbietung ausgewählt ist.

Drei Animationsmodi

Wählen Sie Sprechen für Dialoge, Gesang für Gesangsstimmen oder Performance für eine umfassendere Darbietung; Sprechen ist die Standardeinstellung.

Zwei Ausgabeauflösungen

Generieren Sie standardmäßig mit 480P oder wählen Sie 720P, wenn eine höhere Ausgabeauflösung erforderlich ist.

Wan 2.2 S2V Neuigkeiten und Beispiele zu X

Verwandte Modelle

Kling 1.5 Pro

Erstelle filmreife Videos aus Texten oder Bildern mit KI-Präzision

kling/lipsync/text-to-video

Erzeugen Sie Sprache aus Text und synchronisieren Sie sie mit einem vorhandenen Video; Stimme, Sprache und Sprechtempo sind wählbar.

ltx-2.5/image-to-video/fast

LTX 2.5: Animieren Sie Standbilder zu 4K-Video mit synchronisiertem Audio

wan-2.7/reference-to-video

Verwandelt visuelle oder akustische Referenzen mit präziser Bewegungssteuerung in HD-Clips.

kling-1-6/pro/text-to-video

Erstellen Sie aus einem erforderlichen Prompt ein 5- oder 10-sekündiges Video. Wählen Sie `16:9`, `9:16` oder `1:1`, fügen Sie optional eine negative Prompt hinzu und passen Sie die Stärke der Prompt an.

wan-2-1/image-to-video

Erzeuge realistische Bewegung und filmische Effekte aus Bildern.

Häufig gestellte Fragen

Welche Eingaben benötigt Wan 2.2 S2V?

Es sind eine Bild- und eine Audiodatei erforderlich. Diese Oberfläche bietet kein Feld für einen Text-Prompt.

Welche Bildformate werden unterstützt?

Verwenden Sie JPG, JPEG, PNG, BMP oder WEBP. Bildbreite und -höhe müssen jeweils über 400 liegen und dürfen 7000 Pixel nicht überschreiten.

Was sind die Audioanforderungen?

Verwenden Sie WAV- oder MP3-Audio, das kürzer als 20 Sekunden ist. Die Datei muss außerdem kleiner als 15 MB sein.

Welche Animationsmodi stehen zur Verfügung?

Wählen Sie Sprechen, Gesang oder Performance. Sprechen ist die Standardeinstellung.

Welche Auflösungen kann ich generieren?

Wählen Sie 480P oder 720P. Der Standardwert ist 480P.

Wie viel kostet die Erzeugung?

Für ein 5-Sekunden-Video sind 68 Credits erforderlich.

Wann sollte ich mich für Sprechen, Singen oder Aufführen entscheiden?

Wählen Sie Sprechen für Dialoge, Gesang für Gesangsstimmen und Performance für eine umfassendere Charakterdarstellung, die nicht auf Sprechen oder Singen beschränkt ist.

Warum kann ein Upload abgelehnt werden?

Überprüfen Sie den unterstützten Dateityp und die Einschränkungen. Bilder müssen beide Dimensionsregeln erfüllen, während Audio die Format-, Dauer- und Dateigrößenregeln erfüllen muss.

Unterstützt Wan 2.2 S2V die Stapelverarbeitung?

Ja. Unterstützte Stapelgrößen sind 1, 2, 3 und 4 Aufgaben.

Ändert der Animationsmodus die Anforderungen an Bild und Audio?

Nein. Für speech, sing und perform gelten dieselben Format-, Abmessungs-, Dauer- und Dateigrößenbeschränkungen.

Folge uns
  • LinkedIn
  • Facebook
  • Instagram
  • Twitter
Support
  • Discord
  • E-Mail
  • Systemstatus
  • Partner
Videomodelle
  • Runway Aleph 2
  • Wan 2.5
  • Wan 2.6 Flash
  • MiniMax H3 Max
  • Wan 3.0 Reference To Video
  • Seedance 2.5 Reference to Video 480p
  • Alle Modelle anzeigen →
Bildmodelle
  • Wan 2.6 Image to Image
  • Seedream 5.0 Pro
  • Flux 2 Klein 9B
  • Nano Banana Pro
  • Nano Banana 2 Edit
  • Z Image Turbo LoRA
  • Alle Modelle anzeigen →
Rechtliches
  • Nutzungsbedingungen
  • Datenschutzrichtlinie
  • Cookie-Richtlinie
RunComfy
Urheberrecht 2026 RunComfy. Alle Rechte vorbehalten.

RunComfy ist die führende ComfyUI Plattform, die ComfyUI online Umgebung und Services bietet, zusammen mit ComfyUI Workflows mit atemberaubenden Visualisierungen. RunComfy bietet auch AI Models, Künstlern ermöglichen, die neuesten AI-Tools zu nutzen, um unglaubliche Kunst zu schaffen.

Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...