logo
RunComfy
  • ComfyUI
  • TrainerNeu
  • Modelle
  • API
  • Preise
discord logo
MODELLE
Erkunden
Alle Modelle
BIBLIOTHEK
Generierungen
MODELL-APIS
API-Dokumentation
API-Schlüssel
KONTO
Nutzung

Wan 2.2 S2V: Speech-to-Video-Generator | RunComfy

wan-ai/wan-2-2/speech-to-video

Kombinieren Sie ein Bild und eine Audiodatei, um ein sprechendes, singendes oder darstellendes Charaktervideo in 480P oder 720P zu erstellen.

Erforderliches JPG-, JPEG-, PNG-, BMP- oder WEBP-Bild. Breite und Höhe müssen jeweils über 400 liegen und dürfen 7000 Pixel nicht überschreiten.
0:00
0:00
Erforderliches WAV- oder MP3-Audio, kürzer als 20 Sekunden und kleiner als 15 MB.
Wählen Sie Sprechen, Gesang oder Performance; Standard: Sprechen.
Wählen Sie 480P- oder 720P-Ausgabe; Standard: 480P.
Idle
The rate is $0.10 per second for 480P, and $0.20 per second for 720P.

Wan 2.2 S2V im Überblick

Wan 2.2 S2V verwandelt ein erforderliches Standbild und eine erforderliche Audiospur in ein Charaktervideo. Wählen Sie passend zur Aufnahme Sprechen, Gesang oder Performance und anschließend die Auflösung 480P oder 720P. Für Bild und Audio gelten Vorgaben zu Format, Abmessungen, Dauer und Dateigröße.

Funktionen von Wan 2.2 S2V

Bild- und Audioeingang

Erstellen Sie aus einem erforderlichen Bild und einer erforderlichen Audiodatei ein Video – ganz ohne Text-Prompt.

Audiogesteuerte Charakterbewegung

Verwenden Sie die Aufnahme, um ein Charaktervideo anzusteuern, wobei ein Modus für Sprache, Gesang oder eine umfassendere Darbietung ausgewählt ist.

Drei Animationsmodi

Wählen Sie Sprechen für Dialoge, Gesang für Gesangsstimmen oder Performance für eine umfassendere Darbietung; Sprechen ist die Standardeinstellung.

Zwei Ausgabeauflösungen

Generieren Sie standardmäßig mit 480P oder wählen Sie 720P, wenn eine höhere Ausgabeauflösung erforderlich ist.

Wan 2.2 S2V Neuigkeiten und Beispiele zu X

Verwandte Modelle

wan-2-2/lora/image-to-video

Animieren Sie ein Ausgangsbild anhand eines Prompts und steuern Sie LoRAs, Frames, FPS, Auflösung, Seitenverhältnis, Steps und Seed.

aurora

Erzeugen Sie aus einem Bild, einer Audiodatei und einem Prompt ein Video mit einstellbarer Text- und Audiosteuerung.

wan-2-6/video-to-video

Erstellen Sie ein Video aus einer Textaufforderung und ein bis drei Referenzclips mit Steuerelementen für Dauer, Ausgabegröße, Aufnahmestruktur, Startwert, negativer Aufforderung und Audiogenerierung.

pika-2-2/image-to-video

Erstelle aus Bildern mit Pika 2.2 mühelos lebendige Videos.

seedance-1-0/pro/fast/text-to-video

Intelligentes Text-zu-Video-Tool für dynamische, filmische Inhalte.

wan-2-6/flash/image-to-video

Erstellen Sie lebensechte Videoszenen aus Standbildern mit Bewegung, Dialogsynchronisierung und flexibler kreativer Kontrolle.

Häufig gestellte Fragen

Welche Eingaben benötigt Wan 2.2 S2V?

Es sind eine Bild- und eine Audiodatei erforderlich. Diese Oberfläche bietet kein Feld für einen Text-Prompt.

Welche Bildformate werden unterstützt?

Verwenden Sie JPG, JPEG, PNG, BMP oder WEBP. Bildbreite und -höhe müssen jeweils über 400 liegen und dürfen 7000 Pixel nicht überschreiten.

Was sind die Audioanforderungen?

Verwenden Sie WAV- oder MP3-Audio, das kürzer als 20 Sekunden ist. Die Datei muss außerdem kleiner als 15 MB sein.

Welche Animationsmodi stehen zur Verfügung?

Wählen Sie Sprechen, Gesang oder Performance. Sprechen ist die Standardeinstellung.

Welche Auflösungen kann ich generieren?

Wählen Sie 480P oder 720P. Der Standardwert ist 480P.

Wie viel kostet die Erzeugung?

Für ein 5-Sekunden-Video sind 68 Credits erforderlich.

Wann sollte ich mich für Sprechen, Singen oder Aufführen entscheiden?

Wählen Sie Sprechen für Dialoge, Gesang für Gesangsstimmen und Performance für eine umfassendere Charakterdarstellung, die nicht auf Sprechen oder Singen beschränkt ist.

Warum kann ein Upload abgelehnt werden?

Überprüfen Sie den unterstützten Dateityp und die Einschränkungen. Bilder müssen beide Dimensionsregeln erfüllen, während Audio die Format-, Dauer- und Dateigrößenregeln erfüllen muss.

Unterstützt Wan 2.2 S2V die Stapelverarbeitung?

Ja. Unterstützte Stapelgrößen sind 1, 2, 3 und 4 Aufgaben.

Ändert der Animationsmodus die Anforderungen an Bild und Audio?

Nein. Für speech, sing und perform gelten dieselben Format-, Abmessungs-, Dauer- und Dateigrößenbeschränkungen.

Folge uns
  • LinkedIn
  • Facebook
  • Instagram
  • Twitter
Support
  • Discord
  • E-Mail
  • Systemstatus
  • Partner
Videomodelle
  • MiniMax H3 Open
  • FLUX 3 Image to Video
  • MiniMax H3 Open Image to Video
  • Wan 2.6 Flash
  • Happy Horse 1.1 reference to video
  • Seedance 1.5 Pro Text to Video
  • Alle Modelle anzeigen →
Bildmodelle
  • Seedream 5.0 Pro Image Edit
  • Flux 2 Flash Edit
  • Nano Banana Pro
  • seedream 4.0
  • GPT Image 2
  • Qwen Image Edit 2511 LoRA
  • Alle Modelle anzeigen →
Rechtliches
  • Nutzungsbedingungen
  • Datenschutzrichtlinie
  • Cookie-Richtlinie
RunComfy
Urheberrecht 2026 RunComfy. Alle Rechte vorbehalten.

RunComfy ist die führende ComfyUI Plattform, die ComfyUI online Umgebung und Services bietet, zusammen mit ComfyUI Workflows mit atemberaubenden Visualisierungen. RunComfy bietet auch AI Models, Künstlern ermöglichen, die neuesten AI-Tools zu nutzen, um unglaubliche Kunst zu schaffen.

Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...