Entfernen Sie Videohintergründe mit der Fast-Variante und steuern Sie Codec, Kantenverfeinerung und Motivtyp.
Wan 3.0 ist das All-in-One-Videogenerierungsmodell von Wan-AI, das Text, Bilder, Videos, Audio, Dateien und Webseiten in zusammenhängende Clips mit synchronisiertem Ton umwandelt. Diese Seite bietet Wan 3.0 Image to Video: Geben Sie ein erstes Bild und eine Eingabeaufforderung ein und animieren Sie dieses Bild in einen 2–30 Sekunden langen Clip, mit einem optionalen letzten Bild, um festzulegen, wie die Aufnahme endet. Das gleiche zugrunde liegende Modell führt auch Text-zu-Video und Referenz-zu-Video aus, sodass ein Look, den Sie hier entwickeln, in der gesamten Familie übertragen wird.
| Wan 3.0 Vorteil | Was es für Sie bedeutet |
|---|---|
| Ein Modell, viele Eingaben | Wan 3.0 verarbeitet Text, Bilder des ersten/letzten Frames, Referenzbilder, Video, Audio, Dokumente und Links, sodass Sie selten zwischen Tools und Ideen wechseln müssen. |
| Steuerung des ersten und letzten Frames | Auf dieser Seite können Sie sowohl das Eröffnungs- als auch das Schlussbild festlegen, sodass Wan 3.0 besser steuern kann, wie eine Aufnahme beginnt und aufgelöst wird, als bei einer Animation, die nur auf das erste Bild beschränkt ist. |
| Flexible 2–30-Sekunden-Ausgabe | Wan 3.0 rendert kurze Entwürfe oder längere Einzelaufnahmen, sodass schnelle Iterationen und fertige Aufnahmen vom selben Endpunkt stammen. |
| Synchronisiertes Audio, optional | Jedes Wan 3.0-Ergebnis kann eine passende Audiospur enthalten, oder Sie können einen stillen Clip exportieren – das Umschalten von Audio ändert nichts am Preis. |
In der ersten Tabelle sind die vom Tool Wan 3.0 Image to Video auf dieser Seite bereitgestellten Steuerelemente aufgeführt.
| Parameter | Erforderlich | Geben Sie | ein Standard | Sortiment / Optionen | So wählen Sie |
|---|---|---|---|---|---|
prompt* | Ja (*) | Zeichenfolge | Beispielaufforderung | Bis zu 20.000 Zeichen | Beschreiben Sie das Motiv, seine Bewegung, die Kamerabewegung, die Beleuchtung und den Stil. Eine klare Struktur ist wichtiger als die Länge. |
image_url* | Ja (*) | Zeichenfolge | Beispielbild | Bild-URL oder Base64 | Der erste Frame Wan 3.0 animiert von. Verwenden Sie ein scharfes, gut beleuchtetes und übersichtliches Bild, um die bestmögliche Erhaltung des Motivs zu gewährleisten. |
end_image_url | Nein | Zeichenfolge | leer | Bild-URL oder Base64 | Ein optionaler letzter Frame; Legen Sie es fest, wenn die Endpose oder -komposition festgelegt ist. |
| „Auflösung“ | Nein | Zeichenfolge | 720p | 480p, 720p, 1080p | Verwenden Sie „480p“ für schnelle Entwürfe und „1080p“ für eine detailliertere Lieferung. |
aspect_ratio | Nein | Zeichenfolge | adaptive | adaptive, 16:9, 9:16, 1:1, 4:3, 3:4 | Lassen Sie „adaptive“ dem Eingabebild folgen oder erzwingen Sie ein Seitenverhältnis für eine bestimmte Platzierung. |
| „Dauer“ | Nein | Ganzzahl | 5 | „2“–„30“ Sekunden | Halten Sie ihn kurz, während Sie die Bewegung verfeinern, und erhöhen Sie ihn dann, sobald die Richtung bestätigt ist. |
thinking_mode | Nein | Boolescher Wert | „falsch“ | „wahr“ / „falsch“ | Aktivieren Sie diese Option für komplexe Aufforderungen, die mehrere Bewegungen oder Kompositionsregeln kombinieren. |
enable_audio | Nein | Boolescher Wert | „wahr“ | „wahr“ / „falsch“ | Fahren Sie fort, um eine synchronisierte Audiospur zu erhalten. für einen stillen Clip ausschalten. |
| „Same“ | Nein | Ganzzahl | Zufällig | 0–2147483647 | Fixieren Sie einen Startwert, um ein Ergebnis zu reproduzieren, während Sie kleine, vergleichbare Änderungen vornehmen. |
Die folgende Tabelle fasst das umfassendere Wan 3.0-Modell zusammen. Referenz-, Dokument- und Nur-Text-Eingaben sind über die anderen Modi und Geschwistertools des Modells verfügbar, nicht als Steuerelemente auf dieser Bild-zu-Video-Seite.
| Kerndimension | Wan 3.0 |
|---|---|
| Modell | wan3.0-video |
| Generierungsmodi | Text-zu-Video; Bild-zu-Video (erstes Bild oder erstes + letztes Bild); Verweis auf Video aus Bildern, Video und Audio; plus Dokument- und Weblink-Referenzen. |
| Ausgabedauer | 2–30 Sekunden. Bei der Videoeingabe bleiben Eingabe und Ausgabe innerhalb von 30 Sekunden. Mit der Option „Smart-Dauer“ kann Wan 3.0 eine Länge empfehlen. |
| Auflösung | „480P“, „720P“ oder „1080P“. |
| Ausgabeseitenverhältnis | adaptive (empfohlen aus der Eingabe) oder 16:9, 4:3, 1:1, 3:4, 9:16. |
| Audio ausgeben | Optionaler synchronisierter Ton, der standardmäßig mit dem Bild generiert und aktiviert wird. |
| Eingabe des ersten/letzten Frames | Bis zu einem „first_frame“ und einem „last_frame“. Bilder: JPEG, JPG, PNG, BMP oder WEBP; „240–8000“ Pixel pro Seite; Seitenverhältnis bis zu „8:1“; jeweils bis zu 20 MB. |
| Referenzbilder | Bis zu 10 Referenzbilder für die Konsistenz von Motiv, Objekt oder Szene. |
| Referenzvideos | Bis zu 5 Clips; MP4 oder MOV; jeweils „1–15“ Sekunden; kombiniertes Video bis zu 15 Sekunden; „240–4096“ Pixel pro Seite; bis zu 100 MB pro Clip. |
| Referenzaudio | Bis zu 5 Clips; WAV oder MP3; kombiniertes Audio bis zu 15 Sekunden; jeweils bis zu 15 MB. |
| Dokument-/Webeingabe | Ein Dokument (DOCX, PDF, PPTX, XLSX, TXT und ähnliches, bis zu 50 Seiten) oder ein öffentlicher Weblink. |
| Mode-Exklusivität | Eingaben für den ersten/letzten Frame können nicht mit Referenz-, Dokument- oder Link-Eingaben in derselben Anfrage kombiniert werden. |
| Promptlimit | Bis zu 20.000 Zeichen. |
Die Preise für Wan 3.0 hängen von der gewählten Auflösung und der generierten Dauer ab. Durch das Aktivieren oder Deaktivieren von Wan 3.0-Audio ändert sich die Rate nicht.
| Auflösung | Preis pro Sekunde | 5s | 10s | 30er Jahre |
|---|---|---|---|---|
| 480p | 0,06 $ | 0,30 $ | 0,60 $ | 1,80 $ |
| 720p | 0,12 $ | 0,60 $ | 1,20 $ | 3,60 $ |
| 1080p | 0,25 $ | 1,25 $ | 2,50 $ | 7,50 $ |
Berechnen Sie für Chargen mit 1–4 Ausgaben die Gesamtsumme als „Dauer × Rate pro Sekunde × Ausgabeanzahl“.
Verwenden Sie diese wiederverwendbare Wan 3.0-Struktur:
„[Thema + definierende Details] + [eine Bewegung im Zeitverlauf] + [Kameraeinstellung und -bewegung] + [Einstellung + Beleuchtung] + [visuelle Behandlung] + [Audio] + [Endbild oder Einschränkung]“.
Verwenden Sie diesen Wan 3.0-Vergleich als Leitfaden für die Modellfamilie. Maximale Auflösung und Dauer sind möglicherweise nicht zusammen verfügbar, und verschiedene Tools können unterschiedliche Eingaben und Steuerelemente verfügbar machen. Basierend auf öffentlich zugänglichen Informationen.
| Modell | Auflösung | Maximale Dauer | Audio | Herausragend |
|---|---|---|---|---|
| Wan 3.0 | 480p–1080p | 30er Jahre | Optionales synchronisiertes Audio | Ein All-in-One-Modell, das Text, erstes/letztes Bild und Verweis auf Video aus Bildern, Video und Audio sowie Dokument- und Webeingaben umfasst. |
| Kling 3.0 | Bis zu 4K | 15s | Natives Audio mit Lippensynchronisation | Koordiniert Multi-Shot-Kamerawechsel und vom Sprecher zugewiesene Dialoge für Drehbuchanzeigen und Charakterszenen. |
| Hailuo 02 | 1080p | ~10s | Keine | Physikfokussierte Bewegung und starke Soforthaftung für geräuschlose Action- und Produktaufnahmen. |
| Seedance 2,5 | 1080p | 30er Jahre | Gemeinsames Audio und Video | Referenzintensive Generierung mit synchronisierter Sprache und Effekten für identitätssensitive Bearbeitungen. |
| Veo 3.1 | 4K | 8s | Native Dialoge und Effekte | Steuerelemente für erstes/letztes Bild und Referenz, geeignet für filmische Übergänge und zusammengesetzte Sequenzen. |
Was Wan 3.0 auszeichnet, ist seine Breite: ein einzelnes Modell, das ein erstes Bild animiert, ein letztes Bild berücksichtigt und Bilder, Videos, Audio, Dokumente und Links abrufen kann – und gleichzeitig optional synchronisierten Ton erzeugt. Wählen Sie Wan 3.0 Image to Video, wenn Sie einen Eröffnungsrahmen zum Leben erwecken möchten, und wechseln Sie zu den Text- oder Referenzwerkzeugen, wenn sich Ihr Ausgangspunkt ändert.
Entfernen Sie Videohintergründe mit der Fast-Variante und steuern Sie Codec, Kantenverfeinerung und Motivtyp.
Animieren Sie ein erforderliches Startbild mit einem erforderlichen Prompt mithilfe von Kling 2.1 Pro, mit optionalem Endbild, Dauer, Seitenverhältnis, Negativ-Prompt und Prompt-Stärke.
Erstellen Sie aus einem Referenzvideo eine neue Einstellung und steuern Sie sie per Prompt, Elementen, Bildern, Seitenverhältnis, Dauer und Originalton.
Wan 3.0 Reference To Video erstellt Clips aus Bild-, Video- und Audioreferenzen
Erstelle in Sekunden realistische Bewegtbilder mit Dreamina 3.0.
FLUX 3 Draft Keyframes: Schnelle Multi-Keyframe-Videovorschau mit 720p
Wan 3.0 image-to-video nimmt ein einzelnes Bild des ersten Frames auf und animiert es basierend auf Ihrer Textaufforderung zu einem kurzen, zusammenhängenden Clip. Es eignet sich gut für die Umsetzung von Produktaufnahmen, Porträts, Lifestyle-Fotos oder Konzeptzeichnungen ohne Rigging oder manuelle Keyframes.
Sie stellen immer ein Bild des ersten Frames bereit und können optional ein Bild des letzten Frames hinzufügen, wenn die Endpose oder -komposition wichtig ist. Wan 3.0 erzeugt dann eine kontinuierliche Bewegung, die beim ersten Bild beginnt und sich bis zum letzten Bild auflöst, sodass Sie besser steuern können, wie die Aufnahme beginnt und endet.
Da das erste Bild direkt als Eröffnung des Videos verwendet wird, sorgt Wan 3.0 dafür, dass das Aussehen und die Bildeinstellung des Motivs im gesamten Clip konsistent bleiben. Die Verwendung eines scharfen, gut beleuchteten und übersichtlichen Eingangsbildes sorgt für die beste Erhaltung des Motivs.
Wan 3.0 unterstützt die Ausgabe 480p, 720p und 1080p, wobei 720p der allgemeine Standard ist. Die Dauer ist zwischen 2 und 30 Sekunden einstellbar und das Seitenverhältnis kann Breitbild, vertikal, quadratisch oder klassisch sein oder auf adaptive eingestellt werden, sodass es dem Eingabebild folgt. Die genauen Stromgrenzen finden Sie im Parameterfeld RunComfy.
Ja. Wan 3.0 kann zusammen mit dem Clip eine synchronisierte Audiospur erzeugen, und Sie können den Ton ausschalten, wenn Sie nur stilles Filmmaterial benötigen. Durch das Umschalten von Audio ändern sich die Erzeugungskosten nicht.
Eingabebilder sollten gängige Formate wie JPEG, PNG oder WEBP mit einer angemessenen Auflösung und einem angemessenen Seitenverhältnis sein. Bilder mit sehr geringer Qualität oder stark überladene Bilder können die Bewegungsqualität beeinträchtigen. Bevorzugen Sie daher ein sauberes, hochauflösendes erstes Bild. Die Grenzwerte können je nach Anbietereinstellungen variieren.
Ja. Sie können Wan 3.0 in der Benutzeroberfläche des RunComfy-Modells prototypisieren und dann dasselbe Modell über RunComfy HTTP API mit identischen Parametern für die Produktion oder Automatisierung aufrufen. Dadurch können Sie von einem Browsertest zu einer integrierten Pipeline wechseln, ohne das Modell zu ändern.
Generationen verbrauchen USD oder Credits basierend auf der Ausgabeauflösung und -dauer: 0,06 $ pro Sekunde bei 480p, 0,12 $ pro Sekunde bei 720p und 0,25 $ pro Sekunde bei 1080p. Neue Benutzer erhalten in der Regel einen kostenlosen Testbetrag, um Wan 3.0 auszuprobieren, bevor sie sich zu größeren Auflagen verpflichten.
RunComfy ist die führende ComfyUI Plattform, die ComfyUI online Umgebung und Services bietet, zusammen mit ComfyUI Workflows mit atemberaubenden Visualisierungen. RunComfy bietet auch AI Models, Künstlern ermöglichen, die neuesten AI-Tools zu nutzen, um unglaubliche Kunst zu schaffen.





