logo
RunComfy
  • ComfyUI
  • TrainerNeu
  • Modelle
  • API
  • Preise
discord logo
MODELLE
Erkunden
Alle Modelle
BIBLIOTHEK
Generierungen
MODELL-APIS
API-Dokumentation
API-Schlüssel
KONTO
Nutzung

Wan 3.0 Reference To Video: Multimodale Referenzvideogenerierung auf Models and API | RunComfy

wan-ai/wan-3.0/reference-to-video

Wan 3.0 Reference To Video kombiniert eine Eingabeaufforderung mit Bild-, Video- und Audioreferenzen, um zusammenhängende Clips mit einheitlichen Themen, Bewegungen und Ton zu erstellen.

Beschreiben Sie Szene, Motiv, Bewegung, Kamerabewegung, Beleuchtung und Stil. Beziehen Sie sich auf die Referenzen in der Reihenfolge Bild 1, Video 1, Audio 1.
Image 1
Bis zu 10 Referenzbilder für die Konsistenz von Motiv, Objekt oder Szene. Es ist mindestens eine Referenz (Bild, Video oder Audio) erforderlich.
Bis zu 5 Referenzvideos (MP4 oder MOV, jeweils 1–15 Sekunden, insgesamt nicht mehr als 15 Sekunden) zur Bewegungs- oder Szenenführung.
Bis zu 5 Referenz-Audioclips (insgesamt nicht länger als 15 Sekunden) zur Ton- oder Timingsteuerung.
Ausgabeauflösungsstufe. Verwenden Sie 480p für schnelle Entwürfe und 1080p für eine Ausgabe mit höherer Qualität.
Ausgabeseitenverhältnis des generierten Videos.
Länge des generierten Videos in Sekunden. Der Bereich liegt zwischen 2 und 30. Beginnen Sie mit der Iteration kurz und steigern Sie sie dann, sobald die Bewegung richtig aussieht.
Ermöglichen Sie eine tiefergehende, schnelle Interpretation komplexer Szenen mit mehreren Bewegungs- oder Kompositionsanforderungen.
Wenn diese Option aktiviert ist, enthält das Ausgabevideo eine synchronisierte Audiospur. Für einen stummen Clip ausschalten.
Zufälliger Startwert für reproduzierbare Ergebnisse. Der Bereich liegt zwischen 0 und 2147483647.
Idle
The rate is $0.06 per second for 480p, $0.12 per second for 720p, and $0.25 per second for 1080p.

Einführung in Wan 3.0 Reference To Video

Wan 3.0 Reference To Video stellt aus einer Eingabeaufforderung und multimodalen Referenzen, einschließlich Bildern, Videos und Audio, einen zusammenhängenden Clip mit einer Dauer von 2 bis 30 Sekunden und Kontrolle des Seitenverhältnisses zusammen. Es ersetzt fragiles Compositing durch referenzbasierte Konsistenz und hilft Studios, Werbeteams und Kreativen, Charaktere, Objekte, Bewegungen und Ton während einer Aufnahme markenkonform zu halten. Für Entwickler kann Wan 3.0 Reference To Video auf RunComfy sowohl im Browser als auch über einen HTTP API verwendet werden, sodass Sie das Modell nicht selbst hosten oder skalieren müssen.
Ideal für: Zeichenkonsistenz | Markenproduktszenen | Multimodales Storytelling

Wan-AI / Wan 3.0 Reference To Video#


Wan 3.0 Reference To Video nimmt eine Textaufforderung zusammen mit Referenzmedien und komponiert einen neuen Clip, der sie würdigt. Geben Sie Referenzbilder, Videos oder Audio an und zeigen Sie dann in der Eingabeaufforderung als Bild 1, Video 1 oder Audio 1 darauf, um zu steuern, wer erscheint, wie er sich bewegt und wie die Szene klingt.


Dieser Referenzendpunkt ist für Konsistenzarbeit konzipiert: wiederkehrende Charaktere, bestimmte Produkte, ein aus einem Clip übernommener Bewegungsstil oder ein in eine neue Aufnahme übertragenes Audiogefühl. Referenzen werden in der Reihenfolge abgeglichen, in der Sie sie angeben.


Highlights#


  • Multimodale Referenzen: Leiten Sie eine Aufnahme mit bis zu 10 Bildern, 5 Videos und 5 Audioclips.
  • Konsistenz des Themas: Sorgen Sie dafür, dass ein Charakter, ein Produkt oder ein Objekt im gesamten Clip erkennbar bleibt.
  • Bewegungs- und Timing-Hinweise: Leihen Sie sich Bewegung oder Tempo aus einem Referenzvideo aus.
  • Audioführung: Verwenden Sie Referenzaudio, um den Klang und Rhythmus des Ergebnisses zu steuern.
  • Flexible Ausgabe: Stellen Sie 2 bis 30 Sekunden ein und wählen Sie das Seitenverhältnis für die endgültige Platzierung.

Parameter#


ParameterErforderlichGeben Sieein StandardSortiment / OptionenBeschreibung
Eingabeaufforderung*Ja (*)Zeichenfolge--Szene, Motiv, Bewegung, Kamera, Beleuchtung und Stil.
reference_imagesBedingtArrayleerbis zu 10Referenzbilder für die Konsistenz von Motiv oder Szene.
reference_videosBedingtArrayleerbis zu 5Referenzvideos (jeweils 1–15 Sekunden, insgesamt 15 Sekunden).
reference_audiosBedingtArrayleerbis zu 5Referenzaudio (insgesamt 15 Sekunden).
AuflösungNeinZeichenfolge720p480p, 720p, 1080pAusgabeauflösungsstufe.
aspect_ratioNeinZeichenfolge16:916:9, 9:16, 1:1, 4:3, 3:4, adaptiveAusgabe-Seitenverhältnis.
DauerNeinGanzzahl52-30Ausgabelänge in Sekunden.
thinking_modeNeinboolescher Wertfalschwahr / falschTiefergehende Interpretation komplexer Eingabeaufforderungen.
enable_audioNeinboolescher Wertwahrwahr / falschFügen Sie eine synchronisierte Audiospur hinzu.
SamenNeinGanzzahlzufällig0-2147483647Seed für reproduzierbare Ergebnisse.

Geben Sie mindestens eines von reference_images, reference_videos oder reference_audios an.


Preise#


Der Preis hängt von der gewählten Auflösung ab: 0,06 $ pro Sekunde bei 480p, 0,12 $ pro Sekunde bei 720p und 0,25 $ pro Sekunde bei 1080p. Durch das Aktivieren oder Deaktivieren von Audio ändert sich die Rate nicht.

Verwandte Modelle

hunyuan/image-to-video

Erzeugt fließende Szenenwechsel, natürliche Bewegungen und stabile Animationen.

lucy-edit/restyle

Gestalten Sie ein vorhandenes Video mit Textanweisungen neu und behalten Sie dabei die Quellbewegung und die Gesamtkomposition bei.

cinematic-video-generator

Filmreife Videogenerierung auf Seedance 2.0-Niveau mit beeindruckender Bildtreue und kinoreifer Bewegung

wan-2-1/image-to-video

Erzeuge realistische Bewegung und filmische Effekte aus Bildern.

minimax-h3/text-to-video

MiniMax H3: 768p/2K Text-to-Video mit nativem Stereo-Audio

Kling 1.5 Pro

Erstelle filmreife Videos aus Texten oder Bildern mit KI-Präzision

Häufig gestellte Fragen

Wofür wird Wan 3.0 Reference To Video verwendet?

Wan 3.0 Reference To Video erstellt einen Clip aus einer Textaufforderung in Kombination mit Referenzmedien wie Bildern, Videos und Audio. Es ist auf Konsistenzarbeit ausgelegt: Es soll eine Figur, ein Produkt oder ein Bewegungsstil in einer neuen Aufnahme erkennbar bleiben, anstatt sie von Hand zu komponieren.

Welche Arten von Referenzen kann Wan 3.0 Reference To Video akzeptieren?

Es akzeptiert bis zu 10 Referenzbilder, bis zu 5 Referenzvideos und bis zu 5 Referenzaudioclips in einer Anfrage. Bilder helfen dabei, die Identität zu sperren, Videos leiten Bewegung oder Tempo und Audio steuert den Ton, und Sie zeigen in der Eingabeaufforderung auf jedes Element als Bild 1, Video 1 oder Audio 1.

Wie sorgt Wan 3.0 Reference To Video dafür, dass die Themen konsistent bleiben?

Da Sie direkte visuelle Referenzen bereitstellen, kann Wan 3.0 Reference To Video das Erscheinungsbild einer Figur oder eines Objekts zuverlässiger in die generierte Szene übertragen als eine Eingabeaufforderung allein. Saubere Einzelsubjekt-Referenzbilder bieten im Allgemeinen die stärkste Identitätsfeststellung.

Welche Beschränkungen gelten für Referenzvideos und -audio?

Referenzvideos sollten im MP4- oder MOV-Format vorliegen und jeweils 1 bis 15 Sekunden lang sein, wobei die Gesamtdauer des Referenzvideos 15 Sekunden nicht überschreiten darf. Auch der Referenzton bleibt insgesamt etwa 15 Sekunden lang erhalten. Überprüfen Sie vor einem Lauf das Parameterfeld RunComfy auf die genauen Stromgrenzen.

Welche Ausgabeeinstellungen unterstützt Wan 3.0 Reference To Video?

Die Ausgabe ist bei 480p, 720p oder 1080p mit einer Dauer von 2 bis 30 Sekunden und Seitenverhältnissen wie 16:9, 9:16, 1:1, 4:3 und 3:4 verfügbar. Sie können auch eine synchronisierte Audiospur erstellen oder den Clip lautlos exportieren.

Wann sollte ich „Reference-to-Video“ statt „Image-to-Video“ verwenden?

Verwenden Sie Wan 3.0 Reference To Video, wenn Sie Konsistenz über mehrere Referenzen hinweg oder eine Mischung aus Bild-, Video- und Audioführung in einer Aufnahme benötigen. Verwenden Sie Bild-zu-Video, wenn Sie lediglich ein einzelnes erstes Bild animieren möchten, das Sie bereits haben.

Können Entwickler Wan 3.0 Reference To Video über die RunComfy-API verwenden?

Ja. Sie können Wan 3.0 Reference To Video in der Benutzeroberfläche des RunComfy-Modells prototypisieren und dann dasselbe Modell über RunComfy HTTP API mit identischen Parametern aufrufen. Dadurch bleibt Ihr referenzgesteuertes Setup zwischen Browsertests und Produktionsautomatisierung konsistent.

Wie viel kostet Wan 3.0 Reference To Video auf RunComfy?

Generationen verbrauchen je nach Auflösung und Dauer USD oder Credits: 0,06 $ pro Sekunde bei 480p, 0,12 $ pro Sekunde bei 720p und 0,25 $ pro Sekunde bei 1080p. Neue Benutzer erhalten in der Regel eine kostenlose Testversion, um Wan 3.0 Reference To Video vor größeren Auflagen auszuprobieren.

Folge uns
  • LinkedIn
  • Facebook
  • Instagram
  • Twitter
Support
  • Discord
  • E-Mail
  • Systemstatus
  • Partner
Videomodelle
  • MiniMax H3 Open
  • FLUX 3 Image to Video
  • MiniMax H3 Open Image to Video
  • Wan 2.6 Flash
  • Happy Horse 1.1 reference to video
  • Seedance 1.5 Pro Text to Video
  • Alle Modelle anzeigen →
Bildmodelle
  • Seedream 5.0 Pro Image Edit
  • Flux 2 Flash Edit
  • Nano Banana Pro
  • seedream 4.0
  • GPT Image 2
  • Qwen Image Edit 2511 LoRA
  • Alle Modelle anzeigen →
Rechtliches
  • Nutzungsbedingungen
  • Datenschutzrichtlinie
  • Cookie-Richtlinie
RunComfy
Urheberrecht 2026 RunComfy. Alle Rechte vorbehalten.

RunComfy ist die führende ComfyUI Plattform, die ComfyUI online Umgebung und Services bietet, zusammen mit ComfyUI Workflows mit atemberaubenden Visualisierungen. RunComfy bietet auch AI Models, Künstlern ermöglichen, die neuesten AI-Tools zu nutzen, um unglaubliche Kunst zu schaffen.

Beispiele für Wan 3.0 Reference To Video

Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...