Animiert ein Standbild per Prompt zu einem flüssigen Video in 720P oder 1080P.
Dieses Modell liest ein oder mehrere Referenzbilder zusammen mit einer schriftlichen Aufforderung und generiert dann einen kurzen Filmclip, der das referenzierte Thema, das referenzierte Aussehen und die referenzierte Komposition beibehält und gleichzeitig Bewegung und Ton hinzufügt. Es gehört zur Gemini Omni Flash-Familie von Google, die auch Text-zu-Video und Bild-zu-Video abdeckt; Auf dieser RunComfy-Seite wird die Referenzbild-zu-Video-Aufgabe ausgeführt.
Da die Bilder Identität und visuelle Richtung verankern, kann derselbe Charakter oder das gleiche Produkt vom ersten bis zum letzten Bild erkennbar bleiben, anstatt zwischen den Aufnahmen zu driften.
Die Eingaben entsprechen dem RunComfy OpenAPI Input-Schema für die Referenzbild-zu-Video-Aufgabe.
| Parameter | Erforderlich | Typ | Standard | Bereich / Optionen | Beschreibung |
|---|---|---|---|---|---|
| prompt* | Ja (*) | string | — | Beschreibungstext | Steuert Bewegung, Tempo, Szenenentwicklung und Audio |
| image_urls* | Ja (*) | array (Bild-URIs) | — | jpg, jpeg, png, webp | Ein oder mehrere Referenzbilder für Motiv, Stil und Layout |
| aspect_ratio | Nein | string | 16:9 | 16:9, 9:16 | Seitenverhältnis des generierten Videos |
| duration | Nein | integer | 8 | 3–10 (Sekunden) | Länge des generierten Videos in ganzen Sekunden |
Die Abrechnung richtet sich nach der Länge des generierten Clips:
Animiert ein Standbild per Prompt zu einem flüssigen Video in 720P oder 1080P.
Skalieren Sie ein Quellvideo auf eine gewählte Zielauflösung und Bildrate hoch.
Erstellen Sie Wan 2.1-Videos mit einer benutzerdefinierten LoRA-URL und detaillierten Ausgabe- und Sampling-Einstellungen.
Erzeugen Sie aus einem Pflicht-Prompt ein 5 oder 8 Sekunden langes Video. Ein negativer Prompt, vier feste Ausgabegrößen und ein Seed sind optional einstellbar.
Stellen Sie ein erforderliches Video wieder her und skalieren Sie es hoch. Steuern Sie Ausgabebreite, Frame-Limit, Bildrate, Seed, Restaurierungsstärke und Stapelgröße.
Multimodales KI-Videomodell mit nativer Audioausgabe für Text-, Bild- und Referenzeingaben.
Gemini Omni Flash Reference to Video nimmt ein oder mehrere Referenzbilder und eine Textaufforderung und generiert dann einen kurzen Clip mit synchronisiertem Audio. Die Referenzbilder bestimmen das Motiv, den Stil und das Layout, während die Eingabeaufforderung Bewegung, Tempo, Szenenentwicklung und Ton vorgibt, sodass Ihre Bilder den Look bestimmen und der Text sie zum Leben erweckt.
Es eignet sich gut, um das Erscheinungsbild einer Figur, eines Produkts oder einer Marke in einem kurzen Clip konsistent zu halten, referenzbasierte Filmaufnahmen zu erstellen und Promos aus vorhandenen Bildern zu erstellen. Vermarkter, Filmemacher, Spieleteams und Social Creators verwenden Gemini Omni Flash Reference to Video häufig, wenn Identität und visuelle Ausrichtung nah an ihren Quellbildern bleiben müssen.
Sie können ein oder mehrere Referenzbilder bereitstellen. Zu den unterstützten Formaten gehören jpg, jpeg, png und webp. Mit Gemini Omni Flash Reference to Video können Sie angeben, was jedes Bild zur Eingabeaufforderung beiträgt, z. B. den Charakter, das Outfit oder die Umgebung, um zu steuern, wie es das Ergebnis beeinflusst. Die genauen Eingabegrenzen finden Sie im aktuellen Parameterpanel RunComfy.
Das Modell erzeugt Ton im Einklang mit dem Video, einschließlich Sprache, Umgebungseffekten und gegebenenfalls Musik. Sie können dies in der Eingabeaufforderung mit Gemini Omni Flash Reference to Video steuern, indem Sie den gewünschten Dialogton oder Hintergrundton benennen oder nach keinem Dialog fragen, wenn Sie einen ruhigen Clip benötigen.
Durch die Bereitstellung von Referenzbildern haben Sie eine bessere Kontrolle über die Identität, den Stil und das Layout des Betreffs als mit einer reinen Textaufforderung. Mit Gemini Omni Flash Reference to Video verankern die Bilder das Aussehen der Aufnahme, während die Eingabeaufforderung vorgibt, wie sie sich bewegt. Dies ist hilfreich, wenn Sie bereits bestimmte Charaktere oder Szenen in den Clip übernehmen möchten.
Gemini Omni Flash Reference to Video unterstützt 16:9-Querformat- und 9:16-Hochformatrahmen mit Cliplängen von 3 bis 10 ganzen Sekunden. Überprüfen Sie das aktuelle RunComfy-Parameterfeld auf die genauen Optionen, da sich die verfügbaren Einstellungen im Laufe der Zeit ändern können.
Ja. Sie können Gemini Omni Flash Reference to Video in der Benutzeroberfläche des AI-Modells RunComfy prototypisieren und dann dasselbe Modell über RunComfy HTTP API mit identischen Parametern für Automatisierung und Produktion aufrufen. Dadurch können Sie vom Testen zur Integration übergehen, ohne das Modell selbst hosten oder skalieren zu müssen.
Die Nutzung von Gemini Omni Flash Reference to Video wird nach der Länge des generierten Videos abgerechnet: $0.14 pro Sekunde. Der Betrag wird vom USD- oder Credit-Guthaben Ihres RunComfy-Kontos abgezogen. Neue Nutzer erhalten üblicherweise ein kostenloses Testguthaben; die aktuellen Preise finden Sie im Generierungsbereich dieser Seite.
RunComfy ist die führende ComfyUI Plattform, die ComfyUI online Umgebung und Services bietet, zusammen mit ComfyUI Workflows mit atemberaubenden Visualisierungen. RunComfy bietet auch AI Models, Künstlern ermöglichen, die neuesten AI-Tools zu nutzen, um unglaubliche Kunst zu schaffen.





