Erstellen Sie ein kurzes Quellvideo mit einer erforderlichen Audiospur und steuern Sie dann Emotionen, Bearbeitungsumfang, Verhalten bei nicht übereinstimmender Dauer und Ausdruckskraft.
Dieses Modell liest ein oder mehrere Referenzbilder zusammen mit einer schriftlichen Aufforderung und generiert dann einen kurzen Filmclip, der das referenzierte Thema, das referenzierte Aussehen und die referenzierte Komposition beibehält und gleichzeitig Bewegung und Ton hinzufügt. Es gehört zur Gemini Omni Flash-Familie von Google, die auch Text-zu-Video und Bild-zu-Video abdeckt; Auf dieser RunComfy-Seite wird die Referenzbild-zu-Video-Aufgabe ausgeführt.
Da die Bilder Identität und visuelle Richtung verankern, kann derselbe Charakter oder das gleiche Produkt vom ersten bis zum letzten Bild erkennbar bleiben, anstatt zwischen den Aufnahmen zu driften.
Die Eingaben entsprechen dem RunComfy OpenAPI Input-Schema für die Referenzbild-zu-Video-Aufgabe.
| Parameter | Erforderlich | Typ | Standard | Bereich / Optionen | Beschreibung |
|---|---|---|---|---|---|
| prompt* | Ja (*) | string | — | Beschreibungstext | Steuert Bewegung, Tempo, Szenenentwicklung und Audio |
| image_urls* | Ja (*) | array (Bild-URIs) | — | jpg, jpeg, png, webp | Ein oder mehrere Referenzbilder für Motiv, Stil und Layout |
| aspect_ratio | Nein | string | 16:9 | 16:9, 9:16 | Seitenverhältnis des generierten Videos |
| duration | Nein | integer | 8 | 3–10 (Sekunden) | Länge des generierten Videos in ganzen Sekunden |
Die Abrechnung richtet sich nach der Länge des generierten Clips:
Erstellen Sie ein kurzes Quellvideo mit einer erforderlichen Audiospur und steuern Sie dann Emotionen, Bearbeitungsumfang, Verhalten bei nicht übereinstimmender Dauer und Ausdruckskraft.
Animieren Sie ein erforderliches Bild aus einem erforderlichen Prompt. Steuern Sie Ausgabegröße, Frame-Anzahl, Bildrate, Kamerabewegungsstärke, Seed, Schritte, Führung und Verschiebung.
Bearbeitet einen Quellclip per Text-Prompt und erzeugt auf Wunsch natives Audio.
Seedance 2.5 Referenz 480p: Videoentwurf mit mehreren Referenzen zu geringeren Kosten
Erstellen Sie ein sechs Sekunden langes Video aus einem erforderlichen Text-Prompt mit Hailuo 02 Pro und optionaler Prompt-Erweiterung.
Cineastische Text-zu-Video-Generierung in Pro-Qualität für 0,112 $ pro Sekunde Ausgabe.
Gemini Omni Flash Reference to Video nimmt ein oder mehrere Referenzbilder und eine Textaufforderung und generiert dann einen kurzen Clip mit synchronisiertem Audio. Die Referenzbilder bestimmen das Motiv, den Stil und das Layout, während die Eingabeaufforderung Bewegung, Tempo, Szenenentwicklung und Ton vorgibt, sodass Ihre Bilder den Look bestimmen und der Text sie zum Leben erweckt.
Es eignet sich gut, um das Erscheinungsbild einer Figur, eines Produkts oder einer Marke in einem kurzen Clip konsistent zu halten, referenzbasierte Filmaufnahmen zu erstellen und Promos aus vorhandenen Bildern zu erstellen. Vermarkter, Filmemacher, Spieleteams und Social Creators verwenden Gemini Omni Flash Reference to Video häufig, wenn Identität und visuelle Ausrichtung nah an ihren Quellbildern bleiben müssen.
Sie können ein oder mehrere Referenzbilder bereitstellen. Zu den unterstützten Formaten gehören jpg, jpeg, png und webp. Mit Gemini Omni Flash Reference to Video können Sie angeben, was jedes Bild zur Eingabeaufforderung beiträgt, z. B. den Charakter, das Outfit oder die Umgebung, um zu steuern, wie es das Ergebnis beeinflusst. Die genauen Eingabegrenzen finden Sie im aktuellen Parameterpanel RunComfy.
Das Modell erzeugt Ton im Einklang mit dem Video, einschließlich Sprache, Umgebungseffekten und gegebenenfalls Musik. Sie können dies in der Eingabeaufforderung mit Gemini Omni Flash Reference to Video steuern, indem Sie den gewünschten Dialogton oder Hintergrundton benennen oder nach keinem Dialog fragen, wenn Sie einen ruhigen Clip benötigen.
Durch die Bereitstellung von Referenzbildern haben Sie eine bessere Kontrolle über die Identität, den Stil und das Layout des Betreffs als mit einer reinen Textaufforderung. Mit Gemini Omni Flash Reference to Video verankern die Bilder das Aussehen der Aufnahme, während die Eingabeaufforderung vorgibt, wie sie sich bewegt. Dies ist hilfreich, wenn Sie bereits bestimmte Charaktere oder Szenen in den Clip übernehmen möchten.
Gemini Omni Flash Reference to Video unterstützt 16:9-Querformat- und 9:16-Hochformatrahmen mit Cliplängen von 3 bis 10 ganzen Sekunden. Überprüfen Sie das aktuelle RunComfy-Parameterfeld auf die genauen Optionen, da sich die verfügbaren Einstellungen im Laufe der Zeit ändern können.
Ja. Sie können Gemini Omni Flash Reference to Video in der Benutzeroberfläche des AI-Modells RunComfy prototypisieren und dann dasselbe Modell über RunComfy HTTP API mit identischen Parametern für Automatisierung und Produktion aufrufen. Dadurch können Sie vom Testen zur Integration übergehen, ohne das Modell selbst hosten oder skalieren zu müssen.
Die Nutzung von Gemini Omni Flash Reference to Video wird nach der Länge des generierten Videos abgerechnet: $0.14 pro Sekunde. Der Betrag wird vom USD- oder Credit-Guthaben Ihres RunComfy-Kontos abgezogen. Neue Nutzer erhalten üblicherweise ein kostenloses Testguthaben; die aktuellen Preise finden Sie im Generierungsbereich dieser Seite.
RunComfy ist die führende ComfyUI Plattform, die ComfyUI online Umgebung und Services bietet, zusammen mit ComfyUI Workflows mit atemberaubenden Visualisierungen. RunComfy bietet auch AI Models, Künstlern ermöglichen, die neuesten AI-Tools zu nutzen, um unglaubliche Kunst zu schaffen.





