Erstellen Sie aus einer Text-Prompt ein Video mit wählbarem Seitenverhältnis und einer Dauer von 5 oder 10 Sekunden.
Dieses Modell liest ein oder mehrere Referenzbilder zusammen mit einer schriftlichen Aufforderung und generiert dann einen kurzen Filmclip, der das referenzierte Thema, das referenzierte Aussehen und die referenzierte Komposition beibehält und gleichzeitig Bewegung und Ton hinzufügt. Es gehört zur Gemini Omni Flash-Familie von Google, die auch Text-zu-Video und Bild-zu-Video abdeckt; Auf dieser RunComfy-Seite wird die Referenzbild-zu-Video-Aufgabe ausgeführt.
Da die Bilder Identität und visuelle Richtung verankern, kann derselbe Charakter oder das gleiche Produkt vom ersten bis zum letzten Bild erkennbar bleiben, anstatt zwischen den Aufnahmen zu driften.
Die Eingaben entsprechen dem RunComfy OpenAPI Input-Schema für die Referenzbild-zu-Video-Aufgabe.
| Parameter | Erforderlich | Typ | Standard | Bereich / Optionen | Beschreibung |
|---|---|---|---|---|---|
| prompt* | Ja (*) | string | — | Beschreibungstext | Steuert Bewegung, Tempo, Szenenentwicklung und Audio |
| image_urls* | Ja (*) | array (Bild-URIs) | — | jpg, jpeg, png, webp | Ein oder mehrere Referenzbilder für Motiv, Stil und Layout |
| aspect_ratio | Nein | string | 16:9 | 16:9, 9:16 | Seitenverhältnis des generierten Videos |
| duration | Nein | integer | 8 | 3–10 (Sekunden) | Länge des generierten Videos in ganzen Sekunden |
Die Abrechnung richtet sich nach der Länge des generierten Clips:
Erstellen Sie aus einer Text-Prompt ein Video mit wählbarem Seitenverhältnis und einer Dauer von 5 oder 10 Sekunden.
Stellen Sie ein erforderliches Video wieder her und skalieren Sie es hoch. Steuern Sie Ausgabebreite, Frame-Limit, Bildrate, Seed, Restaurierungsstärke und Stapelgröße.
Erzeugen Sie aus einem erforderlichen Prompt ein Video mit 6, 8 oder 10 Sekunden, 1080p bis 2160p, 25 oder 50 FPS, festem 16:9 und optional erzeugtem Audio.
Generieren Sie aus einer Textaufforderung ein 5-, 10- oder 15-sekündiges Video mit optionalem Quellaudio und Steuerelementen für Größe, Aufnahmestruktur, negative Aufforderung, Startwert, Aufforderungserweiterung und generiertes Audio.
Erzeuge kinoreife Videoclips mit präziser Steuerung und natürlichem Sound
Animieren Sie den erforderlichen ersten Frame anhand eines Text-Prompts und steuern Sie optional das Ende mit einem Bild für den letzten Frame.
Gemini Omni Flash Reference to Video nimmt ein oder mehrere Referenzbilder und eine Textaufforderung und generiert dann einen kurzen Clip mit synchronisiertem Audio. Die Referenzbilder bestimmen das Motiv, den Stil und das Layout, während die Eingabeaufforderung Bewegung, Tempo, Szenenentwicklung und Ton vorgibt, sodass Ihre Bilder den Look bestimmen und der Text sie zum Leben erweckt.
Es eignet sich gut, um das Erscheinungsbild einer Figur, eines Produkts oder einer Marke in einem kurzen Clip konsistent zu halten, referenzbasierte Filmaufnahmen zu erstellen und Promos aus vorhandenen Bildern zu erstellen. Vermarkter, Filmemacher, Spieleteams und Social Creators verwenden Gemini Omni Flash Reference to Video häufig, wenn Identität und visuelle Ausrichtung nah an ihren Quellbildern bleiben müssen.
Sie können ein oder mehrere Referenzbilder bereitstellen. Zu den unterstützten Formaten gehören jpg, jpeg, png und webp. Mit Gemini Omni Flash Reference to Video können Sie angeben, was jedes Bild zur Eingabeaufforderung beiträgt, z. B. den Charakter, das Outfit oder die Umgebung, um zu steuern, wie es das Ergebnis beeinflusst. Die genauen Eingabegrenzen finden Sie im aktuellen Parameterpanel RunComfy.
Das Modell erzeugt Ton im Einklang mit dem Video, einschließlich Sprache, Umgebungseffekten und gegebenenfalls Musik. Sie können dies in der Eingabeaufforderung mit Gemini Omni Flash Reference to Video steuern, indem Sie den gewünschten Dialogton oder Hintergrundton benennen oder nach keinem Dialog fragen, wenn Sie einen ruhigen Clip benötigen.
Durch die Bereitstellung von Referenzbildern haben Sie eine bessere Kontrolle über die Identität, den Stil und das Layout des Betreffs als mit einer reinen Textaufforderung. Mit Gemini Omni Flash Reference to Video verankern die Bilder das Aussehen der Aufnahme, während die Eingabeaufforderung vorgibt, wie sie sich bewegt. Dies ist hilfreich, wenn Sie bereits bestimmte Charaktere oder Szenen in den Clip übernehmen möchten.
Gemini Omni Flash Reference to Video unterstützt 16:9-Querformat- und 9:16-Hochformatrahmen mit Cliplängen von 3 bis 10 ganzen Sekunden. Überprüfen Sie das aktuelle RunComfy-Parameterfeld auf die genauen Optionen, da sich die verfügbaren Einstellungen im Laufe der Zeit ändern können.
Ja. Sie können Gemini Omni Flash Reference to Video in der Benutzeroberfläche des AI-Modells RunComfy prototypisieren und dann dasselbe Modell über RunComfy HTTP API mit identischen Parametern für Automatisierung und Produktion aufrufen. Dadurch können Sie vom Testen zur Integration übergehen, ohne das Modell selbst hosten oder skalieren zu müssen.
Die Nutzung von Gemini Omni Flash Reference to Video wird nach der Länge des generierten Videos abgerechnet: $0.14 pro Sekunde. Der Betrag wird vom USD- oder Credit-Guthaben Ihres RunComfy-Kontos abgezogen. Neue Nutzer erhalten üblicherweise ein kostenloses Testguthaben; die aktuellen Preise finden Sie im Generierungsbereich dieser Seite.
RunComfy ist die führende ComfyUI Plattform, die ComfyUI online Umgebung und Services bietet, zusammen mit ComfyUI Workflows mit atemberaubenden Visualisierungen. RunComfy bietet auch AI Models, Künstlern ermöglichen, die neuesten AI-Tools zu nutzen, um unglaubliche Kunst zu schaffen.





