logo
RunComfy
  • ComfyUI
  • TrainerNeu
  • Modelle
  • API
  • Preise
discord logo
MODELLE
Erkunden
Alle Modelle
BIBLIOTHEK
Generierungen
MODELL-APIS
API-Dokumentation
API-Schlüssel
KONTO
Nutzung

Gemini Omni Flash Reference to Video: referenzbasierte Clips mit synchronisiertem Audio | RunComfy

google/gemini-omni-flash/reference-to-video

Gemini Omni Flash Reference to Video erzeugt aus einem oder mehreren Referenzbildern und einem Prompt einen kurzen Clip mit nativ synchronisiertem Ton. Motiv und Stil bleiben über 3–10 Sekunden in 16:9 oder 9:16 konsistent.

Beschreiben Sie Bewegung, Szenenentwicklung, Tempo und Ton. Sie können Kameraführung und Geräusche vorgeben, etwa „langsame Kamerafahrt nach vorn“, „sanfter Wind und Vogelgezwitscher“ oder „kein Dialog“, und negative Anweisungen wie „Keinen Text anzeigen“ ergänzen. Erläutern Sie im Prompt, welches hochgeladene Bild Motiv, Stil oder Bildaufbau bestimmen soll.
Image 1
Ein oder mehrere Referenzbilder, die das Thema, den Stil, das Layout und die visuelle Ausrichtung des Videos bestimmen. Zu den unterstützten Formaten gehören JPG, JPEG, PNG und WebP.
Das Seitenverhältnis des generierten Videos.
Die Dauer des generierten Videos in Sekunden.
Idle
The rate is $0.14 per second of generated video.

Einführung in Gemini Omni Flash Reference to Video

Googles Gemini Omni Flash Reference to Video erstellt aus einem oder mehreren Referenzbildern und einem Textprompt einen 3–10 Sekunden langen Clip. Die Bilder geben Motiv, Stil und Bildaufbau vor; der Text steuert Bewegung, Tempo und synchronisierten Ton. Damit ersetzt ein einziger referenzgesteuerter Durchlauf manuelles Keyframing und separate Tonarbeit – ideal für Marketing, Film, Spiele und Social Media, wenn Figuren im Bild konsistent bleiben sollen. Auf RunComfy ist das Modell im Browser und über eine HTTP-API verfügbar, ohne eigenes Hosting oder Skalieren.
Ideal für: konsistente Figuren in Kurzclips | referenzbasierte filmische Aufnahmen | Produkt- und Markenwerbung

Google / Gemini Omni Flash Reference to Video#


Dieses Modell liest ein oder mehrere Referenzbilder zusammen mit einer schriftlichen Aufforderung und generiert dann einen kurzen Filmclip, der das referenzierte Thema, das referenzierte Aussehen und die referenzierte Komposition beibehält und gleichzeitig Bewegung und Ton hinzufügt. Es gehört zur Gemini Omni Flash-Familie von Google, die auch Text-zu-Video und Bild-zu-Video abdeckt; Auf dieser RunComfy-Seite wird die Referenzbild-zu-Video-Aufgabe ausgeführt.


Da die Bilder Identität und visuelle Richtung verankern, kann derselbe Charakter oder das gleiche Produkt vom ersten bis zum letzten Bild erkennbar bleiben, anstatt zwischen den Aufnahmen zu driften.


Highlights#


  • Referenzbasierte Generierung: Geben Sie ein oder mehrere Bilder ein und das Modell folgt beim Erstellen der Aufnahme dem Motiv, dem Stil und dem Layout.
  • Promptgesteuerte Regie: Der Text steuert Bewegung, Szenenentwicklung, Tempo und Ton, sodass Sie entscheiden, wie die Referenz zum Leben erweckt wird.
  • Nativ synchronisiertes Audio: Sprache, Umgebungsgeräusche und Musik werden im Einklang mit dem Bild erzeugt, sodass ein Clip zum Teilen bereit ist, ohne dass ein separater Audiodurchgang erforderlich ist.
  • Hohe Themenkonsistenz: Referenzbilder tragen dazu bei, dass ein Charakter, ein Objekt oder eine Marke im gesamten Clip stabil aussieht.
  • Flexibler Bildausschnitt und Länge: Wählen Sie 16:9 im Querformat oder 9:16 im Hochformat, mit einer in ganzen Sekunden einstellbaren Länge von 3 bis 10 Sekunden.
  • Teil einer Familie: Die Gemini Omni Flash-Reihe umfasst mehrere Videoaufgaben; Diese Seite konzentriert sich auf Videos aus Referenzbildern.

Parameter#


Die Eingaben entsprechen dem RunComfy OpenAPI Input-Schema für die Referenzbild-zu-Video-Aufgabe.


ParameterErforderlichTypStandardBereich / OptionenBeschreibung
prompt*Ja (*)string—BeschreibungstextSteuert Bewegung, Tempo, Szenenentwicklung und Audio
image_urls*Ja (*)array (Bild-URIs)—jpg, jpeg, png, webpEin oder mehrere Referenzbilder für Motiv, Stil und Layout
aspect_ratioNeinstring16:916:9, 9:16Seitenverhältnis des generierten Videos
durationNeininteger83–10 (Sekunden)Länge des generierten Videos in ganzen Sekunden

Preise#


Die Abrechnung richtet sich nach der Länge des generierten Clips:


  • Video: $0.14 pro Sekunde generiertem Video.

Verwandte Modelle

react-1

Erstellen Sie ein kurzes Quellvideo mit einer erforderlichen Audiospur und steuern Sie dann Emotionen, Bearbeitungsumfang, Verhalten bei nicht übereinstimmender Dauer und Ausdruckskraft.

wan-2-2/fun-camera

Animieren Sie ein erforderliches Bild aus einem erforderlichen Prompt. Steuern Sie Ausgabegröße, Frame-Anzahl, Bildrate, Kamerabewegungsstärke, Seed, Schritte, Führung und Verschiebung.

seedance-2.0-mini/video-to-video

Bearbeitet einen Quellclip per Text-Prompt und erzeugt auf Wunsch natives Audio.

seedance-2.5/reference-to-video/480p

Seedance 2.5 Referenz 480p: Videoentwurf mit mehreren Referenzen zu geringeren Kosten

hailuo-02/pro/text-to-video

Erstellen Sie ein sechs Sekunden langes Video aus einem erforderlichen Text-Prompt mit Hailuo 02 Pro und optionaler Prompt-Erweiterung.

kling-video-o3/pro/text-to-video

Cineastische Text-zu-Video-Generierung in Pro-Qualität für 0,112 $ pro Sekunde Ausgabe.

Häufig gestellte Fragen

Was macht Gemini Omni Flash Reference to Video?

Gemini Omni Flash Reference to Video nimmt ein oder mehrere Referenzbilder und eine Textaufforderung und generiert dann einen kurzen Clip mit synchronisiertem Audio. Die Referenzbilder bestimmen das Motiv, den Stil und das Layout, während die Eingabeaufforderung Bewegung, Tempo, Szenenentwicklung und Ton vorgibt, sodass Ihre Bilder den Look bestimmen und der Text sie zum Leben erweckt.

Was sind die besten Anwendungsfälle für Gemini Omni Flash Reference to Video?

Es eignet sich gut, um das Erscheinungsbild einer Figur, eines Produkts oder einer Marke in einem kurzen Clip konsistent zu halten, referenzbasierte Filmaufnahmen zu erstellen und Promos aus vorhandenen Bildern zu erstellen. Vermarkter, Filmemacher, Spieleteams und Social Creators verwenden Gemini Omni Flash Reference to Video häufig, wenn Identität und visuelle Ausrichtung nah an ihren Quellbildern bleiben müssen.

Wie viele Referenzbilder kann ich mit Gemini Omni Flash Reference to Video verwenden?

Sie können ein oder mehrere Referenzbilder bereitstellen. Zu den unterstützten Formaten gehören jpg, jpeg, png und webp. Mit Gemini Omni Flash Reference to Video können Sie angeben, was jedes Bild zur Eingabeaufforderung beiträgt, z. B. den Charakter, das Outfit oder die Umgebung, um zu steuern, wie es das Ergebnis beeinflusst. Die genauen Eingabegrenzen finden Sie im aktuellen Parameterpanel RunComfy.

Wie geht Gemini Omni Flash Reference to Video mit Audio um?

Das Modell erzeugt Ton im Einklang mit dem Video, einschließlich Sprache, Umgebungseffekten und gegebenenfalls Musik. Sie können dies in der Eingabeaufforderung mit Gemini Omni Flash Reference to Video steuern, indem Sie den gewünschten Dialogton oder Hintergrundton benennen oder nach keinem Dialog fragen, wenn Sie einen ruhigen Clip benötigen.

Wie unterscheidet sich Gemini Omni Flash Reference to Video von der Text-zu-Video-Generierung?

Durch die Bereitstellung von Referenzbildern haben Sie eine bessere Kontrolle über die Identität, den Stil und das Layout des Betreffs als mit einer reinen Textaufforderung. Mit Gemini Omni Flash Reference to Video verankern die Bilder das Aussehen der Aufnahme, während die Eingabeaufforderung vorgibt, wie sie sich bewegt. Dies ist hilfreich, wenn Sie bereits bestimmte Charaktere oder Szenen in den Clip übernehmen möchten.

Welche Seitenverhältnisse und Dauern unterstützt Gemini Omni Flash Reference to Video?

Gemini Omni Flash Reference to Video unterstützt 16:9-Querformat- und 9:16-Hochformatrahmen mit Cliplängen von 3 bis 10 ganzen Sekunden. Überprüfen Sie das aktuelle RunComfy-Parameterfeld auf die genauen Optionen, da sich die verfügbaren Einstellungen im Laufe der Zeit ändern können.

Können Entwickler Gemini Omni Flash Reference to Video über die RunComfy-API verwenden?

Ja. Sie können Gemini Omni Flash Reference to Video in der Benutzeroberfläche des AI-Modells RunComfy prototypisieren und dann dasselbe Modell über RunComfy HTTP API mit identischen Parametern für Automatisierung und Produktion aufrufen. Dadurch können Sie vom Testen zur Integration übergehen, ohne das Modell selbst hosten oder skalieren zu müssen.

Wie viel kostet die Generierung mit Gemini Omni Flash Reference to Video auf RunComfy?

Die Nutzung von Gemini Omni Flash Reference to Video wird nach der Länge des generierten Videos abgerechnet: $0.14 pro Sekunde. Der Betrag wird vom USD- oder Credit-Guthaben Ihres RunComfy-Kontos abgezogen. Neue Nutzer erhalten üblicherweise ein kostenloses Testguthaben; die aktuellen Preise finden Sie im Generierungsbereich dieser Seite.

Folge uns
  • LinkedIn
  • Facebook
  • Instagram
  • Twitter
Support
  • Discord
  • E-Mail
  • Systemstatus
  • Partner
Videomodelle
  • MiniMax H3 Open
  • FLUX 3 Image to Video
  • MiniMax H3 Open Image to Video
  • Wan 2.6 Flash
  • Happy Horse 1.1 reference to video
  • Seedance 1.5 Pro Text to Video
  • Alle Modelle anzeigen →
Bildmodelle
  • Seedream 5.0 Pro Image Edit
  • Flux 2 Flash Edit
  • Nano Banana Pro
  • seedream 4.0
  • GPT Image 2
  • Qwen Image Edit 2511 LoRA
  • Alle Modelle anzeigen →
Rechtliches
  • Nutzungsbedingungen
  • Datenschutzrichtlinie
  • Cookie-Richtlinie
RunComfy
Urheberrecht 2026 RunComfy. Alle Rechte vorbehalten.

RunComfy ist die führende ComfyUI Plattform, die ComfyUI online Umgebung und Services bietet, zusammen mit ComfyUI Workflows mit atemberaubenden Visualisierungen. RunComfy bietet auch AI Models, Künstlern ermöglichen, die neuesten AI-Tools zu nutzen, um unglaubliche Kunst zu schaffen.

Beispiele für Gemini Omni Flash Reference to Video

Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...