logo
RunComfy
  • ComfyUI
  • TrainerNeu
  • Modelle
  • API
  • Preise
discord logo
MODELLE
Erkunden
Alle Modelle
BIBLIOTHEK
Generierungen
MODELL-APIS
API-Dokumentation
API-Schlüssel
KONTO
Nutzung

Gemini Omni Flash: Text-zu-Video mit synchronisiertem Ton | RunComfy

google/gemini-omni-flash/text-to-video

Gemini Omni Flash erzeugt aus einem Text-Prompt kurze filmische Videos mit nativ synchronisiertem Ton, im Format 16:9 oder 9:16 und mit 3–10 Sekunden Länge.

Beschreiben Sie das gewünschte Video. Tempo und Ton lassen sich direkt im Prompt steuern, etwa mit „in einer durchgehenden Einstellung“, „ruhige Hintergrundmusik“ oder „kein Dialog“. Auch negative Anweisungen wie „Keinen Text zeigen“ sind möglich.
Seitenverhältnis des generierten Videos.
Dauer des generierten Videos in Sekunden.
Idle
The rate is $0.13 per second of generated video.

Einführung in Gemini Omni Flash

Gemini Omni Flash von Google verwandelt einen einzigen Text-Prompt in einen 3–10 Sekunden langen filmischen Clip mit synchronisiertem Ton. Geminis Wissen über die reale Welt unterstützt zusammenhängende, physikalisch plausible Bewegungen. Statt Videos manuell zu schneiden, separat zu vertonen und mehrere Werkzeuge zu verbinden, steuern Marketingteams, Filmschaffende, Game-Teams und Social-Creator den gesamten Entwurf mit einem Prompt. Auf RunComfy lässt sich Gemini Omni Flash im Browser oder per HTTP-API nutzen, ohne das Modell selbst zu hosten oder zu skalieren.
Ideal für: Kurze Social Ads | Filmische Story-Momente | Schnelle Previsualisierung

Google / Gemini Omni Flash#


Gemini Omni Flash ist die multimodale Videogenerierungsfamilie von Google, die auf dem realen Wissen von Gemini und einem besseren Verständnis der Physik für glaubwürdigere Bewegungen und Interaktionen basiert. Die größere Familie umfasst vier verwandte Aufgaben: Text-zu-Video, Bild-zu-Video, Videobearbeitung und Referenz-zu-Video. Diese RunComfy-Seite führt die Text-zu-Video-Aufgabe aus und verwandelt eine schriftliche Aufforderung in einen kurzen Filmclip mit synchronisiertem Ton.


Da es darüber nachdenkt, wie sich die Welt tatsächlich verhält, sorgt das Modell dafür, dass Objekte, Beleuchtung und Bewegung über eine Aufnahme hinweg kohärent bleiben, anstatt von Bild zu Bild zu driften.


Highlights#


  • Nativ synchronisiertes Audio: Generieren Sie Sprache, Soundeffekte und Musik, die auf die Aktion abgestimmt sind, sodass ein Clip ohne separaten Audiodurchlauf zum Teilen bereit ist.
  • Physikbewusste Bewegung: Ein verbessertes physikalisches Verständnis führt zu gleichmäßigeren, natürlicheren Bewegungen und Objektinteraktionen.
  • Basiert auf echtem Wissen: Die Ergebnisse basieren auf Geminis realem Wissen und tragen dazu bei, dass Szenen plausibel und themenbezogen wirken.
  • Steuerung des Prompt-Levels: Direktes Tempo und Ton direkt aus dem Prompt (z. B. eine einzelne Serienaufnahme, ruhige Hintergrundmusik oder kein Dialog).
  • Vier-Aufgaben-Familie: Die Gemini Omni Flash-Reihe umfasst Text-zu-Video, Bild-zu-Video, Videobearbeitung und Referenz-zu-Video; Auf dieser Seite wird nur die Text-zu-Video-Aufgabe vorgestellt.
  • Flexibler Bildausschnitt: Unterstützt 16:9-Querformat und 9:16-Hochformat mit einer Dauer von 3 bis 10 Sekunden.

Parameter#


Die Eingaben entsprechen dem RunComfy OpenAPI Input für die Text-zu-Video-Aufgabe.


ParameterErforderlichTypStandardBereich / OptionenBeschreibung
prompt*Ja (*)string—Beschreibender TextText-Prompt für das zu erzeugende Video
aspect_ratioNeinstring16:916:9, 9:16Seitenverhältnis des Videos
durationNeininteger83–10 (Sekunden)Videolänge in ganzen Sekunden

Preise#


Die Abrechnung richtet sich nach der Länge des generierten Clips:


  • Video: 0,13 $ pro Sekunde generiertes Video.

Verwendung#


  1. Schreiben Sie eine beschreibende Aufforderung – Beschreiben Sie Thema, Aktion, Einstellung, Stimmung, Beleuchtung und Kamera. Detaillierte Eingabeaufforderungen geben dem Modell die Möglichkeit, optimal zu arbeiten.
  2. Legen Sie das Tempo in Worten fest – Fragen Sie direkt in der Eingabeaufforderung nach einer einzelnen Serienaufnahme oder einem bestimmten Rhythmus.
  3. Leiten Sie den Ton – Fordern Sie Dialoge, Umgebungsgeräusche oder Hintergrundmusik an oder sagen Sie „Kein Dialog“, wenn Sie es leise haben möchten.
  4. Negative Anweisungen hinzufügen – Fügen Sie Ausschlüsse in die Eingabeaufforderung selbst ein, z. B. „Keinen Text anzeigen“.
  5. Wählen Sie ein Seitenverhältnis – Wählen Sie 16:9 für Querformat oder 9:16 für Hochformat, Mobile-First-Auslieferung.
  6. Dauer festlegen – Wählen Sie eine beliebige ganze Sekundenzahl zwischen 3 und 10.
  7. Generieren und verfeinern – Überprüfen Sie den Clip, passen Sie dann Wortlaut, Verhältnis oder Dauer an und führen Sie ihn erneut aus.

Eingabeaufforderung und Referenztipps#


  • Führen Sie mit der Kamera und der gewünschten Bewegung aus (z. B. langsames Einschieben, Handheld oder gesperrt).
  • Benennen Sie die Stimmung und die Beleuchtung, damit die Szene Ihren Vorstellungen entspricht.
  • Behalten Sie eine klare Aktion pro Clip bei; Kurze Dauer belohnt gezielte Aufforderungen.
  • Formulieren Sie die Klanglandschaft, wenn es auf Audio ankommt, da das Modell synchronisiertes Audio erzeugen kann.
  • Verwenden Sie klare negative Formulierungen (z. B. keinen Bildschirmtext) statt vager Hinweise.
  • Wenn sich ein Ergebnis überladen anfühlt, vereinfachen Sie die Eingabeaufforderung und entfernen Sie konkurrierende Stilelemente.

Wie Gemini Omni Flash im Vergleich zu anderen Modellen abschneidet#


  • Im Vergleich zu früheren Text-zu-Video-Modellen: Es betont physikbewusste Bewegung und natives synchronisiertes Audio in einem Schritt. Vergleichen Sie anhand öffentlich verfügbarer Informationen anhand Ihrer eigenen Angaben.
  • Im Vergleich zu stillen Videogeneratoren: Es bündelt die Audioerzeugung, sodass Sie eine separate Scoring- oder Sounddesign-Phase überspringen.
  • Innerhalb einer eigenen Familie: Text-to-Video ist eine von vier Aufgaben in dieser Familie; Bild-zu-Video-, Videobearbeitungs- und Referenz-zu-Video-Ziel-Workflows, die auf vorhandenen Medien statt nur auf Text basieren.

Weitere Modelle zum Ausprobieren#


  • Veo 3 Fast – Schnelle Text-zu-Video-Umwandlung mit Audio für schnelle Entwürfe.
  • Seedance 2.5 – filmisches multimodales Video mit Referenzunterstützung.
  • Kling Video – bewegungsorientierte Videogenerierung.
  • Wan 2.5 – Allzweck-Text-zu-Video-Alternative.

Offizielle Ressourcen#


  • Google DeepMind: https://deepmind.google/

Verwandte Modelle

wan-2-2/lora/image-to-video

Animieren Sie ein Ausgangsbild anhand eines Prompts und steuern Sie LoRAs, Frames, FPS, Auflösung, Seitenverhältnis, Steps und Seed.

aurora

Erzeugen Sie aus einem Bild, einer Audiodatei und einem Prompt ein Video mit einstellbarer Text- und Audiosteuerung.

wan-2-2/first-last-frame

Erstelle fließende Videos aus zwei Bildern mit realistischer Bewegung

happyhorse-1.1/image-to-video

Animiert ein Standbild per Prompt zu einem flüssigen Video in 720P oder 1080P.

wan-2-2/image-to-video

KI-gestützte Bildanimationen in 1080p mit präziser Kontrolle und Effekten

hailuo-02/pro/image-to-video

Animieren Sie mit Hailuo 02 Pro ein Ausgangsbild anhand eines Prompts zu einem sechssekündigen Video.

Häufig gestellte Fragen

Wofür wird Gemini Omni Flash verwendet?

Gemini Omni Flash ist das multimodale Videomodell von Google, das eine Textaufforderung in einen kurzen Filmclip mit synchronisiertem Ton umwandelt. Auf dieser RunComfy-Seite wird die Text-zu-Video-Aufgabe ausgeführt, wodurch sie sich für soziale Anzeigen, Story-Beats und schnelle Vorvisualisierungen eignet, bei denen Bewegung und Ton gleichermaßen wichtig sind.

Welche Aufgaben deckt die Gemini Omni Flash-Familie ab?

Die Gemini Omni Flash-Familie umfasst vier verwandte Aufgaben: Text-zu-Video, Bild-zu-Video, Videobearbeitung und Referenz-zu-Video. Auf dieser RunComfy-Seite wird die Text-zu-Video-Aufgabe vorgestellt, die ein Video allein aus einer schriftlichen Eingabeaufforderung generiert, während die anderen Aufgaben mit vorhandenen Bildern oder Filmmaterial beginnen.

Erzeugt Gemini Omni Flash Audio mit dem Video?

Ja. Gemini Omni Flash erzeugt synchronisiertes Audio – wie Sprache, Soundeffekte und Musik – abgestimmt auf die generierte Aktion. Sie können den Ton von der Ansage aus steuern, indem Sie beispielsweise nach ruhiger Hintergrundmusik fragen oder keinen Dialog festlegen.

Was lässt die Bewegung des Gemini Omni Flash natürlicher aussehen?

Gemini Omni Flash basiert auf dem realen Wissen von Gemini und verfügt über ein verbessertes Verständnis der Physik, das dabei hilft, Bewegung, Beleuchtung und Objektinteraktion während einer Aufnahme kohärent zu halten. Dadurch wird die bei älteren Text-zu-Video-Modellen übliche Bild-zu-Bild-Drift reduziert.

Welche Eingabegrenzen sollte ich kennen, bevor ich Gemini Omni Flash verwende?

Die Text-zu-Video-Aufgabe erfordert eine erforderliche Eingabeaufforderung, ein Seitenverhältnis von 16:9 oder 9:16 und eine Dauer zwischen 3 und 10 Sekunden. Überprüfen Sie vor der Generierung das aktuelle RunComfy-Parameterfeld auf die genauen Standardwerte und etwaige anbieterseitige Einschränkungen.

Wie soll ich Eingabeaufforderungen für Gemini Omni Flash schreiben?

Beschreiben Sie Motiv, Aktion, Kamera, Stimmung und Beleuchtung und steuern Sie das Tempo direkt in der Eingabeaufforderung (z. B. eine einzelne Serienaufnahme). Fügen Sie Ausschlüsse in die Eingabeaufforderung selbst ein, z. B. „Keinen Text anzeigen“, da Gemini Omni Flash negative Anweisungen aus der Eingabeaufforderung liest.

Können Entwickler Gemini Omni Flash über die RunComfy-API verwenden?

Ja. Sie können Gemini Omni Flash in der Benutzeroberfläche des RunComfy-Modells prototypisieren und dann dasselbe Modell über die RunComfy-API mit identischen Parametern aufrufen. Dadurch können Sie von einem Browsertest zur automatisierten Generierung übergehen, ohne das Modell selbst hosten oder skalieren zu müssen.

Wie viel kostet die Generierung mit Gemini Omni Flash auf RunComfy?

Generationen mit Gemini Omni Flash werden mit 0,13 US-Dollar pro Sekunde des generierten Videos in Rechnung gestellt und Ihr RunComfy-USD-Guthaben oder Ihr Guthaben in Anspruch genommen. Neue Benutzer beginnen normalerweise mit einem kostenlosen Testbetrag; Aktuelle Einzelheiten finden Sie im Abschnitt „Generierung“ auf dieser Seite.

Folge uns
  • LinkedIn
  • Facebook
  • Instagram
  • Twitter
Support
  • Discord
  • E-Mail
  • Systemstatus
  • Partner
Videomodelle
  • MiniMax H3 Open
  • FLUX 3 Image to Video
  • MiniMax H3 Open Image to Video
  • Wan 2.6 Flash
  • Happy Horse 1.1 reference to video
  • Seedance 1.5 Pro Text to Video
  • Alle Modelle anzeigen →
Bildmodelle
  • Seedream 5.0 Pro Image Edit
  • Flux 2 Flash Edit
  • Nano Banana Pro
  • seedream 4.0
  • GPT Image 2
  • Qwen Image Edit 2511 LoRA
  • Alle Modelle anzeigen →
Rechtliches
  • Nutzungsbedingungen
  • Datenschutzrichtlinie
  • Cookie-Richtlinie
RunComfy
Urheberrecht 2026 RunComfy. Alle Rechte vorbehalten.

RunComfy ist die führende ComfyUI Plattform, die ComfyUI online Umgebung und Services bietet, zusammen mit ComfyUI Workflows mit atemberaubenden Visualisierungen. RunComfy bietet auch AI Models, Künstlern ermöglichen, die neuesten AI-Tools zu nutzen, um unglaubliche Kunst zu schaffen.

Beispiele für Gemini Omni Flash

Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...