logo
RunComfy
  • ComfyUI
  • EntraîneurNouveau
  • Modèles
  • API
  • Tarification
discord logo
MODÈLES
Explorer
Tous les modèles
BIBLIOTHÈQUE
Générations
APIS DE MODÈLES
Documentation API
Clés API
COMPTE
Utilisation

Gemini Omni Flash : génération texte-vidéo avec audio synchronisé | RunComfy

google/gemini-omni-flash/text-to-video

Gemini Omni Flash génère à partir d’un prompt de courtes vidéos cinématographiques avec audio natif synchronisé, aux formats 16:9 ou 9:16 et d’une durée de 3 à 10 secondes.

Décrivez la vidéo à générer. Le rythme et le son se pilotent directement dans le prompt, par exemple « en un seul plan continu », « musique de fond calme » ou « sans dialogue ». Vous pouvez aussi ajouter des consignes négatives comme « ne pas afficher de texte ».
Format d’image de la vidéo générée.
Durée de la vidéo générée, en secondes.
Idle
The rate is $0.13 per second of generated video.

Présentation de Gemini Omni Flash

Gemini Omni Flash de Google transforme un seul prompt en un clip cinématographique de 3 à 10 secondes avec audio synchronisé. Les connaissances de Gemini sur le monde réel favorisent des mouvements cohérents et physiquement crédibles. Au lieu de monter la vidéo, de concevoir le son et d’enchaîner plusieurs outils séparément, les équipes marketing, cinéastes, studios de jeux et créateurs sociaux peuvent piloter le résultat dans un seul prompt. Gemini Omni Flash s’utilise sur RunComfy dans le navigateur ou via l’API HTTP, sans héberger ni faire évoluer le modèle.
Idéal pour : Publicités courtes sur les réseaux sociaux | Moments narratifs cinématographiques | Prévisualisation rapide

Google / Gemini Omni Flash#


Gemini Omni Flash est la famille de génération vidéo multimodale de Google, construite sur les connaissances du monde réel de Gemini et une meilleure compréhension de la physique pour des mouvements et des interactions plus crédibles. La famille plus large couvre quatre tâches liées : la conversion de texte en vidéo, l'image en vidéo, le montage vidéo et la référence à la vidéo. Cette page RunComfy exécute la tâche de conversion texte-vidéo, transformant une invite écrite en un court clip cinématique avec audio synchronisé.


Parce qu'il réfléchit sur le comportement réel du monde, le modèle maintient les objets, l'éclairage et les mouvements cohérents sur une prise de vue au lieu de dériver d'une image à l'autre.


Faits saillants#


  • Audio synchronisé natif : Générez des paroles, des effets sonores et de la musique alignés sur l'action, afin qu'un clip soit prêt à être partagé sans passe audio séparée.
  • Mouvement sensible à la physique : Une compréhension physique améliorée produit des mouvements et des interactions avec les objets plus stables et plus naturels.
  • Basés sur des connaissances réelles : Les résultats s'appuient sur les connaissances du monde réel de Gemini, aidant ainsi les scènes à paraître plausibles et pertinentes.
  • Contrôle au niveau de l'invite : Rythme et son directs directement à partir de l'invite (par exemple, une seule prise de vue continue, une musique de fond calme ou aucun dialogue).
  • Famille de quatre tâches : La gamme Gemini Omni Flash couvre le texte vers la vidéo, l'image vers la vidéo, le montage vidéo et la référence à la vidéo ; cette page expose seule la tâche de conversion texte-vidéo.
  • Cadrage flexible : Prend en charge les formats paysage 16:9 et portrait 9:16, avec des durées de 3 à 10 secondes.

Paramètres#


Les entrées correspondent au schéma RunComfy OpenAPI Input pour la tâche de conversion texte-vidéo.


ParamètreObligatoireTypeValeur par défautPlage / OptionsDescription
prompt*Oui (*)string—Texte descriptifPrompt décrivant la vidéo à générer
aspect_ratioNonstring16:916:9, 9:16Format d’image de la vidéo
durationNoninteger83–10 (secondes)Durée de la vidéo en secondes entières

Tarifs#


La facturation est basée sur la durée du clip généré :


  • Vidéo : 0,13 $ par seconde de vidéo générée.

Comment utiliser#


  1. Écrivez une invite descriptive — Décrivez le sujet, l'action, le décor, l'ambiance, l'éclairage et l'appareil photo. Des invites détaillées donnent au modèle le plus de possibilités de travail.
  2. Définissez le rythme avec des mots — Demandez une seule prise de vue continue ou un rythme spécifique directement dans l'invite.
  3. Dirigez l’audio : demandez un dialogue, un son ambiant ou une musique de fond, ou dites aucun dialogue lorsque vous souhaitez qu'il soit silencieux.
  4. Ajouter des instructions négatives – Insérez des exclusions dans l'invite elle-même, par exemple ne pas afficher le texte.
  5. Choisissez un rapport hauteur/largeur — Choisissez 16:9 pour le paysage ou 9:16 pour une diffusion verticale et mobile d'abord.
  6. Définissez la durée — Choisissez un nombre entier de secondes compris entre 3 et 10.
  7. Générer et affiner : examinez le clip, puis ajustez le texte, le rapport ou la durée, puis exécutez-le à nouveau.

Conseils d'invite et de référence#


  • Dirigez avec la caméra et le mouvement souhaités (par exemple, poussée lente, portable ou verrouillé).
  • Nommez l'ambiance et l'éclairage pour que la scène se lise comme vous le souhaitez.
  • Gardez une action claire par clip ; les courtes durées récompensent les invites ciblées.
  • Épelez le paysage sonore lorsque l'audio est important, puisque le modèle peut générer de l'audio synchronisé.
  • Utilisez des formulations négatives simples (par exemple, pas de texte à l'écran) plutôt que de vagues allusions.
  • Si un résultat vous semble chargé, simplifiez l'invite et supprimez les indices de style concurrents.

Comment Gemini Omni Flash se compare aux autres modèles#


  • Par rapport aux modèles texte-vidéo précédents : Il met l'accent sur le mouvement sensible à la physique et l'audio synchronisé natif en une seule étape. Sur la base d’informations accessibles au public, comparez selon vos propres invites.
  • Par rapport aux générateurs vidéo silencieux : Il regroupe la génération audio, vous évitant ainsi une étape distincte de notation ou de conception sonore.
  • Au sein de sa propre famille : La conversion texte-vidéo est l'une des quatre tâches de cette famille ; les flux de travail d'image vers vidéo, de montage vidéo et de référence à vidéo ciblent les flux de travail qui démarrent à partir de médias existants plutôt que de texte seul.

Plus de modèles à essayer#


  • Veo 3 Fast — Conversion texte-vidéo rapide avec audio pour des brouillons rapides.
  • Seedance 2.5 — Vidéo multimodale cinématographique avec support de référence.
  • Kling Video — Génération vidéo axée sur le mouvement.
  • Wan 2.5 — Alternative texte-vidéo à usage général.

Ressources officielles#


  • Google DeepMind : https://deepmind.google/

Modèles associés

ace-step/audio-outpaint

Prolongez un morceau au début, à la fin ou des deux côtés en respectant son style.

wan-2-5/text-to-video

Générez une vidéo de 5 ou 10 secondes à partir d'une invite requise. Ajoutez éventuellement une piste audio WAV ou MP3, une invite négative et l'une des 13 tailles de sortie.

omnihuman/v1.5

Générez une vidéo à partir d'une image de portrait requise et d'une piste audio requise de moins de 35 secondes. Ajoutez des conseils facultatifs dans six langues prises en charge et utilisez le contrôle de départ, dont la valeur par défaut est -1.

veo-3-1/extend-video

Prolongez une vidéo existante de 7 secondes en 720p, avec guidage par prompt et génération audio facultative.

kling-video-o3/4K/image-to-video

Génération cinématographique d’image en vidéo 4K à 0,42 $ par seconde de sortie.

pika-2-2/image-to-video

Créez des vidéos dynamiques à partir d'images ou de textes.

Questions Fréquemment Posées

À quoi sert Gemini Omni Flash ?

Gemini Omni Flash est le modèle vidéo multimodal de Google qui transforme une invite textuelle en un court clip cinématique avec audio synchronisé. Sur cette page RunComfy, il exécute la tâche de conversion texte-vidéo, ce qui en fait un outil idéal pour les publicités sociales, les rythmes d'histoire et la prévisualisation rapide où le mouvement et le son sont tous deux importants.

Quelles tâches la famille Gemini Omni Flash couvre-t-elle ?

La famille Gemini Omni Flash couvre quatre tâches connexes : texte vers vidéo, image vers vidéo, montage vidéo et référence à vidéo. Cette page RunComfy expose la tâche de conversion texte-vidéo, qui génère une vidéo à partir d'une seule invite écrite, tandis que les autres tâches démarrent à partir d'images ou de séquences existantes.

Gemini Omni Flash génère-t-il de l'audio avec la vidéo ?

Oui. Gemini Omni Flash produit un son synchronisé, tel que la parole, les effets sonores et la musique, aligné sur l'action générée. Vous pouvez contrôler le son à partir de l'invite, par exemple en demandant une musique de fond calme ou en ne spécifiant aucun dialogue.

Qu'est-ce qui rend le mouvement de Gemini Omni Flash plus naturel ?

Gemini Omni Flash s'appuie sur les connaissances du monde réel de Gemini et possède une compréhension améliorée de la physique, ce qui l'aide à maintenir la cohérence du mouvement, de l'éclairage et de l'interaction des objets tout au long d'une prise de vue. Cela réduit la dérive image par image courante dans les anciens modèles texte-vidéo.

Quelles limites de saisie dois-je connaître avant d'utiliser Gemini Omni Flash ?

La tâche de conversion texte-vidéo nécessite une invite requise, un rapport hauteur/largeur de 16:9 ou 9:16 et une durée comprise entre 3 et 10 secondes. Vérifiez le panneau de paramètres RunComfy actuel pour connaître les valeurs par défaut exactes et les limites côté fournisseur avant de générer.

Comment dois-je rédiger des invites pour Gemini Omni Flash ?

Soyez descriptif sur le sujet, l'action, la caméra, l'ambiance et l'éclairage, et contrôlez le rythme directement dans l'invite (par exemple, une seule prise de vue continue). Insérez des exclusions dans l'invite elle-même, telles que « Ne pas afficher le texte », car Gemini Omni Flash lit les instructions négatives à partir de l'invite.

Les développeurs peuvent-ils utiliser Gemini Omni Flash via l'API RunComfy ?

Oui. Vous pouvez prototyper Gemini Omni Flash dans l'interface utilisateur du modèle RunComfy, puis appeler le même modèle via l'API RunComfy avec des paramètres identiques. Cela vous permet de passer d'un test de navigateur à une génération automatisée sans héberger ni mettre à l'échelle le modèle vous-même.

Combien ça coûte de générer avec Gemini Omni Flash sur RunComfy ?

Les générations avec Gemini Omni Flash sont facturées 0,13 $ par seconde de vidéo générée et réduisent votre solde RunComfy en USD ou en crédit. Les nouveaux utilisateurs commencent généralement avec un montant d’essai gratuit ; voir la section Génération sur cette page pour les détails actuels.

Suivez-nous
  • LinkedIn
  • Facebook
  • Instagram
  • Twitter
Support
  • Discord
  • Email
  • État du système
  • affilié
Modèles vidéo
  • MiniMax H3 Open
  • FLUX 3 Image to Video
  • MiniMax H3 Open Image to Video
  • Wan 2.6 Flash
  • Happy Horse 1.1 reference to video
  • Seedance 1.5 Pro Text to Video
  • Voir tous les modèles →
Modèles d'images
  • Seedream 5.0 Pro Image Edit
  • Flux 2 Flash Edit
  • Nano Banana Pro
  • seedream 4.0
  • GPT Image 2
  • Qwen Image Edit 2511 LoRA
  • Voir tous les modèles →
Légal
  • Conditions d'utilisation
  • Politique de confidentialité
  • Politique relative aux cookies
RunComfy
Droits d'auteur 2026 RunComfy. Tous droits réservés.

RunComfy est la première ComfyUI plateforme, offrant des ComfyUI en ligne environnement et services, ainsi que des workflows ComfyUI proposant des visuels époustouflants. RunComfy propose également AI Models, permettant aux artistes d'utiliser les derniers outils d'IA pour créer des œuvres d'art incroyables.

Exemples de Gemini Omni Flash

Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...