Prolongez un morceau au début, à la fin ou des deux côtés en respectant son style.
Gemini Omni Flash est la famille de génération vidéo multimodale de Google, construite sur les connaissances du monde réel de Gemini et une meilleure compréhension de la physique pour des mouvements et des interactions plus crédibles. La famille plus large couvre quatre tâches liées : la conversion de texte en vidéo, l'image en vidéo, le montage vidéo et la référence à la vidéo. Cette page RunComfy exécute la tâche de conversion texte-vidéo, transformant une invite écrite en un court clip cinématique avec audio synchronisé.
Parce qu'il réfléchit sur le comportement réel du monde, le modèle maintient les objets, l'éclairage et les mouvements cohérents sur une prise de vue au lieu de dériver d'une image à l'autre.
Les entrées correspondent au schéma RunComfy OpenAPI Input pour la tâche de conversion texte-vidéo.
| Paramètre | Obligatoire | Type | Valeur par défaut | Plage / Options | Description |
|---|---|---|---|---|---|
| prompt* | Oui (*) | string | — | Texte descriptif | Prompt décrivant la vidéo à générer |
| aspect_ratio | Non | string | 16:9 | 16:9, 9:16 | Format d’image de la vidéo |
| duration | Non | integer | 8 | 3–10 (secondes) | Durée de la vidéo en secondes entières |
La facturation est basée sur la durée du clip généré :
Prolongez un morceau au début, à la fin ou des deux côtés en respectant son style.
Générez une vidéo de 5 ou 10 secondes à partir d'une invite requise. Ajoutez éventuellement une piste audio WAV ou MP3, une invite négative et l'une des 13 tailles de sortie.
Générez une vidéo à partir d'une image de portrait requise et d'une piste audio requise de moins de 35 secondes. Ajoutez des conseils facultatifs dans six langues prises en charge et utilisez le contrôle de départ, dont la valeur par défaut est -1.
Prolongez une vidéo existante de 7 secondes en 720p, avec guidage par prompt et génération audio facultative.
Génération cinématographique d’image en vidéo 4K à 0,42 $ par seconde de sortie.
Créez des vidéos dynamiques à partir d'images ou de textes.
Gemini Omni Flash est le modèle vidéo multimodal de Google qui transforme une invite textuelle en un court clip cinématique avec audio synchronisé. Sur cette page RunComfy, il exécute la tâche de conversion texte-vidéo, ce qui en fait un outil idéal pour les publicités sociales, les rythmes d'histoire et la prévisualisation rapide où le mouvement et le son sont tous deux importants.
La famille Gemini Omni Flash couvre quatre tâches connexes : texte vers vidéo, image vers vidéo, montage vidéo et référence à vidéo. Cette page RunComfy expose la tâche de conversion texte-vidéo, qui génère une vidéo à partir d'une seule invite écrite, tandis que les autres tâches démarrent à partir d'images ou de séquences existantes.
Oui. Gemini Omni Flash produit un son synchronisé, tel que la parole, les effets sonores et la musique, aligné sur l'action générée. Vous pouvez contrôler le son à partir de l'invite, par exemple en demandant une musique de fond calme ou en ne spécifiant aucun dialogue.
Gemini Omni Flash s'appuie sur les connaissances du monde réel de Gemini et possède une compréhension améliorée de la physique, ce qui l'aide à maintenir la cohérence du mouvement, de l'éclairage et de l'interaction des objets tout au long d'une prise de vue. Cela réduit la dérive image par image courante dans les anciens modèles texte-vidéo.
La tâche de conversion texte-vidéo nécessite une invite requise, un rapport hauteur/largeur de 16:9 ou 9:16 et une durée comprise entre 3 et 10 secondes. Vérifiez le panneau de paramètres RunComfy actuel pour connaître les valeurs par défaut exactes et les limites côté fournisseur avant de générer.
Soyez descriptif sur le sujet, l'action, la caméra, l'ambiance et l'éclairage, et contrôlez le rythme directement dans l'invite (par exemple, une seule prise de vue continue). Insérez des exclusions dans l'invite elle-même, telles que « Ne pas afficher le texte », car Gemini Omni Flash lit les instructions négatives à partir de l'invite.
Oui. Vous pouvez prototyper Gemini Omni Flash dans l'interface utilisateur du modèle RunComfy, puis appeler le même modèle via l'API RunComfy avec des paramètres identiques. Cela vous permet de passer d'un test de navigateur à une génération automatisée sans héberger ni mettre à l'échelle le modèle vous-même.
Les générations avec Gemini Omni Flash sont facturées 0,13 $ par seconde de vidéo générée et réduisent votre solde RunComfy en USD ou en crédit. Les nouveaux utilisateurs commencent généralement avec un montant d’essai gratuit ; voir la section Génération sur cette page pour les détails actuels.
RunComfy est la première ComfyUI plateforme, offrant des ComfyUI en ligne environnement et services, ainsi que des workflows ComfyUI proposant des visuels époustouflants. RunComfy propose également AI Models, permettant aux artistes d'utiliser les derniers outils d'IA pour créer des œuvres d'art incroyables.





