logo
RunComfy
  • ComfyUI
  • 训练器新
  • 模型
  • API
  • 定价
discord logo
模型
探索
所有模型
资源库
生成记录
模型 API
API 文档
API 密钥
账户
使用情况

Gemini Omni Flash:支持同步音频的文生视频模型 | RunComfy

google/gemini-omni-flash/text-to-video

Gemini Omni Flash 可根据文本提示词生成带原生同步音频的电影级短视频,支持16:9或9:16画幅以及3–10秒时长。

描述希望生成的视频。你可以直接在提示词中控制节奏和音频,例如“单个连续镜头”“加入舒缓的背景音乐”或“无对白”,也可以加入“不显示文字”等排除指令。
生成视频的宽高比。
生成视频的时长,以秒为单位。
Idle
The rate is $0.13 per second of generated video.

Gemini Omni Flash 简介

Google 的 Gemini Omni Flash 可将一条文本提示词转化为3–10秒、带同步音频的电影级视频。模型利用 Gemini 对现实世界的理解,让动作和物体交互更加连贯、符合物理规律。营销人员、影视创作者、游戏团队和社交内容创作者无需再分别剪辑视频、设计声音并串联多个工具,只需通过一条提示词即可同时控制画面与音频。Gemini Omni Flash 可直接在 RunComfy 浏览器界面或通过 HTTP API 使用,无需自行托管和扩缩模型。
适合场景:短视频广告 | 电影感故事片段 | 快速影视预演

Google / Gemini Omni Flash#


Gemini Omni Flash 是 Google 的多模态视频生成模型系列,结合 Gemini 对现实世界的理解和更强的物理规律推理,让动作与物体交互更可信。该系列覆盖文生视频、图生视频、视频编辑和参考素材生视频四类任务;本 RunComfy 页面提供的是文生视频任务,可根据一条文本提示词生成带同步音频的电影级短片。


模型能够理解现实世界中的运动方式,因此更容易在同一镜头内保持物体、光照和动作连贯,减少逐帧漂移。


主要特点#


  • 原生同步音频: 根据画面动作同步生成语音、音效和音乐,无需再单独制作音轨。
  • 符合物理规律的运动: 更强的物理理解可带来更稳定、自然的运动与物体交互。
  • 基于现实知识: 利用 Gemini 的现实世界知识,让场景更合理、更贴合主题。
  • 提示词级控制: 可直接在提示词中控制节奏和声音,例如单个连续镜头、舒缓背景音乐或无对白。
  • 四类任务: Gemini Omni Flash 系列覆盖文生视频、图生视频、视频编辑和参考素材生视频;本页面仅提供文生视频。
  • 灵活画幅: 支持16:9横屏和9:16竖屏,时长可设为3–10秒。

参数#


输入项与文生视频任务的 RunComfy OpenAPI Input schema 保持一致。


参数必填类型默认值范围 / 选项说明
prompt*是 (*)string—描述性文本要生成视频的文本提示词
aspect_ratio否string16:916:9, 9:16生成视频的宽高比
duration否integer83–10(秒)生成视频的整数秒时长

价格#


按生成视频的时长计费:


  • 视频: $0.13/秒。

使用方法#


  1. 编写清晰的提示词 — 描述主体、动作、环境、氛围、光线和镜头。细节越明确,模型越容易准确理解。
  2. 用文字控制节奏 — 可直接要求单个连续镜头或指定动作节奏。
  3. 指定音频 — 描述对白、环境声或背景音乐;需要安静画面时可明确写“无对白”。
  4. 添加排除指令 — 在提示词中直接写明“不显示文字”等不希望出现的内容。
  5. 选择宽高比 — 横屏内容选择16:9;移动端优先的竖屏内容选择9:16。
  6. 设置时长 — 选择3–10秒之间的任意整数。
  7. 生成并优化 — 查看结果后,调整提示词、宽高比或时长,再次生成。

提示词建议#


  • 先说明想要的镜头和运动方式,例如缓慢推近、手持拍摄或固定机位。
  • 明确氛围与光线,让场景呈现符合预期。
  • 每个短片聚焦一个清晰动作;较短时长更适合重点明确的提示词。
  • 如果声音很重要,请具体描述声景,因为模型可以生成同步音频。
  • 使用“不要出现画面文字”等直接的排除表达,避免含糊暗示。
  • 如果结果过于杂乱,可简化提示词,移除互相冲突的风格要求。

Gemini Omni Flash 与其他模型的区别#


  • 与早期文生视频模型相比: 更强调符合物理规律的动作,并能一步生成原生同步音频。建议使用自己的提示词进行对比。
  • 与无声视频生成器相比: 已集成音频生成,可省去单独配乐和声音设计环节。
  • 在同系列中: 文生视频只是四类任务之一;图生视频、视频编辑和参考素材生视频则从已有媒体开始创作。

其他可尝试的模型#


  • Veo 3 Fast — 适合快速草稿、支持音频的高速文生视频模型。
  • Seedance 2.5 — 支持参考素材的电影级多模态视频模型。
  • Kling Video — 强调运动表现的视频生成模型。
  • Wan 2.5 — 通用文生视频替代方案。

官方资源#


  • Google DeepMind: https://deepmind.google/

相关模型

happyhorse-1.0/text-to-video

HappyHorse 1.0 提供原生 1080p 输出、电影级运动与多镜头一致性。

ltx-2/fast/text-to-video

根据文字提示词生成 16:9 视频,可选择时长、分辨率、帧率以及是否生成音频。

ace-step/audio-outpaint

在音轨开头、结尾或两端续写风格一致的新内容。

cinematic-video-generator

达到 Seedance 2.0 水准的电影级视频生成,兼具出色的视觉保真度与自然的镜头运动

ace-step-1.5/text-to-audio

根据风格标签和歌词生成最长 4 分钟、带人声的歌曲。

seedance-2.5/reference-to-video/480p

Seedance 2.5 参考 480p:以较低成本进行多参考草稿视频

常见问题

Gemini Omni Flash 适合做什么?

Gemini Omni Flash 是 Google 的多模态视频模型,可将文本提示词转化为带同步音频的电影级短片。本 RunComfy 页面提供文生视频任务,适合同时重视画面动作和声音的社交广告、故事片段与快速影视预演。

Gemini Omni Flash 系列覆盖哪些任务?

该系列覆盖文生视频、图生视频、视频编辑和参考素材生视频四类任务。本页面提供的是仅根据文本提示词生成视频的文生视频任务,其他任务则从已有图片或视频素材开始。

Gemini Omni Flash 会随视频一起生成音频吗?

会。模型可生成与画面动作同步的语音、音效和音乐。你可以直接在提示词中控制声音,例如要求舒缓背景音乐或指定“无对白”。

为什么 Gemini Omni Flash 的动作更自然?

Gemini Omni Flash 结合了 Gemini 对现实世界的理解与更强的物理规律推理,有助于在同一镜头中保持动作、光照和物体交互连贯,减少早期文生视频模型常见的逐帧漂移。

使用 Gemini Omni Flash 前需要了解哪些输入限制?

文生视频任务必须提供 prompt,宽高比可选16:9或9:16,时长范围为3–10秒。生成前请查看 RunComfy 当前参数面板,确认默认值和服务商侧的最新限制。

Gemini Omni Flash 的提示词应该怎么写?

请清楚描述主体、动作、镜头、氛围和光线,并在提示词中直接控制节奏,例如要求单个连续镜头。不希望出现的内容也应明确写出,例如“不显示文字”。

开发者能否通过 RunComfy API 使用 Gemini Omni Flash?

可以。你可以先在 RunComfy 模型界面中测试,再通过 RunComfy API 使用相同参数调用模型,从浏览器原型快速转向自动化生成,无需自行托管或扩缩模型。

在 RunComfy 使用 Gemini Omni Flash 需要多少钱?

Gemini Omni Flash 按生成视频时长收费,价格为 $0.13/秒,并从 RunComfy 账户余额中扣除。新用户通常会获得试用额度;最新信息请以本页面生成区域为准。

关注我们
  • 领英
  • Facebook
  • Instagram
  • Twitter
支持
  • Discord
  • 电子邮件
  • 系统状态
  • 附属
视频模型
  • MiniMax H3 Max
  • MiniMax H3 Max Reference to video
  • MiniMax H3 Max text to video
  • MiniMax H3 Open Reference To Video
  • Wan 3.0 Prime
  • Wan 2.7 Image to Video
  • 查看所有模型 →
图像模型
  • Wan 2.6 Image to Image
  • Flux 2 Flash Edit
  • Nano Banana Pro
  • GPT Image 2 Image Edit
  • Qwen Image 3.0 Edit
  • Qwen Image 3.0 Pro Edit
  • 查看所有模型 →
法律
  • 服务条款
  • 隐私政策
  • Cookie 政策
RunComfy
版权 2026 RunComfy. 保留所有权利。

RunComfy 是首选的 ComfyUI 平台,提供 ComfyUI 在线 环境和服务,以及 ComfyUI 工作流 具有惊艳的视觉效果。 RunComfy还提供 AI Models, 帮助艺术家利用最新的AI工具创作出令人惊叹的艺术作品。

Gemini Omni Flash 示例

Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...