logo
RunComfy
  • ComfyUI
  • 训练器新
  • 模型
  • API
  • 定价
discord logo
模型
探索
所有模型
资源库
生成记录
模型 API
API 文档
API 密钥
账户
使用情况

Gemini Omni Flash Reference to Video:参考图驱动的同步音频视频生成 | RunComfy

google/gemini-omni-flash/reference-to-video

Gemini Omni Flash Reference to Video 可根据一张或多张参考图与提示词生成带原生同步音频的短片,并在 3–10 秒的视频中保持主体和风格一致;支持 16:9 和 9:16。

描述所需的动作、场景发展、节奏和音频。可指定镜头运动与声音(如“缓慢推进”“轻风与鸟鸣”“无对白”),也可加入“不显示文字”等负向要求。请在提示词中说明上传图像分别用于主体、风格还是构图。
Image 1
一张或多张参考图像,用于指导视频中的主体、风格、构图和整体视觉方向。支持 jpg、jpeg、png 和 webp 格式。
生成视频的宽高比。
生成视频的时长,以秒为单位。
Idle
The rate is $0.14 per second of generated video.

Gemini Omni Flash Reference to Video 简介

Google 的 Gemini Omni Flash Reference to Video 可结合一张或多张参考图像与文字提示词,生成 3–10 秒的短片。参考图决定主体、风格和构图,文本则控制动作、节奏和同步音频。它把手动制作关键帧与单独配音整合为一次参考图驱动的生成,适合需要保持角色形象一致的营销人员、影视创作者、游戏团队和社交内容创作者。开发者既可在 RunComfy 浏览器页面中使用,也可通过 HTTP API 调用,无需自行托管或扩展模型。
适合:角色一致性短片 | 参考图驱动的电影感镜头 | 产品与品牌宣传

Google / Gemini Omni Flash Reference to Video#


模型会同时读取一张或多张参考图像与文字提示词,生成带动作和声音的电影感短片,并尽量保留参考图中的主体、视觉风格和构图。它属于 Google Gemini Omni Flash 系列;该系列也支持文生视频和图生视频,本页面对应参考图生视频任务。


参考图能固定主体身份与视觉方向,让同一角色或产品从第一帧到最后一帧保持可辨识,减少在镜头中逐渐走样的问题。


核心亮点#


  • 参考图驱动: 输入一张或多张图片,模型会依据其中的主体、风格和构图来生成镜头。
  • 提示词控制: 通过文本控制动作、场景发展、节奏和音频,决定参考内容如何动起来。
  • 原生同步音频: 同步生成对白、环境声和音乐,无需再单独制作音轨。
  • 主体一致性: 参考图有助于在整段视频中维持角色、物体或品牌的统一外观。
  • 灵活画幅与时长: 支持 16:9 横屏和 9:16 竖屏,时长可按整秒设置为 3–10 秒。
  • 多任务系列: Gemini Omni Flash 覆盖多种视频任务;本页面专注于参考图生视频。

参数#


输入参数与 RunComfy OpenAPI 中参考图生视频任务的 Input 架构一致。


参数必填类型默认值范围 / 选项说明
prompt*是 (*)string—描述性文本指导动作、节奏、场景发展和音频
image_urls*是 (*)array(图像 URI)—jpg, jpeg, png, webp一张或多张参考图,用于指导主体、风格和构图
aspect_ratio否string16:916:9, 9:16生成视频的宽高比
duration否integer83–10(秒)生成视频的时长,按整秒设置

价格#


按生成视频的时长计费:


  • 视频: 每生成 1 秒收费 $0.14。

相关模型

hailuo-02/text-to-video

使用 Hailuo 02 根据一段必填文本提示词生成 6 秒或 10 秒视频,并可选择提示词扩展。

kling-3.0/pro/image-to-video

Kling V3.0 系列中画面品质与动作真实感最高的高端图生视频模型。

infinite-talk/fast

使用一段音频和一张图片生成视频,并可按需设置提示词和随机种子。

flux-3/first-last-frame-to-video

根据起始帧与结束帧生成可选原生音频的过渡视频

seedance-1-0/pro/fast/image-to-video

利用Seedance 1.0 Pro Fast轻松将静态图像变为电影级动态视频,释放创作无限可能。

ltx-2/retake-video

根据提示词重做现有视频中的指定片段,并可选择替换音频、画面或同时替换两者。

常见问题

Gemini Omni Flash Reference to Video 是做什么的?

Gemini Omni Flash Reference to Video 接收一张或多张参考图像和文本提示词,生成带同步音频的短片。参考图决定主体、风格和构图,提示词则控制动作、节奏、场景发展与声音,让画面在保持参考特征的同时动起来。

Gemini Omni Flash Reference to Video 的最佳用例是什么?

它适合在短片中保持角色、产品或品牌外观一致,制作由参考图引导的电影感镜头,以及根据现有视觉素材生成宣传片。当主体形象和视觉方向需要贴近源图时,营销人员、影视创作者、游戏团队和社交内容创作者常会使用 Gemini Omni Flash Reference to Video。

Gemini Omni Flash Reference to Video 可以使用多少参考图像?

你可以提供一张或多张参考图像,支持 jpg、jpeg、png 和 webp 格式。使用 Gemini Omni Flash Reference to Video 时,可在提示词中说明每张图分别用于角色、服装或环境等内容,从而明确其对结果的作用。具体输入数量限制请以当前 RunComfy 参数面板为准。

Gemini Omni Flash Reference to Video 如何处理音频?

模型会生成与视频同步的对白、环境音效和音乐。你可以在 Gemini Omni Flash Reference to Video 的提示词中说明对白语气或所需背景声;如果需要安静的短片,也可以明确要求“无对白”。

Gemini Omni Flash Reference to Video 与文本到视频生成有何不同?

与只使用文本提示词相比,参考图能更好地固定主体形象、风格和构图。在 Gemini Omni Flash Reference to Video 中,图像决定镜头的视觉基础,提示词控制镜头如何运动,因此很适合把已有角色或场景延续到短片中。

Gemini Omni Flash Reference to Video 支持哪些宽高比和持续时间?

Gemini Omni Flash Reference to Video 支持 16:9 横屏和 9:16 竖屏,视频时长可按整秒设置为 3–10 秒。可用设置可能会调整,请以当前 RunComfy 参数面板为准。

开发人员可以通过 RunComfy API 使用 Gemini Omni Flash Reference to Video 吗?

可以。你可以先在 RunComfy 模型页面中测试 Gemini Omni Flash Reference to Video,再使用相同参数通过 RunComfy HTTP API 调用模型,用于自动化和生产环境。这样无需自行托管或扩展模型,即可从测试平滑过渡到集成。

在 RunComfy 上使用 Gemini Omni Flash Reference to Video 生成需要多少钱?

Gemini Omni Flash Reference to Video 按生成视频的时长计费,每秒 $0.14,费用从 RunComfy 账户的美元余额或积分中扣除。新用户通常可获得试用额度,当前价格请查看本页面的生成区域。

关注我们
  • 领英
  • Facebook
  • Instagram
  • Twitter
支持
  • Discord
  • 电子邮件
  • 系统状态
  • 附属
视频模型
  • Wan 3.0 Prime Reference To Video
  • Wan 3.0 Prime
  • Wan 3.0 Prime Text To Video
  • Wan 2.6 Flash
  • MiniMax H3 Open Image to Video
  • MiniMax H3 Open
  • 查看所有模型 →
图像模型
  • Seedream 5.0 Pro Image Edit
  • Qwen Image 3.0 Pro Edit
  • Flux 2 Flash Edit
  • Nano Banana Pro
  • seedream 4.0
  • GPT Image 2 Image Edit
  • 查看所有模型 →
法律
  • 服务条款
  • 隐私政策
  • Cookie 政策
RunComfy
版权 2026 RunComfy. 保留所有权利。

RunComfy 是首选的 ComfyUI 平台,提供 ComfyUI 在线 环境和服务,以及 ComfyUI 工作流 具有惊艳的视觉效果。 RunComfy还提供 AI Models, 帮助艺术家利用最新的AI工具创作出令人惊叹的艺术作品。

Gemini Omni Flash Reference to Video 示例

Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...