logo
RunComfy
  • ComfyUI
  • 训练器新
  • 模型
  • API
  • 定价
discord logo
模型
探索
所有模型
资源库
生成记录
模型 API
API 文档
API 密钥
账户
使用情况

Gemini Omni Flash Image to Video:将静态图像生成带同步音频的视频 | RunComfy

google/gemini-omni-flash/image-to-video

Gemini Omni Flash Image to Video 可将上传的图像生成带原生同步音频的短片,并通过提示词控制 3–10 秒视频中的运动;支持 16:9 和 9:16。

描述希望输入图像如何运动或变化。可在提示词中指定镜头运动、节奏和音频(如“缓慢推进”“轻风与鸟鸣”“无对白”),也可加入“不显示文字”等负向要求。
要制作成动画的输入图像。支持 jpg、jpeg、png 和 webp 格式。
生成视频的宽高比。
生成视频的时长,以秒为单位。
Idle
The rate is $0.14 per second of generated video.

Gemini Omni Flash Image to Video 简介

Google 的 Gemini Omni Flash Image to Video 可让一张静态图像动起来,将单帧画面扩展为 3–10 秒、动作与音频同步的短片。模型借助 Gemini 对现实世界的理解,让运动更符合场景逻辑。它把动画、关键帧和声音设计整合到一次提示词驱动的生成中,适合营销人员、影视创作者、游戏团队和社交内容创作者。开发者既可在 RunComfy 浏览器页面中使用,也可通过 HTTP API 调用,无需自行托管或扩展模型。
适合:静态图转社交短片 | 视听概念测试 | 参考图驱动的电影感镜头

Google / Gemini Omni Flash Image to Video#


输入一张图片和文字指令,模型即可将静态画面生成带声音的电影感短片。它属于 Google Gemini Omni Flash 系列;该系列还支持文生视频、视频编辑和参考图生视频,本页面对应图生视频任务。


模型会结合对现实世界和物理规律的理解来推断运动,因此从第一帧开始,主体与场景的变化更连贯,不易在播放过程中出现漂移或变形。


核心亮点#


  • 单图动画: 从一张静态图出发,为主体和场景生成自然、符合物理逻辑的运动。
  • 原生同步音频: 同步生成对白、环境声和音乐,无需再单独制作音轨。
  • 提示词控制运动: 直接描述镜头运动、节奏和氛围,决定画面如何动起来。
  • 现实知识支撑: 利用 Gemini 对现实世界的理解,让生成内容更可信、更贴合主题。
  • 灵活画幅: 支持 16:9 横屏和 9:16 竖屏,时长可按整秒设置为 3–10 秒。
  • 多任务系列: Gemini Omni Flash 覆盖多种视频任务;本页面专注于将图像转化为动态视频。

参数#


输入参数与 RunComfy OpenAPI 中图生视频任务的 Input 架构一致。


参数必填类型默认值范围 / 选项说明
prompt*是 (*)string—描述性文本描述输入图像应如何移动或变化
image_url*是 (*)string(图像 URI)—jpg, jpeg, png, webp要制作动画的静态图像
aspect_ratio否string16:916:9, 9:16生成视频的宽高比
duration否integer83–10(秒)生成视频的时长,按整秒设置

价格#


按生成视频的时长计费:


  • 视频: 每生成 1 秒收费 $0.14。

相关模型

aurora

根据图片、音频和提示词生成视频,并分别调整文字与音频的引导强度。

hailuo-02/image-to-video

智能将静态图像转换为动态视频,轻松生成高清创意内容,助力设计与营销表达。

wan-2-2/lora/text-to-image

根据提示词生成图像,并设置 LoRA、图像尺寸、格式、推理步数、负面提示词和随机种子。

wan-2.7/edit-video

通过 AI 转换现有视频,同时保持动作稳定和设计一致。

kling-2-6/pro/image-to-video

将一张参考图制作成 5 秒或 10 秒的视频,并可设置反向提示词与原生音频生成。

wan-2-2/lora/text-to-video

根据提示词生成视频,并设置 LoRA、分辨率、宽高比、帧数、FPS、推理步数和随机种子。

常见问题

Gemini Omni Flash Image to Video 是做什么的?

Gemini Omni Flash Image to Video 接收一张静态图像和一段文本提示词,将画面生成带同步音频的短片。模型会推断主体与场景的自然运动,因此无需分别制作动画和音轨,就能把单帧画面变成有动作、有声音的镜头。

Gemini Omni Flash Image to Video 的最佳用例是什么?

它适合把静态照片制作成社交媒体短片、基于参考图测试镜头运动与节奏,以及快速验证视听概念。创作者、营销人员、影视和游戏团队常用 Gemini Omni Flash Image to Video 先探索动作与氛围,再投入完整制作。

Gemini Omni Flash Image to Video 如何处理音频?

模型会生成与画面同步的对白、环境音效和音乐。你可以在 Gemini Omni Flash Image to Video 的提示词中说明对白语气或所需背景声;如果需要安静的短片,也可以明确要求“无对白”。

Gemini Omni Flash Image to Video 与文本到视频生成有何不同?

以上传图像作为起点,相比只使用文本提示词,更容易固定开场构图和主体形象。在 Gemini Omni Flash Image to Video 中,静态图决定画面外观,提示词控制场景如何运动,因此特别适合已经有明确起始画面的情况。

Gemini Omni Flash Image to Video 支持哪些宽高比和持续时间?

Gemini Omni Flash Image to Video 支持 16:9 横屏和 9:16 竖屏,视频时长可按整秒设置为 3–10 秒。可用设置可能会调整,请以当前 RunComfy 参数面板为准。

在使用 Gemini Omni Flash Image to Video 之前我应该了解哪些输入限制?

你需要提供一张输入图像,以及描述运动方式的文本提示词。支持的图像格式包括 jpg、jpeg、png 和 webp。部分限制可能会随服务提供方的设置变化,未在此处列出的要求请以 RunComfy 参数面板为准。

开发人员可以通过 RunComfy API 使用 Gemini Omni Flash Image to Video 吗?

可以。你可以先在 RunComfy 模型页面中测试 Gemini Omni Flash Image to Video,再使用相同参数通过 RunComfy HTTP API 调用模型,用于自动化和生产环境。这样无需自行托管或扩展模型,即可从测试平滑过渡到集成。

在 RunComfy 上使用 Gemini Omni Flash Image to Video 生成需要多少钱?

Gemini Omni Flash Image to Video 按生成视频的时长计费,每秒 $0.14,费用从 RunComfy 账户的美元余额或积分中扣除。新用户通常可获得试用额度,当前价格请查看本页面的生成区域。

关注我们
  • 领英
  • Facebook
  • Instagram
  • Twitter
支持
  • Discord
  • 电子邮件
  • 系统状态
  • 附属
视频模型
  • Wan 3.0 Prime Reference To Video
  • Wan 3.0 Prime
  • Wan 3.0 Prime Text To Video
  • Wan 2.6 Flash
  • MiniMax H3 Open Image to Video
  • MiniMax H3 Open
  • 查看所有模型 →
图像模型
  • Seedream 5.0 Pro Image Edit
  • Qwen Image 3.0 Pro Edit
  • Flux 2 Flash Edit
  • Nano Banana Pro
  • seedream 4.0
  • GPT Image 2 Image Edit
  • 查看所有模型 →
法律
  • 服务条款
  • 隐私政策
  • Cookie 政策
RunComfy
版权 2026 RunComfy. 保留所有权利。

RunComfy 是首选的 ComfyUI 平台,提供 ComfyUI 在线 环境和服务,以及 ComfyUI 工作流 具有惊艳的视觉效果。 RunComfy还提供 AI Models, 帮助艺术家利用最新的AI工具创作出令人惊叹的艺术作品。

Gemini Omni Flash Image to Video 示例

Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...