根据图片、音频和提示词生成视频,并分别调整文字与音频的引导强度。
输入一张图片和文字指令,模型即可将静态画面生成带声音的电影感短片。它属于 Google Gemini Omni Flash 系列;该系列还支持文生视频、视频编辑和参考图生视频,本页面对应图生视频任务。
模型会结合对现实世界和物理规律的理解来推断运动,因此从第一帧开始,主体与场景的变化更连贯,不易在播放过程中出现漂移或变形。
输入参数与 RunComfy OpenAPI 中图生视频任务的 Input 架构一致。
| 参数 | 必填 | 类型 | 默认值 | 范围 / 选项 | 说明 |
|---|---|---|---|---|---|
| prompt* | 是 (*) | string | — | 描述性文本 | 描述输入图像应如何移动或变化 |
| image_url* | 是 (*) | string(图像 URI) | — | jpg, jpeg, png, webp | 要制作动画的静态图像 |
| aspect_ratio | 否 | string | 16:9 | 16:9, 9:16 | 生成视频的宽高比 |
| duration | 否 | integer | 8 | 3–10(秒) | 生成视频的时长,按整秒设置 |
按生成视频的时长计费:
根据图片、音频和提示词生成视频,并分别调整文字与音频的引导强度。
智能将静态图像转换为动态视频,轻松生成高清创意内容,助力设计与营销表达。
根据提示词生成图像,并设置 LoRA、图像尺寸、格式、推理步数、负面提示词和随机种子。
通过 AI 转换现有视频,同时保持动作稳定和设计一致。
将一张参考图制作成 5 秒或 10 秒的视频,并可设置反向提示词与原生音频生成。
根据提示词生成视频,并设置 LoRA、分辨率、宽高比、帧数、FPS、推理步数和随机种子。
Gemini Omni Flash Image to Video 接收一张静态图像和一段文本提示词,将画面生成带同步音频的短片。模型会推断主体与场景的自然运动,因此无需分别制作动画和音轨,就能把单帧画面变成有动作、有声音的镜头。
它适合把静态照片制作成社交媒体短片、基于参考图测试镜头运动与节奏,以及快速验证视听概念。创作者、营销人员、影视和游戏团队常用 Gemini Omni Flash Image to Video 先探索动作与氛围,再投入完整制作。
模型会生成与画面同步的对白、环境音效和音乐。你可以在 Gemini Omni Flash Image to Video 的提示词中说明对白语气或所需背景声;如果需要安静的短片,也可以明确要求“无对白”。
以上传图像作为起点,相比只使用文本提示词,更容易固定开场构图和主体形象。在 Gemini Omni Flash Image to Video 中,静态图决定画面外观,提示词控制场景如何运动,因此特别适合已经有明确起始画面的情况。
Gemini Omni Flash Image to Video 支持 16:9 横屏和 9:16 竖屏,视频时长可按整秒设置为 3–10 秒。可用设置可能会调整,请以当前 RunComfy 参数面板为准。
你需要提供一张输入图像,以及描述运动方式的文本提示词。支持的图像格式包括 jpg、jpeg、png 和 webp。部分限制可能会随服务提供方的设置变化,未在此处列出的要求请以 RunComfy 参数面板为准。
可以。你可以先在 RunComfy 模型页面中测试 Gemini Omni Flash Image to Video,再使用相同参数通过 RunComfy HTTP API 调用模型,用于自动化和生产环境。这样无需自行托管或扩展模型,即可从测试平滑过渡到集成。
Gemini Omni Flash Image to Video 按生成视频的时长计费,每秒 $0.14,费用从 RunComfy 账户的美元余额或积分中扣除。新用户通常可获得试用额度,当前价格请查看本页面的生成区域。
RunComfy 是首选的 ComfyUI 平台,提供 ComfyUI 在线 环境和服务,以及 ComfyUI 工作流 具有惊艳的视觉效果。 RunComfy还提供 AI Models, 帮助艺术家利用最新的AI工具创作出令人惊叹的艺术作品。





