使用 Pika 2.2 根据文本提示词生成高质量视频。
模型会同时读取一张或多张参考图像与文字提示词,生成带动作和声音的电影感短片,并尽量保留参考图中的主体、视觉风格和构图。它属于 Google Gemini Omni Flash 系列;该系列也支持文生视频和图生视频,本页面对应参考图生视频任务。
参考图能固定主体身份与视觉方向,让同一角色或产品从第一帧到最后一帧保持可辨识,减少在镜头中逐渐走样的问题。
输入参数与 RunComfy OpenAPI 中参考图生视频任务的 Input 架构一致。
| 参数 | 必填 | 类型 | 默认值 | 范围 / 选项 | 说明 |
|---|---|---|---|---|---|
| prompt* | 是 (*) | string | — | 描述性文本 | 指导动作、节奏、场景发展和音频 |
| image_urls* | 是 (*) | array(图像 URI) | — | jpg, jpeg, png, webp | 一张或多张参考图,用于指导主体、风格和构图 |
| aspect_ratio | 否 | string | 16:9 | 16:9, 9:16 | 生成视频的宽高比 |
| duration | 否 | integer | 8 | 3–10(秒) | 生成视频的时长,按整秒设置 |
按生成视频的时长计费:
使用 Pika 2.2 根据文本提示词生成高质量视频。
用Dreamina 3.0将文字转化为高质量电影画面,让创意以视频形式精准呈现。
使用 Wan 2.2 Plus 根据提示词生成 5 秒视频,并设置尺寸、随机种子和提示词扩展。
Kling V3.0 系列中具有最高视觉保真度的优质电影文本转视频。
通过遮罩或区域描述替换视频中的选定区域,并可按需使用图像和提示词。
根据必填提示词将一张必填的图像制作成视频。可设置输出尺寸、帧数、播放帧率、镜头运动强度、随机种子、步数、引导强度和 shift。
Gemini Omni Flash Reference to Video 接收一张或多张参考图像和文本提示词,生成带同步音频的短片。参考图决定主体、风格和构图,提示词则控制动作、节奏、场景发展与声音,让画面在保持参考特征的同时动起来。
它适合在短片中保持角色、产品或品牌外观一致,制作由参考图引导的电影感镜头,以及根据现有视觉素材生成宣传片。当主体形象和视觉方向需要贴近源图时,营销人员、影视创作者、游戏团队和社交内容创作者常会使用 Gemini Omni Flash Reference to Video。
你可以提供一张或多张参考图像,支持 jpg、jpeg、png 和 webp 格式。使用 Gemini Omni Flash Reference to Video 时,可在提示词中说明每张图分别用于角色、服装或环境等内容,从而明确其对结果的作用。具体输入数量限制请以当前 RunComfy 参数面板为准。
模型会生成与视频同步的对白、环境音效和音乐。你可以在 Gemini Omni Flash Reference to Video 的提示词中说明对白语气或所需背景声;如果需要安静的短片,也可以明确要求“无对白”。
与只使用文本提示词相比,参考图能更好地固定主体形象、风格和构图。在 Gemini Omni Flash Reference to Video 中,图像决定镜头的视觉基础,提示词控制镜头如何运动,因此很适合把已有角色或场景延续到短片中。
Gemini Omni Flash Reference to Video 支持 16:9 横屏和 9:16 竖屏,视频时长可按整秒设置为 3–10 秒。可用设置可能会调整,请以当前 RunComfy 参数面板为准。
可以。你可以先在 RunComfy 模型页面中测试 Gemini Omni Flash Reference to Video,再使用相同参数通过 RunComfy HTTP API 调用模型,用于自动化和生产环境。这样无需自行托管或扩展模型,即可从测试平滑过渡到集成。
Gemini Omni Flash Reference to Video 按生成视频的时长计费,每秒 $0.14,费用从 RunComfy 账户的美元余额或积分中扣除。新用户通常可获得试用额度,当前价格请查看本页面的生成区域。
RunComfy 是首选的 ComfyUI 平台,提供 ComfyUI 在线 环境和服务,以及 ComfyUI 工作流 具有惊艳的视觉效果。 RunComfy还提供 AI Models, 帮助艺术家利用最新的AI工具创作出令人惊叹的艺术作品。





