使用 Hailuo 02 根据一段必填文本提示词生成 6 秒或 10 秒视频,并可选择提示词扩展。
模型会同时读取一张或多张参考图像与文字提示词,生成带动作和声音的电影感短片,并尽量保留参考图中的主体、视觉风格和构图。它属于 Google Gemini Omni Flash 系列;该系列也支持文生视频和图生视频,本页面对应参考图生视频任务。
参考图能固定主体身份与视觉方向,让同一角色或产品从第一帧到最后一帧保持可辨识,减少在镜头中逐渐走样的问题。
输入参数与 RunComfy OpenAPI 中参考图生视频任务的 Input 架构一致。
| 参数 | 必填 | 类型 | 默认值 | 范围 / 选项 | 说明 |
|---|---|---|---|---|---|
| prompt* | 是 (*) | string | — | 描述性文本 | 指导动作、节奏、场景发展和音频 |
| image_urls* | 是 (*) | array(图像 URI) | — | jpg, jpeg, png, webp | 一张或多张参考图,用于指导主体、风格和构图 |
| aspect_ratio | 否 | string | 16:9 | 16:9, 9:16 | 生成视频的宽高比 |
| duration | 否 | integer | 8 | 3–10(秒) | 生成视频的时长,按整秒设置 |
按生成视频的时长计费:
使用 Hailuo 02 根据一段必填文本提示词生成 6 秒或 10 秒视频,并可选择提示词扩展。
Kling V3.0 系列中画面品质与动作真实感最高的高端图生视频模型。
使用一段音频和一张图片生成视频,并可按需设置提示词和随机种子。
根据起始帧与结束帧生成可选原生音频的过渡视频
利用Seedance 1.0 Pro Fast轻松将静态图像变为电影级动态视频,释放创作无限可能。
根据提示词重做现有视频中的指定片段,并可选择替换音频、画面或同时替换两者。
Gemini Omni Flash Reference to Video 接收一张或多张参考图像和文本提示词,生成带同步音频的短片。参考图决定主体、风格和构图,提示词则控制动作、节奏、场景发展与声音,让画面在保持参考特征的同时动起来。
它适合在短片中保持角色、产品或品牌外观一致,制作由参考图引导的电影感镜头,以及根据现有视觉素材生成宣传片。当主体形象和视觉方向需要贴近源图时,营销人员、影视创作者、游戏团队和社交内容创作者常会使用 Gemini Omni Flash Reference to Video。
你可以提供一张或多张参考图像,支持 jpg、jpeg、png 和 webp 格式。使用 Gemini Omni Flash Reference to Video 时,可在提示词中说明每张图分别用于角色、服装或环境等内容,从而明确其对结果的作用。具体输入数量限制请以当前 RunComfy 参数面板为准。
模型会生成与视频同步的对白、环境音效和音乐。你可以在 Gemini Omni Flash Reference to Video 的提示词中说明对白语气或所需背景声;如果需要安静的短片,也可以明确要求“无对白”。
与只使用文本提示词相比,参考图能更好地固定主体形象、风格和构图。在 Gemini Omni Flash Reference to Video 中,图像决定镜头的视觉基础,提示词控制镜头如何运动,因此很适合把已有角色或场景延续到短片中。
Gemini Omni Flash Reference to Video 支持 16:9 横屏和 9:16 竖屏,视频时长可按整秒设置为 3–10 秒。可用设置可能会调整,请以当前 RunComfy 参数面板为准。
可以。你可以先在 RunComfy 模型页面中测试 Gemini Omni Flash Reference to Video,再使用相同参数通过 RunComfy HTTP API 调用模型,用于自动化和生产环境。这样无需自行托管或扩展模型,即可从测试平滑过渡到集成。
Gemini Omni Flash Reference to Video 按生成视频的时长计费,每秒 $0.14,费用从 RunComfy 账户的美元余额或积分中扣除。新用户通常可获得试用额度,当前价格请查看本页面的生成区域。
RunComfy 是首选的 ComfyUI 平台,提供 ComfyUI 在线 环境和服务,以及 ComfyUI 工作流 具有惊艳的视觉效果。 RunComfy还提供 AI Models, 帮助艺术家利用最新的AI工具创作出令人惊叹的艺术作品。





