logo
RunComfy
  • ComfyUI
  • 训练器新
  • 模型
  • API
  • 定价
discord logo
模型
探索
所有模型
资源库
生成记录
模型 API
API 文档
API 密钥
账户
使用情况

Kling Video O3:在模型页面与 API 上生成可选音频的电影感文字视频 | RunComfy

kling/kling-video-o3/standard/text-to-video

将文本提示词制作成 3–15 秒电影感视频,支持可选音频、多种宽高比和 Kling Video O3 品质,可在 RunComfy 模型页面和 HTTP API 中使用。

描述要生成的场景、主体、动作、镜头与氛围。
输出画面比例。16:9 适合横屏,9:16 适合竖屏社交内容,1:1 适合方形画面。
生成视频的时长,范围为 3–15 秒。
启用后将在生成视频的同时合成同步音频,每秒费用约增加 33%。
镜头控制方式。intelligent 由模型自动安排剪辑和节奏;customize 则按提示词手动控制。
用于控制场景转场与推进的其他提示词片段。multi_prompt 中各片段的时长之和必须等于视频总时长。
Idle
The rate is $0.084 per second without sound, and $0.112 per second with sound.

Kling Video O3 简介

快手的 Kling Video O3 Standard 是一款文字转视频模型,可按每秒 $0.084 生成 3–15 秒电影感视频,并支持可选同步音频,以及 16:9、9:16、1:1 宽高比。它以提示词控制的 Kling Video O3 生成,取代拍摄排期、手工剪辑和素材库搜寻,加快视频剪辑师、营销团队、社交内容创作者和产品设计师的构思。开发者既可在浏览器中使用 RunComfy 上的 Kling Video O3,也可通过 HTTP API 调用,无需自行托管模型或扩展算力。
适用场景:社交短片与 TikTok 视频 | 营销与宣传视频 | 概念可视化镜头

Kuaishou / Kling Video O3 Standard#


这是快手 O3 系列的文字转视频模型,能够仅根据一条提示词生成电影感动作、稳定主体和符合物理规律的画面。Standard 版本在保留 O3 视觉风格的同时提供更实用的价格,并可选择生成音频,让输出视频自带完成混音的声画效果。


它适合需要快速制作符合需求的短镜头、又不想组织摄制组、使用剪辑机房或搜索授权素材的团队。


核心亮点#


  • O3 级画面:与早期 Kling 版本相比,动作更精确,主体一致性也更强。
  • 可选音频:每次生成均可开关同步音频,只有实际需要时才支付附加费用。
  • 灵活时长:可按整秒设置 3–15 秒,适合片头点缀、开场钩子和场景节拍。
  • 多种画幅:一个模型即可输出 16:9 横屏、9:16 竖屏和 1:1 方形素材。
  • 镜头控制:customize 按提示词手动控制节奏;intelligent 则由模型自动处理镜头范围。
  • 多段提示词叙事:串联多个提示词片段,在一次生成中控制场景转场。

参数#


参数必填类型默认值范围 / 选项说明
prompt*是(*)string—自由文本描述主体、动作、镜头和氛围的场景提示词。
aspect_ratio否string16:916:9、9:16、1:1输出画面的宽高比。
duration否integer53–15视频时长,单位为秒。
sound否booleanfalsetrue / false随视频生成同步音频。
shot_type否stringcustomizecustomize、intelligent镜头模式;intelligent 自动决定范围,customize 遵循提示词。
multi_prompt否array—0–20 项用于引导场景转场的附加提示词片段;片段时长之和必须等于视频总时长。

价格#


RunComfy 上的 Standard 版本按生成视频的秒数计费。启用音频后,会在无声费率基础上增加约 33%。


输出模式每秒费率
无声视频$0.084
有声视频$0.112

费用估算示例


时长无声有声
3 秒约 $0.252约 $0.336
5 秒(默认)约 $0.420约 $0.560
10 秒约 $0.840约 $1.120
15 秒约 $1.260约 $1.680

使用方法#


1) 在 RunComfy 中打开 Kling Video O3 模型,并展开生成面板。

2) 用镜头语言编写提示词,明确主体、动作、环境、摄影机运动和光线。

3) 按发布渠道选择宽高比:YouTube 用 16:9,Reels 和 Shorts 用 9:16,信息流用 1:1。

4) 将时长设为 3–15 秒;迭代提示词时先生成 3–5 秒,最终成片再延长。

5) 只有确实需要同步音频时才开启 sound,因为它会提高每秒费用。

6) 选择 shot_type:需要严格按提示词控制时用 customize;希望模型处理节奏时用 intelligent。

7) 运行生成、预览结果,然后从任务历史下载视频。

8) 自动化使用时,将相同字段发送到 RunComfy API 端点,并把输出 URL 接入现有流程。


提示词与参考建议#


  • 描述主体之前,先写镜头类型和摄影机运动,例如“wide tracking shot”“slow push-in”“locked tripod”。
  • 明确写出光线与时段,例如“golden hour rim light”“overcast soft key”“neon practicals”,帮助模型确定视觉风格。
  • 提示词应具体、简洁;按优先级排列的描述比冗长的形容词堆叠更有效。
  • 在 Kling Video O3 中让 aspect_ratio 与构图匹配:竖向主体用 9:16,环境占比较大的镜头用 16:9。
  • 对 10–15 秒长视频,描述一条清晰的动作弧线,不要塞入多个无关动作,以保持连贯性。
  • 若希望一次渲染中在两个时刻之间干净转场,请使用多段提示词。
  • 环境声和拟音需要同步时可启用 sound;若准备后期配乐,则保持关闭。

Kling Video O3 与其他模型的比较#


  • 与 O3 Pro 版本相比:Kling Video O3 Standard 牺牲少量顶级细节,换取明显更低的每秒价格,更适合迭代和大批量社交内容。
  • 与 Kling V3.0 Standard 相比:根据公开资料,O3 系列在保留相近控制界面的同时,目标是提升动作真实感与主体一致性。
  • 与图像转视频模型相比:文字转视频无需参考首帧,可直接根据提示词生成动作,加快早期概念探索。
  • 与开源文字转视频模型相比:该模型通过托管 API 提供,无需自行托管、配置 GPU 或维护模型权重。

其他可尝试的模型#


  • Kling V2.1 Master Text To Video — 侧重最高品质的另一款 Kling 版本。
  • Kling V2.1 Standard Image To Video — 动画化参考静帧,而不是只从文字开始。
  • Hailuo 02 Text To Video — 另一家提供方的模型,物理模拟能力突出。
  • Wan 2.5 Text To Video — 面向提示词视频生成、风格接近开放权重的选择。

官方资源#


  • Kling AI(快手):https://app.klingai.com/
  • 快手:https://www.kuaishou.com/en

相关模型

kling-1-6/pro/image-to-video

精准理解提示,流畅生成动画,高品质图像到视频创作体验。

pika-2-2/text-to-video

使用 Pika 2.2 从文本生成高清动画,快速实现创意视频制作。

kling-video-o3/standard/reference-to-video

根据参考素材生成 3–15 秒视频,起价为每秒 $0.084。

wan-2-5/image-to-video

利用Wan 2.5,将静态图像高效转换为动态视频,轻松打造创意视觉内容。

happyhorse-1.0/reference-to-video

HappyHorse 1.0 参考视频将多达 9 个参考图像和提示融合成一个具有稳定身份的连贯多字符剪辑。

seedance-2.0/pro

生成 2K 电影感视频,支持精准口型同步与镜头控制。

常见问题

Kling Video O3 是什么?它在文字转视频流程中能做什么?

Kling Video O3 是快手 O3 系列的文字转视频模型,可将一条提示词制作成主体稳定、动作自然且符合物理规律的电影感视频。在 RunComfy 的文字转视频流程中,只需描述场景、镜头和氛围,Kling Video O3 便会输出完成的视频,并可选择同步音频。它适合希望跳过手工剪辑和摄制组、快速通过提示词创作的用户。

Kling Video O3 最适合哪些生成任务?

Kling Video O3 适合制作社交短片、广告素材、品牌片头、产品可视化和设计或分镜概念镜头。3–15 秒灵活时长与 16:9、9:16、1:1 宽高比,可让同一模型覆盖 TikTok、Reels、YouTube 和信息流版位。需要输出自带完整声画时,还可开启可选音频。

Kling Video O3 与 O3 Pro 版本及早期 Kling 模型相比如何?

与 O3 Pro 相比,Kling Video O3 Standard 在保留 O3 视觉风格的同时提供更实用的每秒价格,适合迭代和较大批量生成。根据现有提供方资料,与 V3.0 等早期 Kling 版本相比,O3 系列更重视动作真实感和主体一致性。提示词、宽高比、时长、音频与镜头类型等控制方式依然熟悉,旧提示词也容易迁移。

哪些团队和生产场景最适合 Kling Video O3?

营销团队、视频剪辑师、社交内容创作者和产品设计师可用 Kling Video O3 制作符合简报的宣传片、动态情绪板和短视频,无需预约演员或搜寻素材。开发者可将同一模型接入自动化流程,把简报元数据转成可发布的视频;分镜师和概念艺术家也可更快预演原本需要预可视化制作的场景。

使用 Kling Video O3 前需要了解哪些输入限制?

Kling Video O3 必须提供文本提示词,支持 16:9、9:16、1:1 宽高比,以及 3–15 秒的整秒时长。sound 可开关,shot_type 接受 customize 或 intelligent。提示词长度、多段提示词数量和渲染并发等其他限制可能随模式或提供方设置变化,请以当前 RunComfy 参数面板为准。

开发者能否通过 RunComfy API 将 Kling Video O3 用于生产任务?

可以。先在 RunComfy AI Playground 网页界面中调整 Kling Video O3 的提示词、宽高比、时长、音频和镜头类型,直到结果符合目标;配置稳定后,即可以完全相同的参数从后端、内容流水线或 CMS 调用 RunComfy API。浏览器负责创意迭代,代码负责生产运行,模型行为保持一致。

在 RunComfy 上使用 Kling Video O3 生成视频需要多少费用?

Kling Video O3 会从 RunComfy 余额中扣除美元积分。根据现有提供方信息,Standard 版本无声时按每秒 $0.084 计费,有声时按每秒 $0.112 计费,启用音频约增加 33%。默认 5 秒无声视频约 $0.42,15 秒有声视频约 $1.68。新用户通常会获得免费试用美元额度;最新价格请以模型页面 Generation 区域为准。

Kling Video O3 适合使用怎样的提示词?

Kling Video O3 更适合简洁、有优先级的镜头语言:先写摄影机运动和镜头类型,再说明主体、动作、环境、光线和时段。“slow push-in”“golden hour rim light”“handheld with slight sway”等具体提示,比冗长的形容词更能锁定动作与画面。生成 10–15 秒视频时,应描述一条清晰的动作弧线,避免多个无关动作破坏连贯性。

关注我们
  • 领英
  • Facebook
  • Instagram
  • Twitter
支持
  • Discord
  • 电子邮件
  • 系统状态
  • 附属
视频模型
  • Gemini Omni Flash Video Edit
  • Gemini Omni Flash Image to Video
  • Gemini Omni Flash Reference to Video
  • Wan 2.6 Flash
  • Seedance 2.0 Pro
  • Wan 2.7 Reference to Video
  • 查看所有模型 →
图像模型
  • Seedream 5.0 Pro Image Edit
  • seedream 4.0
  • Nano Banana 2 Edit
  • Nano Banana Pro
  • GPT Image 2 Image Edit
  • GPT Image 2
  • 查看所有模型 →
法律
  • 服务条款
  • 隐私政策
  • Cookie 政策
RunComfy
版权 2026 RunComfy. 保留所有权利。

RunComfy 是首选的 ComfyUI 平台,提供 ComfyUI 在线 环境和服务,以及 ComfyUI 工作流 具有惊艳的视觉效果。 RunComfy还提供 AI Models, 帮助艺术家利用最新的AI工具创作出令人惊叹的艺术作品。

Kling Video O3 示例

Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...