logo
RunComfy
  • ComfyUI
  • 训练器新
  • 模型
  • API
  • 定价
discord logo
模型
探索
所有模型
资源库
生成记录
模型 API
API 文档
API 密钥
账户
使用情况

Kling Avatar V2:音频驱动的口播数字人视频 | RunComfy

kling/ai-avatar/v2/standard

用一张人像和一段音频制作口播数字人视频,并可通过提示词引导动作与表达方式。

用于创建数字人的人像 URL。
0:00
0:00
用于驱动数字人说话表现的音频 URL。
用于引导生成视频的可选提示词,最多 2500 个字符。
Idle
The rate is $0.0562 per second.

Kling Avatar V2 简介

Kling Avatar V2 是一款音频驱动的图生视频模型,可根据一张人像制作口播数字人视频。在这个 RunComfy 页面中,`image` 和 `audio` 为必填 URL,`prompt` 为可选项,最多可输入 2500 个字符,用于补充动作、表情或说话方式。本页面没有单独的时长、宽高比或分辨率设置。你既可以在浏览器中试用,也可以通过 HTTP API 接入,无需自行部署模型。

Kling Avatar V2 概览#


Kling Avatar V2 通过两项必填媒体输入生成口播数字人视频:人像决定画面中的人物,音频驱动说话表现。你还可以填写可选提示词,对表情、头部动作或表达方式作简短补充。


这个 RunComfy 页面只提供 image、audio 和 prompt 三个输入字段,没有单独的视频时长、宽高比或分辨率设置。


输入参数#


参数类型默认值/范围说明
imagestring (image_uri)必填用于创建数字人的人像 URL。
audiostring (audio_uri)必填用于驱动数字人说话表现的音频 URL。
promptstring可选; 默认: 空; 最多 2500 个字符对动作、表情或表达方式的简短说明。

素材准备建议#


  • 使用面部清晰、遮挡较少的人像。
  • 提供稳定且可直接访问的媒体 URL,并确保任务处理期间链接持续有效。
  • 尽量使用人声清楚、背景噪声较少的音频。
  • 可选的 prompt 应简短明确,只描述需要影响的行为,例如“语气沉稳”或“轻微点头”。
  • 本页面不能单独选择时长、画幅或输出分辨率。

浏览器与 API 工作流#


建议先在 RunComfy 模型界面中共同检查人像、音频和可选提示词。接入应用时,可通过 Kling Avatar V2 API 端点 提交相同的三个字段。


正式使用前,请查看当前的模型提供方与 RunComfy 条款,并确认你对人像、音频、提示词及生成视频拥有必要权利。


适用场景#


  • 主播或品牌发言人短片
  • 培训与入职视频
  • 数字人的多语言配音版本
  • 由录音驱动的角色口播

如需其他服务版本,可查看 Kling AI Avatar V2 Pro 模型。

相关模型

hailuo-2-3/standard/image-to-video

Hailuo 2.3 让设计师轻松将静态图像转换为逼真动态视频,精准控制每一帧细节,激发创意灵感。

kling-video-o3/pro/reference-to-video

专业级参考图生视频,支持 3–15s 输出,每秒 $0.112 起。

kling-video-o3/4K/reference-to-video

电影感 4K 参考图生视频,输出每秒 $0.42。

react-1

使用必填音频驱动一段短视频,并控制情绪、编辑范围、音视频时长不一致时的处理方式和表现力。

wan-2-6/flash/image-to-video

将静态图变成动作自然、对白同步且创作可控的逼真视频场景。

kling-video-o1/video-to-video/edit

使用提示词编辑参考视频,可加入元素与图片参考,并可选择保留原始音轨。

常见问题

Kling Avatar V2 的生成结果可以商用吗?

是否可以商用取决于当前的模型提供方与 RunComfy 条款,以及你对人像、音频、提示词和生成结果所拥有的权利。通过 RunComfy 使用模型并不会取代这些条款,也不会自动授予第三方素材的使用权。发布或变现前,请先核对适用条款。

这个 Kling Avatar V2 页面有哪些输入限制?

页面要求提供一个 image URL 和一个 audio URL。prompt 为可选项,最多 2500 个字符。本页面没有独立的时长、宽高比、分辨率或多参考图输入。

开发者如何从浏览器试用切换到 API?

先在 RunComfy 模型界面中测试必填的 image、audio 以及可选的 prompt,再通过模型的 HTTP API 提交相同字段。请确保媒体 URL 在整个处理期间可访问,并在应用中妥善处理任务状态、失败情况和返回结果。

Kling Avatar V2 主要用于什么?

这个页面面向音频驱动的口播数字人工作流:一张人像确定出镜人物,一段音频驱动说话表现,可选提示词用于补充行为要求。它不是多图编辑工具,也不是纯文本生成视频的界面。

Kling Avatar V2 一定提供免费试用吗?

本页面没有承诺固定的免费试用额度。积分、价格和账号资格可能变化,开始正式任务前请以 RunComfy 账号中显示的最新信息为准。

可以使用哪些图片和音频格式?

schema 只明确 image 使用 image_uri、audio 使用 audio_uri,并未逐一列出所有兼容扩展名。请使用当前界面接受的格式并提供可直接访问的 URL;如果文件被拒绝,可转换为常见的网页图片或音频格式后重试。

在哪里可以获得 Kling Avatar V2 的 RunComfy 支持?

如对请求、积分或 API 接入有疑问,可发送邮件至 hi@runcomfy.com 联系 RunComfy。请附上相关任务 ID 和简要问题说明,但不要通过邮件发送私密素材或登录凭据。

关注我们
  • 领英
  • Facebook
  • Instagram
  • Twitter
支持
  • Discord
  • 电子邮件
  • 系统状态
  • 附属
视频模型
  • MiniMax H3 Open
  • FLUX 3 Image to Video
  • MiniMax H3 Open Image to Video
  • Wan 2.6 Flash
  • Happy Horse 1.1 reference to video
  • Seedance 1.5 Pro Text to Video
  • 查看所有模型 →
图像模型
  • Seedream 5.0 Pro Image Edit
  • Flux 2 Flash Edit
  • Nano Banana Pro
  • seedream 4.0
  • GPT Image 2
  • Qwen Image Edit 2511 LoRA
  • 查看所有模型 →
法律
  • 服务条款
  • 隐私政策
  • Cookie 政策
RunComfy
版权 2026 RunComfy. 保留所有权利。

RunComfy 是首选的 ComfyUI 平台,提供 ComfyUI 在线 环境和服务,以及 ComfyUI 工作流 具有惊艳的视觉效果。 RunComfy还提供 AI Models, 帮助艺术家利用最新的AI工具创作出令人惊叹的艺术作品。

Kling Avatar V2 的实际应用示例

Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...