logo
RunComfy
  • ComfyUI
  • 训练器新
  • 模型
  • API
  • 定价
discord logo
模型
探索
所有模型
资源库
生成记录
模型 API
API 文档
API 密钥
账户
使用情况

Seed Audio 1.0:支持预设声音与参考音频的文生音频模型和 API | RunComfy

bytedance/seed-audio-1.0/text-to-audio

在 RunComfy 上使用 Seed Audio 1.0,根据文字、参考音频片段或图像生成自然的语音音频。支持预设声音,并可调整语速、音高和输出格式,可在浏览器中使用或通过 API 调用。

要合成的文字。请按顺序使用 @Audio1、@Audio2、@Audio3 引用参考音频片段。
用于合成的预设声音。
最多可添加 3 段参考音频,并在提示词中以 @Audio1、@Audio2、@Audio3 引用。每段最长 30s、最大 10MB,支持 wav/mp3/pcm/ogg_opus。
一张参考图像(jpeg/png/webp,最大 10MB)。不能与参考音频同时使用。
输出音频的容器格式。
输出音频的采样率,以 Hz 为单位。
朗读速度。1.0 为正常速度,0.5 为半速,2.0 为双倍速度。
输出响度。1.0 为正常音量,0.5 为一半,2.0 为两倍。
以半音为单位调整声音音高。0 为正常音高,-12 降低一个八度,12 升高一个八度。
Idle
The rate is $0.21 per minute.

Seed Audio 1.0 简介

Bytedance 推出的 Seed Audio 1.0 可将文字提示词转化为高质量、自然流畅的音频,并可通过文字、最多三段参考音频或一张图像进行引导,费用为每分钟 $0.21。
Seed Audio 1.0 以提示词驱动的合成方式取代按脚本录音和配音人员排期,让创作者、产品团队和本地化工作室在几分钟内制作语音音频。
开发者既可在浏览器中使用 RunComfy 上的 Seed Audio 1.0,也可通过 HTTP API 调用,无需自行托管或扩展模型。
适合:配音与旁白 | 多语言本地化 | 交互式音频原型

Bytedance / Seed Audio 1.0#


Seed Audio 1.0 是 Bytedance 推出的文生音频模型,可将文字提示词转化为清晰、自然的语音与口播音频。你可以通过三种方式引导结果:仅使用文字提示词、使用最多三段简短参考音频,或使用一张用于影响表达方式的参考图像。


输出规格:仅音频 / 格式 wav、mp3、pcm、ogg_opus / 采样率 8 kHz 至 48 kHz。


亮点#


Seed Audio 1.0 专为快速、灵活且表达方式可控的音频合成而打造。


  • 三种引导模式:可仅根据文字、使用预设声音或使用自己的参考音频驱动合成;也支持以参考图像替代音频进行引导。
  • 按顺序引用参考音频:在提示词中使用 @Audio1、@Audio2 和 @Audio3 引用最多三段音频,可混合多个来源或将目标表达方式带入朗读。
  • 多语言预设声音:提供涵盖英语、中文、西班牙语、日语、印度尼西亚语和葡萄牙语组合的预设声音。
  • 表达控制:可调整语速、音量和音高,使朗读节奏与语气符合项目需求。
  • 灵活输出:可导出 wav、mp3、pcm 或 ogg_opus,并支持最高 48 kHz 采样率,便于后续编辑。

参数#


参数必填类型默认值范围 / 选项说明
prompt*是 (*)string—自由文本要合成的文字;请按顺序使用 @Audio1、@Audio2、@Audio3 引用参考音频。
voice否stringvivi_mixed_en_zh_ja_es_id预设声音列表用于合成的预设声音。
audio_urls否array—最多 3 个 URL参考音频(wav/mp3/pcm/ogg_opus),每段最长 30s、最大 10MB。
image_url否string—jpeg/png/webp,最大 10MB一张参考图像;不能与参考音频同时使用。
output_format否stringmp3wav, mp3, pcm, ogg_opus输出音频的容器格式。
sample_rate否integer240008000 - 48000输出采样率,以 Hz 为单位。
speed否number10.5 - 2.0朗读速度;1.0 为正常节奏。
volume否number10.5 - 2.0输出音量;1.0 为正常音量。
pitch否integer0-12 - 12以半音为单位调整音高。

价格#


RunComfy 上的 Seed Audio 1.0 按生成音频的时长计费。


计费单位费率
每分钟生成音频$0.21

预估费用示例


时长预估费用
15 s~$0.053
30 s~$0.105
60 s~$0.21
120 s~$0.42

使用方法#


按照以下步骤,使用 Seed Audio 1.0 获得自然清晰的朗读效果。


  1. 在 RunComfy 上打开 Seed Audio 1.0 模型,并展开生成面板。
  2. 输入要朗读的提示词,使用自然的标点,让语句节奏和停顿更准确。
  3. 选择预设声音;如果需要特定表达方式,也可以跳过此项并添加参考音频。
  4. 如需使用参考音频,请添加最多三个音频 URL,并在提示词中以 @Audio1、@Audio2、@Audio3 引用。
  5. 也可以不用参考音频,改为提供一张参考图像来引导朗读语气。
  6. 调整语速、音量和音高,再选择适合工作流程的 output_format 与 sample_rate。
  7. 开始生成、试听结果,然后从任务历史记录中下载文件。
  8. 如需自动化,可将相同字段发送至 RunComfy 上的 Seed Audio 1.0 端点,无需自行托管。

提示词与参考素材技巧#


  • 按照你希望听到的方式书写:短句和清晰标点能让 Seed Audio 1.0 的朗读节奏更稳定。
  • 参考音频应简短、干净;每段控制在 30 秒、10MB 以内,结果会更可靠。
  • 确保音频顺序与提示词引用一致,让 @Audio1、@Audio2 和 @Audio3 指向正确来源。
  • 快速制作草稿时使用预设声音;需要特定角色时,再改用参考音频。
  • 仅在没有传入音频时使用图像引导,因为两种参考模式不能同时使用。
  • 小幅调整语速和音高;变化过大会使朗读听起来不自然。

Seed Audio 1.0 与其他模型的比较#


  • 多模态提示:与许多只支持文字的语音工具不同,Seed Audio 1.0 可接收文字、参考音频或图像来塑造输出(依据公开信息)。
  • 参考素材处理:使用 @Audio 标记按顺序引用音频,比单一固定声音槽位提供更精细的来源控制。
  • 灵活输出:多种容器格式和广泛的采样率范围,让 Seed Audio 1.0 的结果可以轻松接入现有工作流程。

相关模型

seedance-v1.5-pro/text-to-video

根据文字生成 4–12 秒视频,支持 480p、720p、1080p、6 种宽高比,以及音频和固定镜头设置。

sync/lipsync/v2/pro

根据必填视频 URL 和音频 URL 创建口型同步视频,并可从五种模式中选择音视频时长不一致的处理方式。

kling-2-6/motion-control-standard

以 AI 精准迁移动作,快速生成稳定流畅的角色动画。

happyhorse-1.0/image-to-video

Alibaba 上的 HappyHorse 1.0 I2V 将静态图像动画化为原生 1080p 视频,具有物理精确的运动和身份稳定的主题。

kling-video-o3/4K/reference-to-video

电影感 4K 参考图生视频,输出每秒 $0.47。

ltx-2.5/image-to-video/pro

LTX 2.5 Pro:带有同步音频的静态视频,质量模式

常见问题

Seed Audio 1.0 是什么?它在文生音频工作流中有什么作用?

Seed Audio 1.0 是 Bytedance 推出的文生音频模型,可将文字提示词转化为清晰、自然的语音与口播音频。在 RunComfy 的文生音频工作流中,输入希望朗读的内容,还可通过预设声音、参考音频片段或一张图像引导表达方式。它适合希望无需安排录音即可通过提示词制作音频的创作者。

Seed Audio 1.0 最适合哪些生成任务?

Seed Audio 1.0 适合制作配音、旁白、角色台词、音频短剧和多语言朗读。预设声音与表达控件可调整节奏、音量和音高,使其符合场景或品牌需求。Seed Audio 1.0 还支持参考音频,因此也适合需要在多段音频中保持目标表达方式一致的情况。

Seed Audio 1.0 如何使用参考音频和参考图像?

使用 Seed Audio 1.0 时,最多可添加三段参考音频,并在提示词中按顺序以 @Audio1、@Audio2 和 @Audio3 引用,从而混合多个来源或把目标表达方式带入朗读。也可以改为提供一张参考图像来引导语气,但图像与音频参考不能在同一个请求中同时使用。为获得可靠结果,每段参考音频应保持简短,控制在约 30 秒、10MB 以内。

哪些团队和生产场景最适合使用 Seed Audio 1.0?

内容创作者、产品团队和本地化工作室可以使用 Seed Audio 1.0 制作解说配音、应用语音提示、广告口播和多语言配音。开发者还可将 Seed Audio 1.0 接入工作流,根据脚本或营销文案按需生成语音。预设声音与参考素材驱动的表达方式兼顾快速草稿和更具体的角色需求,并可在同一个界面中完成。

使用 Seed Audio 1.0 前需要了解哪些输入和输出选项?

Seed Audio 1.0 必须提供提示词,还可选择声音、参考音频和图像输入,并支持调节语速、音量和音高。输出格式可选 wav、mp3、pcm 或 ogg_opus,采样率范围为 8 kHz 至 48 kHz。音频大小和支持格式等确切限制可能随提供方设置而变化,请在集成前查看 RunComfy 参数面板。

开发者可以通过 RunComfy API 使用 Seed Audio 1.0 吗?

可以。你可以先在 RunComfy AI Playground Web UI 中调节提示词、声音、参考素材和表达控件,直到 Seed Audio 1.0 的输出符合目标。设置稳定后,使用完全相同的参数通过 RunComfy API 调用 Seed Audio 1.0,即可从后端或内容工作流自动生成音频。这样既能在浏览器中迭代,也能在代码中运行生产任务,而不会改变模型行为。

在 RunComfy 上使用 Seed Audio 1.0 生成音频需要多少费用?

Seed Audio 1.0 的生成任务会消耗 RunComfy 余额中的 usd / credits;根据目前可用的提供方信息,该模型按每分钟生成音频 $0.21 计费。新用户通常会获得免费试用 usd 额度,之后的使用遵循模型页面显示的 Generation 规则。当前费率和各模式间可能存在的差异,请参阅 RunComfy 上 Seed Audio 1.0 页面的 Generation 部分。

关注我们
  • 领英
  • Facebook
  • Instagram
  • Twitter
支持
  • Discord
  • 电子邮件
  • 系统状态
  • 附属
视频模型
  • Wan 3.0 Reference To Video
  • LTX 2.5 Pro
  • Wan 3.0
  • Wan 2.6 Flash
  • MiniMax H3 Open Image to Video
  • Happy Horse 1.1 reference to video
  • 查看所有模型 →
图像模型
  • seedream 4.0
  • Seedream 5.0 Pro Image Edit
  • Flux 2 Flash Edit
  • Nano Banana Pro
  • Qwen Image Edit 2511 LoRA
  • Flux 2 Pro
  • 查看所有模型 →
法律
  • 服务条款
  • 隐私政策
  • Cookie 政策
RunComfy
版权 2026 RunComfy. 保留所有权利。

RunComfy 是首选的 ComfyUI 平台,提供 ComfyUI 在线 环境和服务,以及 ComfyUI 工作流 具有惊艳的视觉效果。 RunComfy还提供 AI Models, 帮助艺术家利用最新的AI工具创作出令人惊叹的艺术作品。