根据文字生成 4–12 秒视频,支持 480p、720p、1080p、6 种宽高比,以及音频和固定镜头设置。
Seed Audio 1.0 是 Bytedance 推出的文生音频模型,可将文字提示词转化为清晰、自然的语音与口播音频。你可以通过三种方式引导结果:仅使用文字提示词、使用最多三段简短参考音频,或使用一张用于影响表达方式的参考图像。
输出规格:仅音频 / 格式 wav、mp3、pcm、ogg_opus / 采样率 8 kHz 至 48 kHz。
Seed Audio 1.0 专为快速、灵活且表达方式可控的音频合成而打造。
| 参数 | 必填 | 类型 | 默认值 | 范围 / 选项 | 说明 |
|---|---|---|---|---|---|
| prompt* | 是 (*) | string | — | 自由文本 | 要合成的文字;请按顺序使用 @Audio1、@Audio2、@Audio3 引用参考音频。 |
| voice | 否 | string | vivi_mixed_en_zh_ja_es_id | 预设声音列表 | 用于合成的预设声音。 |
| audio_urls | 否 | array | — | 最多 3 个 URL | 参考音频(wav/mp3/pcm/ogg_opus),每段最长 30s、最大 10MB。 |
| image_url | 否 | string | — | jpeg/png/webp,最大 10MB | 一张参考图像;不能与参考音频同时使用。 |
| output_format | 否 | string | mp3 | wav, mp3, pcm, ogg_opus | 输出音频的容器格式。 |
| sample_rate | 否 | integer | 24000 | 8000 - 48000 | 输出采样率,以 Hz 为单位。 |
| speed | 否 | number | 1 | 0.5 - 2.0 | 朗读速度;1.0 为正常节奏。 |
| volume | 否 | number | 1 | 0.5 - 2.0 | 输出音量;1.0 为正常音量。 |
| pitch | 否 | integer | 0 | -12 - 12 | 以半音为单位调整音高。 |
RunComfy 上的 Seed Audio 1.0 按生成音频的时长计费。
| 计费单位 | 费率 |
|---|---|
| 每分钟生成音频 | $0.21 |
预估费用示例
| 时长 | 预估费用 |
|---|---|
| 15 s | ~$0.053 |
| 30 s | ~$0.105 |
| 60 s | ~$0.21 |
| 120 s | ~$0.42 |
按照以下步骤,使用 Seed Audio 1.0 获得自然清晰的朗读效果。
根据文字生成 4–12 秒视频,支持 480p、720p、1080p、6 种宽高比,以及音频和固定镜头设置。
根据必填视频 URL 和音频 URL 创建口型同步视频,并可从五种模式中选择音视频时长不一致的处理方式。
以 AI 精准迁移动作,快速生成稳定流畅的角色动画。
Alibaba 上的 HappyHorse 1.0 I2V 将静态图像动画化为原生 1080p 视频,具有物理精确的运动和身份稳定的主题。
电影感 4K 参考图生视频,输出每秒 $0.47。
LTX 2.5 Pro:带有同步音频的静态视频,质量模式
Seed Audio 1.0 是 Bytedance 推出的文生音频模型,可将文字提示词转化为清晰、自然的语音与口播音频。在 RunComfy 的文生音频工作流中,输入希望朗读的内容,还可通过预设声音、参考音频片段或一张图像引导表达方式。它适合希望无需安排录音即可通过提示词制作音频的创作者。
Seed Audio 1.0 适合制作配音、旁白、角色台词、音频短剧和多语言朗读。预设声音与表达控件可调整节奏、音量和音高,使其符合场景或品牌需求。Seed Audio 1.0 还支持参考音频,因此也适合需要在多段音频中保持目标表达方式一致的情况。
使用 Seed Audio 1.0 时,最多可添加三段参考音频,并在提示词中按顺序以 @Audio1、@Audio2 和 @Audio3 引用,从而混合多个来源或把目标表达方式带入朗读。也可以改为提供一张参考图像来引导语气,但图像与音频参考不能在同一个请求中同时使用。为获得可靠结果,每段参考音频应保持简短,控制在约 30 秒、10MB 以内。
内容创作者、产品团队和本地化工作室可以使用 Seed Audio 1.0 制作解说配音、应用语音提示、广告口播和多语言配音。开发者还可将 Seed Audio 1.0 接入工作流,根据脚本或营销文案按需生成语音。预设声音与参考素材驱动的表达方式兼顾快速草稿和更具体的角色需求,并可在同一个界面中完成。
Seed Audio 1.0 必须提供提示词,还可选择声音、参考音频和图像输入,并支持调节语速、音量和音高。输出格式可选 wav、mp3、pcm 或 ogg_opus,采样率范围为 8 kHz 至 48 kHz。音频大小和支持格式等确切限制可能随提供方设置而变化,请在集成前查看 RunComfy 参数面板。
可以。你可以先在 RunComfy AI Playground Web UI 中调节提示词、声音、参考素材和表达控件,直到 Seed Audio 1.0 的输出符合目标。设置稳定后,使用完全相同的参数通过 RunComfy API 调用 Seed Audio 1.0,即可从后端或内容工作流自动生成音频。这样既能在浏览器中迭代,也能在代码中运行生产任务,而不会改变模型行为。
Seed Audio 1.0 的生成任务会消耗 RunComfy 余额中的 usd / credits;根据目前可用的提供方信息,该模型按每分钟生成音频 $0.21 计费。新用户通常会获得免费试用 usd 额度,之后的使用遵循模型页面显示的 Generation 规则。当前费率和各模式间可能存在的差异,请参阅 RunComfy 上 Seed Audio 1.0 页面的 Generation 部分。
RunComfy 是首选的 ComfyUI 平台,提供 ComfyUI 在线 环境和服务,以及 ComfyUI 工作流 具有惊艳的视觉效果。 RunComfy还提供 AI Models, 帮助艺术家利用最新的AI工具创作出令人惊叹的艺术作品。