logo
RunComfy
  • ComfyUI
  • 训练器新
  • 模型
  • API
  • 定价
discord logo
模型
探索
所有模型
资源库
生成记录
模型 API
API 文档
API 密钥
账户
使用情况

Ace Step 1.5:在模型页面与 API 上通过文字、歌词和风格标签生成音乐 | RunComfy

acestep-ai/ace-step-1.5/text-to-audio

根据风格标签和可选歌词生成最长 4 分钟的歌曲,提供原创人声与高保真音质,可在 RunComfy 模型页面和 HTTP API 中使用。

用逗号分隔曲风、情绪和乐器标签,以控制生成曲目的风格。
可选的演唱内容。留空或填写 [inst] / [instrumental] 可生成纯音乐;使用 [Verse]、[Chorus]、[Bridge] 标记组织歌曲结构。
音频时长,单位为秒。
Idle
The rate is $0.0003 per second.

Ace Step 1.5 简介

ACE Studio 的 Ace Step 1.5 可将文本风格标签和可选的结构化歌词制作成最长 4 分钟的完整歌曲,按每秒 $0.0003 计费,支持 50 多种语言,并提供连贯人声和高保真音质。它以标签驱动、提示词可控的 Ace Step 1.5 生成,取代人工配乐、预约歌手和多轨制作,加快媒体团队、游戏工作室、内容创作者和广告制作人的音乐构思。开发者既可在浏览器中使用 RunComfy 上的 Ace Step 1.5,也可通过 HTTP API 调用,无需自行托管模型或扩展算力。
适用场景:音乐样带原型 | 电影与游戏配乐 | 短视频广告音乐

ACE Studio / Ace Step 1.5#


Ace Step 1.5 是一款文字转音乐模型,可将逗号分隔的风格标签和可选的结构化歌词制作成包含人声、配器与同步唱词的完整歌曲。模型支持 50 多种语言,运行高效,适合快速迭代,时长可从数秒延伸到 4 分钟(240 秒)。


输出格式:仅音频 / 时长 5–240 秒 / 立体声 / 采样率由提供方定义。


参数#


参数必填类型默认值范围 / 选项说明
tags*是(*)string—自由文本以逗号分隔的曲风、情绪和乐器标签。
lyrics否string—自由文本或 [inst] / [instrumental]演唱内容;使用 [Verse]、[Chorus]、[Bridge] 等标记组织歌曲结构。
duration否integer605–240音频时长,单位为秒。
seed否integer-1-1–2147483647用于复现结果的随机种子;-1 表示随机。

价格#


RunComfy 上的 Ace Step 1.5 按生成音频时长计费。


计费单位费率
每生成 1 秒音频$0.0003

费用估算示例


时长约计费用
30 秒约 $0.009
60 秒(默认)约 $0.018
120 秒约 $0.036
240 秒(4 分钟)约 $0.072

使用方法#


1) 在 RunComfy 中打开 Ace Step 1.5 模型,并展开生成面板。

2) 输入“lofi, hiphop, chill, mellow piano”等风格标签,定义曲风、情绪和配器。

3) 按需添加歌词;清晰分隔 [Verse]、[Chorus] 和 [Bridge],或填写 [inst] 生成纯音乐。

4) 将时长设为 5–240 秒;先用短片段确认方向,再生成完整的 4 分钟版本。

5) 若要对比标签或歌词变化带来的影响,请锁定种子;希望获得更多变化时则保留 -1。

6) 运行生成、试听结果,然后从任务历史下载音频文件。

7) 通过 API 使用时,将相同字段发送到 RunComfy 上的 Ace Step 1.5 端点即可,无需自行托管。

8) 将效果出色的种子和标签组合保存为预设,以便在整个项目中保持一致的声音方向。

相关模型

minimax-h3/reference-to-video

从图像、视频和音频参考生成 768p 或 2K 视频

infinite-talk/fast/multi

使用两段音频和一张图片生成视频,并设置两位人物的发言顺序。

infinite-talk/image-to-video

利用AI将静态照片快速生成自然口型、表情生动的视频内容,轻松实现人像开口说话效果。

wan-2-6/video-to-video

根据文字提示词和 1~3 段参考视频生成视频,并可设置时长、输出尺寸、镜头结构、随机种子、反向提示词和音频生成。

kling-video-o3/pro/image-to-video

3–15s 专业级电影感图生视频,输出每秒 $0.123 起。

Hailuo Video 01

将文字图像一键转化为电影级视频,支持角色一致与风格统一

常见问题

Ace Step 1.5 是什么?它在文字转音频流程中能做什么?

Ace Step 1.5 是 acestep-ai 推出的文字转音乐模型,可将风格标签和可选的结构化歌词制作成包含旋律、节奏与人声的完整音轨。在 RunComfy 的文字转音频流程中,只需描述曲风、情绪和歌曲结构,Ace Step 1.5 就能生成唱词同步、整体连贯的音乐,适合希望跳过手工作曲、快速通过提示词创作的用户。

Ace Step 1.5 最适合哪些生成任务?

Ace Step 1.5 适合为视频生成背景音乐、制作短歌曲样带、氛围循环、广告短曲和游戏场景参考音轨。它擅长标签式风格控制,使用几个描述词便可调整曲风、配器和能量。人声与歌词生成功能也让 Ace Step 1.5 适合歌曲草稿和创意原型。

Ace Step 1.5 与原版 Ace Step 及其他音乐模型有何区别?

与原版 Ace Step 相比,Ace Step 1.5 保留标签驱动控制和最长 4 分钟时长,同时将多语言歌词支持扩展到 50 多种语言,并改进结构化歌词的处理。与纯器乐系统相比,它能一次生成原生人声、配器和同步唱词;种子参数则帮助开发者围绕选定方向稳定复现与迭代。

哪些团队和生产场景最适合 Ace Step 1.5?

设计师、技术美术、视频创作者和产品团队可用 Ace Step 1.5 制作预告片、社交内容、游戏音频原型、电商视频和广告素材。开发者也可将其接入按场景元数据或活动简报即时生成配乐的流程。Ace Step 1.5 跨多种语言同时支持人声与纯音乐,一个界面即可覆盖广泛音频需求。

使用 Ace Step 1.5 前需要了解哪些输入与输出限制?

Ace Step 1.5 的单次生成时长可在 5–240 秒(4 分钟)之间调整,只要求填写 tags 字段,另可提供结构化 lyrics。支持的音频格式和标签组合等其他限制取决于当前提供方配置,请在正式接入前查看 RunComfy 参数面板;不同模式或提供方设置可能有所不同。

如何从模型界面测试 Ace Step 1.5 迁移到 RunComfy API 的生产调用?

先在 RunComfy AI Playground 网页界面中调整风格标签、歌词、时长和种子,直到 Ace Step 1.5 的文字转音频结果符合目标。配置稳定后,即可通过 RunComfy API 以相同参数调用同一模型,在后端或内容流水线中自动生成;浏览器负责创意迭代,代码负责生产运行,底层模型行为不变。

在 RunComfy 上使用 Ace Step 1.5 生成音频如何计费?

Ace Step 1.5 会从 RunComfy 余额中扣除美元积分。根据现有提供方信息,模型按每秒 $0.0003 计费。新用户通常会获得一笔免费试用美元额度,之后按 Ace Step 1.5 页面 Generation 区域所示规则收费;最新费率和不同模式的差异也请以该区域为准。

关注我们
  • 领英
  • Facebook
  • Instagram
  • Twitter
支持
  • Discord
  • 电子邮件
  • 系统状态
  • 附属
视频模型
  • MiniMax H3 Open
  • FLUX 3 Image to Video
  • MiniMax H3 Open Image to Video
  • Wan 2.6 Flash
  • Happy Horse 1.1 reference to video
  • Seedance 1.5 Pro Text to Video
  • 查看所有模型 →
图像模型
  • Seedream 5.0 Pro Image Edit
  • Flux 2 Flash Edit
  • Nano Banana Pro
  • seedream 4.0
  • GPT Image 2
  • Qwen Image Edit 2511 LoRA
  • 查看所有模型 →
法律
  • 服务条款
  • 隐私政策
  • Cookie 政策
RunComfy
版权 2026 RunComfy. 保留所有权利。

RunComfy 是首选的 ComfyUI 平台,提供 ComfyUI 在线 环境和服务,以及 ComfyUI 工作流 具有惊艳的视觉效果。 RunComfy还提供 AI Models, 帮助艺术家利用最新的AI工具创作出令人惊叹的艺术作品。