logo
RunComfy
  • ComfyUI
  • 训练器新
  • 模型
  • API
  • 定价
discord logo
模型
探索
所有模型
资源库
生成记录
模型 API
API 文档
API 密钥
账户
使用情况

ACE-Step Audio Inpaint:在模型页面与 API 上进行音频片段、歌词与风格改写 | RunComfy

acestep-ai/ace-step/audio-inpaint

用新风格标签或歌词重新合成音轨中的指定片段,再无缝接回原混音;可在 RunComfy 模型页面和 HTTP API 中使用。

0:00
0:00
要编辑的源音频。请提供 MP3、WAV 或 FLAC 文件的 HTTPS URL,最长 60 分钟。
以逗号分隔的曲风、情绪和乐器标签,用于控制重制片段的风格。
起始时间的参照点。start 从音轨开头向后计算,end 从音轨末尾向前倒算。
可编辑片段的开始位置,单位为秒,并按所选参照点计算。
结束时间的参照点。start 从音轨开头向后计算,end 从音轨末尾向前倒算。
可编辑片段的结束位置,单位为秒,并按所选参照点计算。
重制片段的可选歌词。留空则由模型写词;若不需要人声,请填写 [inst] 或 [instrumental]。
用于复现结果的随机种子。设为 -1 则每次随机。
Idle
The rate is $0.0002 per second of output audio.

ACE-Step Audio Inpaint 简介

ACE Studio 的 ACE-Step Audio Inpaint 可重新合成现有音轨中的指定区间,按输出音频每秒 $0.0002 计费;它能替换歌词、配器或情绪,同时保持混音的其余部分不变。它以定向、提示词驱动的局部重绘,取代整首歌曲重新渲染和手工拆分音轨,加快制作人、声音设计师、游戏音频团队和广告创意人员的音乐修复与混音迭代。开发者既可在浏览器中使用 RunComfy 上的 ACE-Step Audio Inpaint,也可通过 HTTP API 调用,无需自行托管模型或扩展算力。
适用场景:歌词改写与补录 | 段落风格重塑与混音 | 旁白和音效修复

ACE Studio / ACE-Step Audio Inpaint#


ACE-Step Audio Inpaint 是一款音频编辑模型,可重新渲染现有音轨中的指定区间,而不影响其他部分。提供源音频 URL,标记片段起止位置,再用风格标签和可选歌词描述替换内容;模型会在原位合成新片段,并将其接回前后混音。


输出格式:仅音频 / 源音频最长 60 分钟 / 片段范围 0–240 秒 / 采样率由提供方定义。


核心亮点#


  • 片段级改写:用起止时间锁定区间,仅重新合成该区间;其余音频逐比特保持不变。
  • 边界感知拼接:模型会参考片段前后的音频,使补丁在速度、调性和音色上自然衔接,避免明显接缝。
  • 可从两端定位:时间既可从开头正向计算,也可从结尾倒算,便于修复尾奏和音轨末端。
  • 标签驱动的风格与歌词重写:用简短标签和可选歌词改变配器、情绪或演唱内容。
  • 可复现版本:固定种子可锁定某次结果;使用随机种子则可探索同一需求的不同版本。
  • 页面与 API 一致:RunComfy 模型页面和 HTTP API 接收完全相同的输入。

参数#


参数必填类型默认值范围 / 选项说明
audio*是(*)string—MP3 / WAV / FLAC 的 HTTPS URL,最长 60 分钟要编辑的源音频文件。
tags*是(*)string—自由文本以逗号分隔的曲风、情绪和乐器标签,用于控制片段风格。
start_time_relative_to否stringstartstart、endstart_time 的参照点。
start_time否number—0–240可编辑片段的起始秒数。
end_time_relative_to否stringstartstart、endend_time 的参照点。
end_time否number300–240可编辑片段的结束秒数。
lyrics否string—自由文本或 [inst] / [instrumental]重制片段的歌词;留空则由模型写词。
seed否integer-1-1–2147483647用于复现结果的随机种子;-1 表示随机。

价格#


RunComfy 上的 ACE-Step Audio Inpaint 按所生成输出音频的时长计费。


计费单位费率
每输出 1 秒音频$0.0002

费用估算示例


输出时长约计费用
30 秒约 $0.006
60 秒约 $0.012
180 秒(3 分钟)约 $0.036

提示词与参考建议#


  • 将片段边界放在自然的节拍或乐句末尾,让转接更符合编曲逻辑。
  • 使用多个互补标签,例如“lofi, mellow piano, soft drums”,锁定片段的曲风和配器。
  • 若要细微修复,请让新标签贴近前后音频的能量;若要明显混音变化,则可有意拉开风格差距。
  • 提供结构清楚、音节数一致的歌词,使改写后的唱句与周围小节相衔接。
  • 若要生成纯音乐或去除片段中的人声,请将 lyrics 设为 [inst] 或 [instrumental]。
  • 对 start_time_relative_to 使用 end 并设置较小偏移,可直接调整淡出或结尾副歌,无需从头计算时间。
  • 迭代时固定种子,只修改标签或歌词,便于判断差异来自哪项编辑。
  • 每次聚焦几个小节,通常比改写很长区间更容易获得干净的融合效果。

相关模型

seedance-2.5/image-to-video/720p

Seedance 2.5:将静态图像动画化为电影 AI 视频

elevenlabs/music-generation

通过提示词创作歌曲,支持 44.1 kHz WAV 输出与分段编辑。

seedance-2.0-mini/image-to-video

将起始图像制作成带原生音频的电影感短片。

kling-2-5/turbo/text-to-video

使用 Kling 2.5 Turbo 根据提示词生成视频,并设置时长、宽高比和负面提示词。

kling-video-o3/4K/text-to-video

电影感 4K 文生视频,输出每秒 $0.42。

kling-2-1/pro/image-to-video

使用 Kling 2.1 Pro 根据必填起始图片和提示词生成视频,并可设置选填结束图片、时长、宽高比、负面提示词和提示词强度。

常见问题

ACE-Step Audio Inpaint 是什么?它在音频转音频流程中能做什么?

ACE-Step Audio Inpaint 是 acestep-ai 推出的音频编辑模型,可改写现有音轨中的指定时间区间,同时保留周围音频。在 RunComfy 的音频转音频流程中,提供源 URL、标记起止时间,再输入风格标签或新歌词,ACE-Step Audio Inpaint 便只重新生成该片段。它适合修复、风格重塑和定向混音,无需重制整首歌曲。

ACE-Step Audio Inpaint 最适合哪些生成任务?

ACE-Step Audio Inpaint 适合修复节拍不准或含噪的小节、改写一段主歌或副歌、重塑某一段的配器,以及替换成品中的某句歌词。它也可修补短旁白或音效,并保持周围音频不变。由于按区间工作,它比整曲生成更适合混音、母带前处理和内容编辑流程。

ACE-Step Audio Inpaint 与整曲文字转音乐或分轨编辑有何区别?

与从零生成歌曲的文字转音乐模型相比,ACE-Step Audio Inpaint 专注于指定时间区间的编辑,并将新内容无缝融合到现有音轨。与手工分轨后再生成相比,它在一次音频转音频任务中完成片段选择、重新合成和交叉淡化,让技术美术更准确地决定哪些内容要变、哪些必须保留。

哪些团队和生产场景最适合 ACE-Step Audio Inpaint?

音乐制作人、声音设计师、游戏音频团队和广告创意人员需要修复、改写或重塑现有音轨的某一段时,都可使用 ACE-Step Audio Inpaint。开发者可以把它接入编辑工具,让用户圈选区间并通过音频转音频界面提交新标签或歌词;内容团队也可用它完成预告片、播客或游戏过场的最后修补。

使用 ACE-Step Audio Inpaint 前需要了解哪些输入与输出限制?

源音频通常通过 MP3、WAV 或 FLAC 的公开 HTTPS URL 提供;根据现有提供方信息,最长约 60 分钟。ACE-Step Audio Inpaint 的可编辑区间由 start_time 和 end_time 确定,两者范围均为 0–240 秒,并可相对音轨开头或结尾定位。采样率和准确格式支持等限制取决于提供方设置,请以 RunComfy 参数面板的实时值为准。

如何从 Playground 中测试 ACE-Step Audio Inpaint 迁移到 RunComfy API 的生产调用?

先在 RunComfy AI Playground 网页界面中调整音频 URL、片段范围、标签、歌词和种子,直到 ACE-Step Audio Inpaint 的音频转音频结果符合目标。配置稳定后,即可通过 RunComfy API 以相同参数调用同一模型,在后端或内容流水线中自动编辑;浏览器负责创意迭代,代码负责生产运行,模型行为不变。

在 RunComfy 上运行 ACE-Step Audio Inpaint 如何计费?

ACE-Step Audio Inpaint 会从 RunComfy 余额中扣除美元积分。根据现有提供方信息,模型按输出音频每秒 $0.0002 计费。新用户通常会获得一笔免费试用美元额度,之后按模型页面 Generation 区域所示规则收费;最新费率和模式差异也请以该区域为准。

ACE-Step Audio Inpaint 的输出可以商用吗?

RunComfy 提供 ACE-Step Audio Inpaint 模型和音频转音频流程,但编辑后音频的商业使用权取决于原模型作者及提供方(acestep-ai)的许可,也取决于您对上传源音轨拥有的权利。将结果用于商业产品、广告、电影或游戏前,请查看 ACE-Step 官方许可并确认源音频权利。平台侧问题可联系 hi@runcomfy.com。

关注我们
  • 领英
  • Facebook
  • Instagram
  • Twitter
支持
  • Discord
  • 电子邮件
  • 系统状态
  • 附属
视频模型
  • MiniMax H3 Open
  • FLUX 3 Image to Video
  • MiniMax H3 Open Image to Video
  • Wan 2.6 Flash
  • Happy Horse 1.1 reference to video
  • Seedance 1.5 Pro Text to Video
  • 查看所有模型 →
图像模型
  • Seedream 5.0 Pro Image Edit
  • Flux 2 Flash Edit
  • Nano Banana Pro
  • seedream 4.0
  • GPT Image 2
  • Qwen Image Edit 2511 LoRA
  • 查看所有模型 →
法律
  • 服务条款
  • 隐私政策
  • Cookie 政策
RunComfy
版权 2026 RunComfy. 保留所有权利。

RunComfy 是首选的 ComfyUI 平台,提供 ComfyUI 在线 环境和服务,以及 ComfyUI 工作流 具有惊艳的视觉效果。 RunComfy还提供 AI Models, 帮助艺术家利用最新的AI工具创作出令人惊叹的艺术作品。