logo
RunComfy
  • ComfyUI
  • 訓練器新
  • 模型
  • API
  • 定價
discord logo
模型
探索
所有模型
資源庫
生成記錄
模型 API
API 文檔
API 金鑰
帳戶
使用情況

ACE-Step Audio Inpaint:在模型頁面與 API 上進行音訊片段、歌詞與風格改寫 | RunComfy

acestep-ai/ace-step/audio-inpaint

用新風格標籤或歌詞重新合成音軌中的指定片段,再無縫接回原混音;可在 RunComfy 模型頁面和 HTTP API 中使用。

0:00
0:00
要編輯的原始音訊。請提供 MP3、WAV 或 FLAC 檔案的 HTTPS 網址,最長 60 分鐘。
以逗號分隔的曲風、情緒和樂器標籤,用於控制重製片段的風格。
起始時間的參照點。start 從音軌開頭向後計算,end 從音軌末尾向前倒算。
可編輯片段的開始位置,單位為秒,並按所選參照點計算。
結束時間的參照點。start 從音軌開頭向後計算,end 從音軌末尾向前倒算。
可編輯片段的結束位置,單位為秒,並按所選參照點計算。
重製片段的選填歌詞。留空則由模型寫詞;若不需要人聲,請填寫 [inst] 或 [instrumental]。
用於復現結果的隨機種子。設為 -1 則每次隨機。
Idle
The rate is $0.0002 per second of output audio.

ACE-Step Audio Inpaint 簡介

ACE Studio 的 ACE-Step Audio Inpaint 可重新合成現有音軌中的指定區間,依輸出音訊每秒 $0.0002 計費;它能替換歌詞、配器或情緒,同時保持其餘混音內容不變。它以定向、提示詞驅動的局部重繪,取代整首歌曲重新渲染和手動拆分音軌,加快製作人、聲音設計師、遊戲音訊團隊和廣告創意人員的音樂修復與混音迭代。開發者既可在瀏覽器中使用 RunComfy 上的 ACE-Step Audio Inpaint,也可透過 HTTP API 呼叫,無須自行部署模型或管理擴充。
適用場景:歌詞改寫與補錄 | 段落風格重塑與混音 | 旁白和音效修復

ACE Studio / ACE-Step Audio Inpaint#


ACE-Step Audio Inpaint 是一款音訊編輯模型,可重新渲染現有音軌中的指定區間,而不影響其他部分。提供原始音訊 URL,標記片段起止位置,再用風格標籤和選填歌詞描述替換內容;模型會在原位置合成新片段,並將其接回前後混音。


輸出格式:僅音訊 / 原始音訊最長 60 分鐘 / 片段範圍 0–240 秒 / 取樣率由服務供應商定義。


核心亮點#


  • 片段級改寫:用起止時間鎖定區間,僅重新合成該區間;其餘音訊逐位元保持不變。
  • 邊界感知拼接:模型會參考片段前後的音訊,使新片段在速度、調性和音色上自然銜接,避免明顯接縫。
  • 可從兩端定位:時間既可從開頭正向計算,也可從結尾倒算,便於修復尾奏和音軌末端。
  • 標籤驅動的風格與歌詞重寫:用簡短標籤和選填歌詞改變配器、情緒或演唱內容。
  • 可復現版本:固定種子可鎖定某次結果;使用隨機種子則可探索同一需求的不同版本。
  • 頁面與 API 一致:RunComfy 模型頁面和 HTTP API 接收完全相同的輸入。

參數#


參數必填類型預設值範圍 / 選項說明
audio*是(*)string—MP3 / WAV / FLAC 的 HTTPS URL,最長 60 分鐘要編輯的原始音訊檔案。
tags*是(*)string—自由文字以逗號分隔的曲風、情緒和樂器標籤,用於控制片段風格。
start_time_relative_to否stringstartstart、endstart_time 的參照點。
start_time否number—0–240可編輯片段的起始秒數。
end_time_relative_to否stringstartstart、endend_time 的參照點。
end_time否number300–240可編輯片段的結束秒數。
lyrics否string—自由文字或 [inst] / [instrumental]重製片段的歌詞;留空則由模型寫詞。
seed否integer-1-1–2147483647用於復現結果的隨機種子;-1 表示隨機。

價格#


RunComfy 上的 ACE-Step Audio Inpaint 依所生成輸出音訊的長度計費。


計費單位費率
每輸出 1 秒音訊$0.0002

預估費用範例


輸出長度預估費用
30 秒約 $0.006
60 秒約 $0.012
180 秒(3 分鐘)約 $0.036

提示詞與參考建議#


  • 將片段邊界放在自然的節拍或樂句末尾,讓轉接更符合編曲邏輯。
  • 使用多個互補標籤,例如“lofi, mellow piano, soft drums”,鎖定片段的曲風和配器。
  • 若要細微修復,請讓新標籤貼近前後音訊的能量感;若要明顯混音變化,則可刻意拉開風格差距。
  • 提供結構清楚、音節數一致的歌詞,使改寫後的唱句與周圍小節相銜接。
  • 若要生成純音樂或去除片段中的人聲,請將 lyrics 設為 [inst] 或 [instrumental]。
  • 對 start_time_relative_to 使用 end 並設定較小偏移,可直接調整淡出或結尾副歌,無須從頭計算時間。
  • 迭代時固定種子,只修改標籤或歌詞,便於判斷差異來自哪項編輯。
  • 每次聚焦幾個小節,通常比改寫很長區間更容易獲得乾淨的融合效果。

相關模型

ltx-2/pro/image-to-video

根據提示詞讓必填來源圖片動起來,可精確選擇 6、8 或 10 秒,1080p~2160p,25 或 50 FPS,固定 16:9,並可產生音訊。

one-to-all-animation/1.3b

將驅動影片中的動作遷移到參考角色圖片,並可設定正向/反向提示詞和產生參數。

happyhorse-1.0/reference-to-video

HappyHorse 1.0 參考影片將多達 9 個參考影像和提示融合成一個具有穩定身份的連貫多字元片段。

kling-2-1/standard/image-to-video

使用 Kling 2.1 Standard 根據必填圖片和提示詞生成影片,並可設定時長、寬高比、負向提示詞和提示詞強度。

flux-3/keyframes-to-video

從具有可選音頻的多關鍵幀靜態圖像生成視頻

hailuo-2-3/standard/text-to-video

以文字打造動感影片,Hailuo 2.3 結合高階動態生成技術,讓創作者輕鬆產出逼真10秒短片。

常見問題

ACE-Step Audio Inpaint 是什麼?它在音訊轉音訊流程中能做什麼?

ACE-Step Audio Inpaint 是 acestep-ai 推出的音訊編輯模型,可改寫現有音軌中的指定時間區間,同時保留周圍音訊。在 RunComfy 的音訊轉音訊流程中,提供來源 URL、標記起止時間,再輸入風格標籤或新歌詞,ACE-Step Audio Inpaint 便只重新生成該片段。它適合修復、風格重塑和定向混音,無須重製整首歌曲。

ACE-Step Audio Inpaint 最適合哪些生成任務?

ACE-Step Audio Inpaint 適合修復節拍不準或含噪的小節、改寫一段主歌或副歌、重塑某一段的配器,以及替換成品中的某句歌詞。它也可修補短旁白或音效,並保持周圍音訊不變。由於按區間工作,它比整首歌曲生成更適合混音、母帶前處理和內容編輯流程。

ACE-Step Audio Inpaint 與整曲文字轉音樂或分軌編輯有何區別?

與從零製作歌曲的文字轉音樂模型相較,ACE-Step Audio Inpaint 專注於指定時間區間的編輯,並將新內容無縫融合到現有音軌。與手動分軌後再生成相較,它在一次音訊轉音訊任務中完成片段選擇、重新合成和交叉淡化,讓技術美術更精準地決定哪些內容要變、哪些必須保留。

哪些團隊和正式製作場景最適合 ACE-Step Audio Inpaint?

音樂製作人、聲音設計師、遊戲音訊團隊和廣告創意人員需要修復、改寫或重塑現有音軌的某一段時,都可使用 ACE-Step Audio Inpaint。開發者可以把它整合至編輯工具,讓使用者圈選區間並透過音訊轉音訊介面提交新標籤或歌詞;內容團隊也可用它完成預告片、Podcast或遊戲過場的最後修補。

使用 ACE-Step Audio Inpaint 前需要了解哪些輸入與輸出限制?

原始音訊通常透過 MP3、WAV 或 FLAC 的公開 HTTPS 網址提供;依照目前可取得的服務供應商資訊,最長約 60 分鐘。ACE-Step Audio Inpaint 的可編輯區間由 start_time 和 end_time 確定,兩者範圍均為 0–240 秒,並可相對音軌開頭或結尾定位。取樣率和確切格式支援等限制取決於服務供應商設定,請以 RunComfy 參數面板的即時值為準。

如何從 Playground 中測試 ACE-Step Audio Inpaint 遷移到 RunComfy API 的正式環境呼叫?

先在 RunComfy AI Playground 網頁介面中調整音訊網址、片段範圍、標籤、歌詞和種子,直到 ACE-Step Audio Inpaint 的音訊轉音訊結果符合目標。設定穩定後,即可透過 RunComfy API 以相同參數呼叫同一模型,在後端或內容工作流程中自動編輯;瀏覽器負責創意迭代,程式碼負責正式環境執行,模型行為不變。

在 RunComfy 上執行 ACE-Step Audio Inpaint 如何計費?

ACE-Step Audio Inpaint 會從 RunComfy 餘額中扣除美元 / 點數。依照目前可取得的服務供應商資訊,模型依輸出音訊每秒 $0.0002 計費。新用戶通常可獲得免費試用額度,之後按模型頁面的「生成」區塊所示規則收費;最新費率和模式差異也請以該區域為準。

ACE-Step Audio Inpaint 的輸出可以商用嗎?

RunComfy 提供 ACE-Step Audio Inpaint 模型和音訊轉音訊流程,但編輯後音訊的商業使用權取決於原模型作者與服務供應商(acestep-ai)的授權條款,也取決於您對上傳原始音軌擁有的權利。將結果用於商業產品、廣告、電影或遊戲前,請檢視 ACE-Step 官方授權條款,並確認原始音訊權利。平台端問題可聯絡 hi@runcomfy.com。

關注我們
  • 領英
  • Facebook
  • Instagram
  • Twitter
支持
  • Discord
  • 電子郵件
  • 系統狀態
  • 附屬
視頻模型
  • MiniMax H3 Open
  • FLUX 3 Image to Video
  • MiniMax H3 Open Image to Video
  • Wan 2.6 Flash
  • Happy Horse 1.1 reference to video
  • Seedance 1.5 Pro Text to Video
  • 查看所有模型 →
影像模型
  • Seedream 5.0 Pro Image Edit
  • Flux 2 Flash Edit
  • Nano Banana Pro
  • seedream 4.0
  • GPT Image 2
  • Qwen Image Edit 2511 LoRA
  • 查看所有模型 →
法律
  • 服務條款
  • 隱私政策
  • Cookie 政策
RunComfy
版權 2026 RunComfy. 保留所有權利。

RunComfy 是首選的 ComfyUI 平台,提供 ComfyUI 在線 環境和服務,以及 ComfyUI 工作流程 具有驚豔的視覺效果。 RunComfy還提供 AI Models, 幫助藝術家利用最新的AI工具創作出令人驚艷的藝術作品。