根據提示詞讓必填來源圖片動起來,可精確選擇 6、8 或 10 秒,1080p~2160p,25 或 50 FPS,固定 16:9,並可產生音訊。
ACE-Step Audio Inpaint 是一款音訊編輯模型,可重新渲染現有音軌中的指定區間,而不影響其他部分。提供原始音訊 URL,標記片段起止位置,再用風格標籤和選填歌詞描述替換內容;模型會在原位置合成新片段,並將其接回前後混音。
輸出格式:僅音訊 / 原始音訊最長 60 分鐘 / 片段範圍 0–240 秒 / 取樣率由服務供應商定義。
| 參數 | 必填 | 類型 | 預設值 | 範圍 / 選項 | 說明 |
|---|---|---|---|---|---|
| audio* | 是(*) | string | — | MP3 / WAV / FLAC 的 HTTPS URL,最長 60 分鐘 | 要編輯的原始音訊檔案。 |
| tags* | 是(*) | string | — | 自由文字 | 以逗號分隔的曲風、情緒和樂器標籤,用於控制片段風格。 |
| start_time_relative_to | 否 | string | start | start、end | start_time 的參照點。 |
| start_time | 否 | number | — | 0–240 | 可編輯片段的起始秒數。 |
| end_time_relative_to | 否 | string | start | start、end | end_time 的參照點。 |
| end_time | 否 | number | 30 | 0–240 | 可編輯片段的結束秒數。 |
| lyrics | 否 | string | — | 自由文字或 [inst] / [instrumental] | 重製片段的歌詞;留空則由模型寫詞。 |
| seed | 否 | integer | -1 | -1–2147483647 | 用於復現結果的隨機種子;-1 表示隨機。 |
RunComfy 上的 ACE-Step Audio Inpaint 依所生成輸出音訊的長度計費。
| 計費單位 | 費率 |
|---|---|
| 每輸出 1 秒音訊 | $0.0002 |
預估費用範例
| 輸出長度 | 預估費用 |
|---|---|
| 30 秒 | 約 $0.006 |
| 60 秒 | 約 $0.012 |
| 180 秒(3 分鐘) | 約 $0.036 |
根據提示詞讓必填來源圖片動起來,可精確選擇 6、8 或 10 秒,1080p~2160p,25 或 50 FPS,固定 16:9,並可產生音訊。
將驅動影片中的動作遷移到參考角色圖片,並可設定正向/反向提示詞和產生參數。
HappyHorse 1.0 參考影片將多達 9 個參考影像和提示融合成一個具有穩定身份的連貫多字元片段。
使用 Kling 2.1 Standard 根據必填圖片和提示詞生成影片,並可設定時長、寬高比、負向提示詞和提示詞強度。
從具有可選音頻的多關鍵幀靜態圖像生成視頻
以文字打造動感影片,Hailuo 2.3 結合高階動態生成技術,讓創作者輕鬆產出逼真10秒短片。
ACE-Step Audio Inpaint 是 acestep-ai 推出的音訊編輯模型,可改寫現有音軌中的指定時間區間,同時保留周圍音訊。在 RunComfy 的音訊轉音訊流程中,提供來源 URL、標記起止時間,再輸入風格標籤或新歌詞,ACE-Step Audio Inpaint 便只重新生成該片段。它適合修復、風格重塑和定向混音,無須重製整首歌曲。
ACE-Step Audio Inpaint 適合修復節拍不準或含噪的小節、改寫一段主歌或副歌、重塑某一段的配器,以及替換成品中的某句歌詞。它也可修補短旁白或音效,並保持周圍音訊不變。由於按區間工作,它比整首歌曲生成更適合混音、母帶前處理和內容編輯流程。
與從零製作歌曲的文字轉音樂模型相較,ACE-Step Audio Inpaint 專注於指定時間區間的編輯,並將新內容無縫融合到現有音軌。與手動分軌後再生成相較,它在一次音訊轉音訊任務中完成片段選擇、重新合成和交叉淡化,讓技術美術更精準地決定哪些內容要變、哪些必須保留。
音樂製作人、聲音設計師、遊戲音訊團隊和廣告創意人員需要修復、改寫或重塑現有音軌的某一段時,都可使用 ACE-Step Audio Inpaint。開發者可以把它整合至編輯工具,讓使用者圈選區間並透過音訊轉音訊介面提交新標籤或歌詞;內容團隊也可用它完成預告片、Podcast或遊戲過場的最後修補。
原始音訊通常透過 MP3、WAV 或 FLAC 的公開 HTTPS 網址提供;依照目前可取得的服務供應商資訊,最長約 60 分鐘。ACE-Step Audio Inpaint 的可編輯區間由 start_time 和 end_time 確定,兩者範圍均為 0–240 秒,並可相對音軌開頭或結尾定位。取樣率和確切格式支援等限制取決於服務供應商設定,請以 RunComfy 參數面板的即時值為準。
先在 RunComfy AI Playground 網頁介面中調整音訊網址、片段範圍、標籤、歌詞和種子,直到 ACE-Step Audio Inpaint 的音訊轉音訊結果符合目標。設定穩定後,即可透過 RunComfy API 以相同參數呼叫同一模型,在後端或內容工作流程中自動編輯;瀏覽器負責創意迭代,程式碼負責正式環境執行,模型行為不變。
ACE-Step Audio Inpaint 會從 RunComfy 餘額中扣除美元 / 點數。依照目前可取得的服務供應商資訊,模型依輸出音訊每秒 $0.0002 計費。新用戶通常可獲得免費試用額度,之後按模型頁面的「生成」區塊所示規則收費;最新費率和模式差異也請以該區域為準。
RunComfy 提供 ACE-Step Audio Inpaint 模型和音訊轉音訊流程,但編輯後音訊的商業使用權取決於原模型作者與服務供應商(acestep-ai)的授權條款,也取決於您對上傳原始音軌擁有的權利。將結果用於商業產品、廣告、電影或遊戲前,請檢視 ACE-Step 官方授權條款,並確認原始音訊權利。平台端問題可聯絡 hi@runcomfy.com。
RunComfy 是首選的 ComfyUI 平台,提供 ComfyUI 在線 環境和服務,以及 ComfyUI 工作流程 具有驚豔的視覺效果。 RunComfy還提供 AI Models, 幫助藝術家利用最新的AI工具創作出令人驚艷的藝術作品。