logo
RunComfy
  • ComfyUI
  • 訓練器新
  • 模型
  • API
  • 定價
discord logo
模型
探索
所有模型
資源庫
生成記錄
模型 API
API 文檔
API 金鑰
帳戶
使用情況

Ace Step 1.5:在模型頁面與 API 上透過文字、歌詞和風格標籤生成音樂 | RunComfy

acestep-ai/ace-step-1.5/text-to-audio

根據風格標籤和選填歌詞生成最長 4 分鐘的歌曲,提供原創人聲與高傳真音質,可在 RunComfy 模型頁面和 HTTP API 中使用。

用逗號分隔曲風、情緒和樂器標籤,以控制製作曲目的風格。
選填的演唱內容。留空或填寫 [inst] / [instrumental] 可生成純音樂;使用 [Verse]、[Chorus]、[Bridge] 標記組織歌曲結構。
音訊長度,單位為秒。
Idle
The rate is $0.0003 per second.

Ace Step 1.5 簡介

ACE Studio 的 Ace Step 1.5 可將文字風格標籤和選填的結構化歌詞製作成最長 4 分鐘的完整歌曲,以每秒 $0.0003 計費,支援 50 多種語言,並提供連貫人聲和高傳真音質。它以標籤驅動、提示詞可控的 Ace Step 1.5 生成,取代人工配樂、預約歌手和多軌製作,加快媒體團隊、遊戲工作室、內容創作者和廣告製作人的音樂構思。開發者既可在瀏覽器中使用 RunComfy 上的 Ace Step 1.5,也可透過 HTTP API 呼叫,無須自行部署模型或管理擴充。
適用場景:音樂樣帶原型 | 電影與遊戲配樂 | 短影片廣告音樂

ACE Studio / Ace Step 1.5#


Ace Step 1.5 是一款文字轉音樂模型,可將逗號分隔的風格標籤和選填的結構化歌詞製作成包含人聲、配器與同步唱詞的完整歌曲。模型支援 50 多種語言,執行效率高,適合快速迭代,長度可從數秒延伸到 4 分鐘(240 秒)。


輸出格式:僅音訊 / 長度 5–240 秒 / 立體聲 / 取樣率由服務供應商定義。


參數#


參數必填類型預設值範圍 / 選項說明
tags*是(*)string—自由文字以逗號分隔的曲風、情緒和樂器標籤。
lyrics否string—自由文字或 [inst] / [instrumental]演唱內容;使用 [Verse]、[Chorus]、[Bridge] 等標記組織歌曲結構。
duration否integer605–240音訊長度,單位為秒。
seed否integer-1-1–2147483647用於復現結果的隨機種子;-1 表示隨機。

價格#


RunComfy 上的 Ace Step 1.5 依生成音訊長度計費。


計費單位費率
每生成 1 秒音訊$0.0003

預估費用範例


長度預估費用
30 秒約 $0.009
60 秒(預設)約 $0.018
120 秒約 $0.036
240 秒(4 分鐘)約 $0.072

使用方法#


1) 在 RunComfy 中開啟 Ace Step 1.5 模型,並展開生成設定面板。

2) 輸入“lofi, hiphop, chill, mellow piano”等風格標籤,定義曲風、情緒和配器。

3) 視需要加入歌詞;清晰分隔 [Verse]、[Chorus] 和 [Bridge],或填寫 [inst] 生成純音樂。

4) 將長度設為 5–240 秒;先用短片段確認方向,再生成完整的 4 分鐘版本。

5) 若要比較標籤或歌詞變化帶來的影響,請鎖定種子;希望探索更多變化時則保留 -1。

6) 開始生成、試聽結果,然後從工作紀錄下載音訊檔案。

7) 透過 API 使用時,將相同欄位傳送到 RunComfy 上的 Ace Step 1.5 端點即可,無須自行部署。

8) 將效果出色的種子和標籤組合儲存為預設,以便在整個專案中保持一致的聲音方向。

相關模型

dreamina-3-0/pro/text-to-video

以Dreamina 3.0將文字轉化為動態影像,精準呈現電影級創意場景。

wan-2-1/image-to-video

以 AI 將靜態圖像轉換為流暢動態影片,呈現電影級畫面與真實運動感。

veo-3-1/fast/first-last-frame-to-video

以Veo 3.1 Fast 輕鬆將影像轉為動態影片,展現創意視覺與專業級畫面品質。

pikaframes

使用 Pikaframes 將起始圖片到結束圖片之間的變化製作成流暢動畫。

runway-gen-3-alpha/turbo/image-to-video

支援高擬真動畫與風格控制,Runway Gen-3 Alpha Turbo 為設計師開啟創作新境界

kling-video-o3/pro/text-to-video

專業級電影感文字轉影片,輸出每秒 $0.112。

常見問題

Ace Step 1.5 是什麼?它在文字轉音訊流程中能做什麼?

Ace Step 1.5 是 acestep-ai 推出的文字轉音樂模型,可將風格標籤和選填的結構化歌詞製作成包含旋律、節奏與人聲的完整音軌。在 RunComfy 的文字轉音訊流程中,只需描述曲風、情緒和歌曲結構,Ace Step 1.5 就能生成唱詞同步、整體連貫的音樂,適合希望跳過手動作曲、快速透過提示詞創作的使用者。

Ace Step 1.5 最適合哪些生成任務?

Ace Step 1.5 適合為影片生成背景音樂、製作短歌曲樣帶、氛圍迴圈、廣告短曲和遊戲場景參考音軌。它擅長標籤式風格控制,使用幾個描述詞便可調整曲風、配器和能量。人聲與歌詞生成功能也讓 Ace Step 1.5 適合歌曲草稿和創意原型。

Ace Step 1.5 與原版 Ace Step 及其他音樂模型有何區別?

與原版 Ace Step 相較,Ace Step 1.5 保留標籤驅動控制和最長 4 分鐘長度,同時將多語言歌詞支援延伸到 50 多種語言,並改進結構化歌詞的處理。與純器樂系統相較,它能一次生成原生人聲、配器和同步唱詞;種子參數則幫助開發者圍繞選定方向穩定復現與迭代。

哪些團隊和正式製作場景最適合 Ace Step 1.5?

設計師、技術美術、影片創作者和產品團隊可用 Ace Step 1.5 製作預告片、社群內容、遊戲音訊原型、電商影片和廣告素材。開發者也可將其整合至依場景後設資料或行銷活動需求即時生成配樂的流程。Ace Step 1.5 跨多種語言同時支援人聲與純音樂,一個介面即可覆蓋廣泛音訊需求。

使用 Ace Step 1.5 前需要了解哪些輸入與輸出限制?

Ace Step 1.5 的單次輸出長度可在 5–240 秒(4 分鐘)之間調整,只要求填寫 tags 欄位,另可提供結構化 lyrics。支援的音訊格式和標籤組合等其他限制取決於目前服務供應商設定,請在正式導入前檢視 RunComfy 參數面板;不同模式或服務供應商設定可能有所不同。

如何從模型介面測試 Ace Step 1.5 遷移到 RunComfy API 的正式環境呼叫?

先在 RunComfy AI Playground 網頁介面中調整風格標籤、歌詞、長度和種子,直到 Ace Step 1.5 的文字轉音訊結果符合目標。設定穩定後,即可透過 RunComfy API 以相同參數呼叫同一模型,在後端或內容工作流程中自動生成;瀏覽器負責創意迭代,程式碼負責正式環境執行,底層模型行為不變。

在 RunComfy 上使用 Ace Step 1.5 生成音訊如何計費?

Ace Step 1.5 會從 RunComfy 餘額中扣除美元 / 點數。依照目前可取得的服務供應商資訊,模型以每秒 $0.0003 計費。新用戶通常可獲得免費試用額度,之後按 Ace Step 1.5 頁面的「生成」區塊所示規則收費;最新費率和不同模式的差異也請以該區域為準。

關注我們
  • 領英
  • Facebook
  • Instagram
  • Twitter
支持
  • Discord
  • 電子郵件
  • 系統狀態
  • 附屬
視頻模型
  • MiniMax H3 Open
  • FLUX 3 Image to Video
  • MiniMax H3 Open Image to Video
  • Wan 2.6 Flash
  • Happy Horse 1.1 reference to video
  • Seedance 1.5 Pro Text to Video
  • 查看所有模型 →
影像模型
  • Seedream 5.0 Pro Image Edit
  • Flux 2 Flash Edit
  • Nano Banana Pro
  • seedream 4.0
  • GPT Image 2
  • Qwen Image Edit 2511 LoRA
  • 查看所有模型 →
法律
  • 服務條款
  • 隱私政策
  • Cookie 政策
RunComfy
版權 2026 RunComfy. 保留所有權利。

RunComfy 是首選的 ComfyUI 平台,提供 ComfyUI 在線 環境和服務,以及 ComfyUI 工作流程 具有驚豔的視覺效果。 RunComfy還提供 AI Models, 幫助藝術家利用最新的AI工具創作出令人驚艷的藝術作品。