logo
RunComfy
  • ComfyUI
  • 訓練器新
  • 模型
  • API
  • 定價
discord logo
模型
探索
所有模型
資源庫
生成記錄
模型 API
API 文檔
API 金鑰
帳戶
使用情況

Seed Audio 1.0:支援預設聲音與參考音訊的文字轉音訊模型和 API | RunComfy

bytedance/seed-audio-1.0/text-to-audio

在 RunComfy 上使用 Seed Audio 1.0,根據文字、參考音訊片段或圖片產生自然的語音音訊。支援預設聲音,並可調整語速、音高和輸出格式,可在瀏覽器中使用或透過 API 呼叫。

要合成的文字。請依序使用 @Audio1、@Audio2、@Audio3 引用參考音訊片段。
用於合成的預設聲音。
最多可加入 3 段參考音訊,並在提示詞中以 @Audio1、@Audio2、@Audio3 引用。每段最長 30s、最大 10MB,支援 wav/mp3/pcm/ogg_opus。
一張參考圖片(jpeg/png/webp,最大 10MB)。不能與參考音訊同時使用。
輸出音訊的容器格式。
輸出音訊的取樣率,以 Hz 為單位。
朗讀速度。1.0 為正常速度,0.5 為半速,2.0 為雙倍速度。
輸出音量。1.0 為正常音量,0.5 為一半,2.0 為兩倍。
以半音為單位調整聲音音高。0 為正常音高,-12 降低一個八度,12 提高一個八度。
Idle
The rate is $0.075 per minute.

Seed Audio 1.0 簡介

Bytedance 推出的 Seed Audio 1.0 可將文字提示詞轉換為高品質、自然流暢的音訊,並可透過文字、最多三段參考音訊或一張圖片進行引導,費用為每分鐘 $0.075。
Seed Audio 1.0 以提示詞驅動的合成方式取代按腳本錄音和配音人員排程,讓創作者、產品團隊與在地化工作室在幾分鐘內製作語音音訊。
開發者既可在瀏覽器中使用 RunComfy 上的 Seed Audio 1.0,也可透過 HTTP API 呼叫,無須自行託管或擴充模型。
適合:配音與旁白 | 多語系在地化 | 互動式音訊原型

Bytedance / Seed Audio 1.0#


Seed Audio 1.0 是 Bytedance 推出的文字轉音訊模型,可將文字提示詞轉換為清晰、自然的語音與口播音訊。你可以透過三種方式引導結果:只使用文字提示詞、使用最多三段簡短參考音訊,或使用一張用來影響表達方式的參考圖片。


輸出規格:僅音訊 / 格式 wav、mp3、pcm、ogg_opus / 取樣率 8 kHz 至 48 kHz。


特色#


Seed Audio 1.0 專為快速、彈性且表達方式可控的音訊合成而打造。


  • 三種引導模式:可只根據文字、使用預設聲音或使用自己的參考音訊驅動合成;也支援以參考圖片取代音訊進行引導。
  • 依序引用參考音訊:在提示詞中使用 @Audio1、@Audio2 和 @Audio3 引用最多三段音訊,可混合多個來源或將目標表達方式帶入朗讀。
  • 多語言預設聲音:提供涵蓋英文、中文、西班牙文、日文、印尼文和葡萄牙文組合的預設聲音。
  • 表達控制:可調整語速、音量和音高,使朗讀節奏與語氣符合專案需求。
  • 彈性輸出:可匯出 wav、mp3、pcm 或 ogg_opus,並支援最高 48 kHz 取樣率,方便後續編輯。

參數#


參數必填類型預設值範圍 / 選項說明
prompt*是 (*)string—自由文字要合成的文字;請依序使用 @Audio1、@Audio2、@Audio3 引用參考音訊。
voice否stringvivi_mixed_en_zh_ja_es_id預設聲音清單用於合成的預設聲音。
audio_urls否array—最多 3 個 URL參考音訊(wav/mp3/pcm/ogg_opus),每段最長 30s、最大 10MB。
image_url否string—jpeg/png/webp,最大 10MB一張參考圖片;不能與參考音訊同時使用。
output_format否stringmp3wav, mp3, pcm, ogg_opus輸出音訊的容器格式。
sample_rate否integer240008000 - 48000輸出取樣率,以 Hz 為單位。
speed否number10.5 - 2.0朗讀速度;1.0 為正常節奏。
volume否number10.5 - 2.0輸出音量;1.0 為正常音量。
pitch否integer0-12 - 12以半音為單位調整音高。

價格#


RunComfy 上的 Seed Audio 1.0 依生成音訊的長度計費。


計費單位費率
每分鐘生成音訊$0.075

預估費用範例


片長預估費用
15 s~$0.019
30 s~$0.038
60 s~$0.075
120 s~$0.150

使用方式#


按照以下步驟,使用 Seed Audio 1.0 取得自然清晰的朗讀效果。


  1. 在 RunComfy 上開啟 Seed Audio 1.0 模型,並展開生成面板。
  2. 輸入要朗讀的提示詞,使用自然的標點,讓語句節奏和停頓更準確。
  3. 選擇預設聲音;如果需要特定表達方式,也可以略過此項並加入參考音訊。
  4. 如需使用參考音訊,請加入最多三個音訊 URL,並在提示詞中以 @Audio1、@Audio2、@Audio3 引用。
  5. 也可以不使用參考音訊,改為提供一張參考圖片來引導朗讀語氣。
  6. 調整語速、音量和音高,再選擇適合工作流程的 output_format 與 sample_rate。
  7. 開始生成、試聽結果,然後從任務記錄中下載檔案。
  8. 如需自動化,可將相同欄位傳送至 RunComfy 上的 Seed Audio 1.0 端點,無須自行託管。

提示詞與參考素材技巧#


  • 按照你希望聽到的方式書寫:短句和清楚標點能讓 Seed Audio 1.0 的朗讀節奏更穩定。
  • 參考音訊應簡短、乾淨;每段控制在 30 秒、10MB 以內,結果會更可靠。
  • 確保音訊順序與提示詞引用一致,讓 @Audio1、@Audio2 和 @Audio3 指向正確來源。
  • 快速製作草稿時使用預設聲音;需要特定角色時,再改用參考音訊。
  • 僅在沒有傳入音訊時使用圖片引導,因為兩種參考模式不能同時使用。
  • 小幅調整語速和音高;變化過大會讓朗讀聽起來不自然。

Seed Audio 1.0 與其他模型的比較#


  • 多模態提示:與許多只支援文字的語音工具不同,Seed Audio 1.0 可接收文字、參考音訊或圖片來塑造輸出(依據公開資訊)。
  • 參考素材處理:使用 @Audio 標記依序引用音訊,比單一固定聲音欄位提供更精細的來源控制。
  • 彈性輸出:多種容器格式和廣泛的取樣率範圍,讓 Seed Audio 1.0 的結果可以輕鬆接入現有工作流程。

相關模型

luma-ray-2/text-to-video

根據必填文字提示詞產生影片。可選擇六種長寬比、`540p`/`720p`/`1080p`、`5` 秒/`9` 秒,以及是否循環播放。

wan-2-2/lora/image-to-video

依提示詞讓起始圖像動起來,並設定 LoRA、影格數、FPS、解析度、長寬比、推論步數與隨機種子。

hailuo-2-3/standard/image-to-video

Hailuo 2.3 讓設計師輕鬆將靜態圖像轉化為逼真動態影片,精準掌控每個細節創意。

veo-3-1/fast/extend-video

依照提示詞將現有影片延長 7 秒,以 720p 輸出,並可選擇是否產生音訊。

minimax-h3/text-to-video

MiniMax H3:768p/2K 文字轉視頻,附原生立體聲音訊

gemini-omni-flash/image-to-video

將一張靜態影像生成含同步音訊的短影片。

常見問題

Seed Audio 1.0 是什麼?它在文字轉音訊工作流程中有什麼作用?

Seed Audio 1.0 是 Bytedance 推出的文字轉音訊模型,可將文字提示詞轉換為清晰、自然的語音與口播音訊。在 RunComfy 的文字轉音訊工作流程中,輸入希望朗讀的內容,還可透過預設聲音、參考音訊片段或一張圖片引導表達方式。它適合希望無須安排錄音即可透過提示詞製作音訊的創作者。

Seed Audio 1.0 最適合哪些生成任務?

Seed Audio 1.0 適合製作配音、旁白、角色台詞、音訊短劇和多語言朗讀。預設聲音與表達控制項可調整節奏、音量和音高,使其符合場景或品牌需求。Seed Audio 1.0 還支援參考音訊,因此也適合需要在多段音訊中維持目標表達方式一致的情況。

Seed Audio 1.0 如何使用參考音訊和參考圖片?

使用 Seed Audio 1.0 時,最多可加入三段參考音訊,並在提示詞中依序以 @Audio1、@Audio2 和 @Audio3 引用,藉此混合多個來源或把目標表達方式帶入朗讀。也可以改為提供一張參考圖片來引導語氣,但圖片與音訊參考不能在同一個請求中同時使用。為取得可靠結果,每段參考音訊應保持簡短,控制在約 30 秒、10MB 以內。

哪些團隊和正式使用情境最適合 Seed Audio 1.0?

內容創作者、產品團隊和在地化工作室可以使用 Seed Audio 1.0 製作解說配音、應用程式語音提示、廣告口播和多語言配音。開發者還可將 Seed Audio 1.0 接入工作流程,根據腳本或行銷文案按需生成語音。預設聲音與參考素材驅動的表達方式兼顧快速草稿和更具體的角色需求,並可在同一個介面中完成。

使用 Seed Audio 1.0 前需要了解哪些輸入和輸出選項?

Seed Audio 1.0 必須提供提示詞,還可選擇聲音、參考音訊和圖片輸入,並支援調整語速、音量和音高。輸出格式可選 wav、mp3、pcm 或 ogg_opus,取樣率範圍為 8 kHz 至 48 kHz。音訊大小和支援格式等確切限制可能隨供應商設定而變動,請在整合前查看 RunComfy 參數面板。

開發者可以透過 RunComfy API 使用 Seed Audio 1.0 嗎?

可以。你可以先在 RunComfy AI Playground Web UI 中調整提示詞、聲音、參考素材和表達控制項,直到 Seed Audio 1.0 的輸出符合目標。設定穩定後,使用完全相同的參數透過 RunComfy API 呼叫 Seed Audio 1.0,即可從後端或內容工作流程自動生成音訊。這樣既能在瀏覽器中迭代,也能在程式碼中執行正式任務,而不會改變模型行為。

在 RunComfy 上使用 Seed Audio 1.0 生成音訊需要多少費用?

Seed Audio 1.0 的生成任務會消耗 RunComfy 餘額中的 usd / credits;根據目前可用的供應商資訊,此模型按每分鐘生成音訊 $0.075 計費。新使用者通常會取得免費試用 usd 額度,之後的使用遵循模型頁面顯示的 Generation 規則。目前費率和各模式間可能存在的差異,請參閱 RunComfy 上 Seed Audio 1.0 頁面的 Generation 區段。

關注我們
  • 領英
  • Facebook
  • Instagram
  • Twitter
支持
  • Discord
  • 電子郵件
  • 系統狀態
  • 附屬
視頻模型
  • MiniMax H3 Open
  • FLUX 3 Image to Video
  • MiniMax H3 Open Image to Video
  • Wan 2.6 Flash
  • Happy Horse 1.1 reference to video
  • Seedance 1.5 Pro Text to Video
  • 查看所有模型 →
影像模型
  • Seedream 5.0 Pro Image Edit
  • Flux 2 Flash Edit
  • Nano Banana Pro
  • seedream 4.0
  • GPT Image 2
  • Qwen Image Edit 2511 LoRA
  • 查看所有模型 →
法律
  • 服務條款
  • 隱私政策
  • Cookie 政策
RunComfy
版權 2026 RunComfy. 保留所有權利。

RunComfy 是首選的 ComfyUI 平台,提供 ComfyUI 在線 環境和服務,以及 ComfyUI 工作流程 具有驚豔的視覺效果。 RunComfy還提供 AI Models, 幫助藝術家利用最新的AI工具創作出令人驚艷的藝術作品。