根據必填文字提示詞產生影片。可選擇六種長寬比、`540p`/`720p`/`1080p`、`5` 秒/`9` 秒,以及是否循環播放。
Seed Audio 1.0 是 Bytedance 推出的文字轉音訊模型,可將文字提示詞轉換為清晰、自然的語音與口播音訊。你可以透過三種方式引導結果:只使用文字提示詞、使用最多三段簡短參考音訊,或使用一張用來影響表達方式的參考圖片。
輸出規格:僅音訊 / 格式 wav、mp3、pcm、ogg_opus / 取樣率 8 kHz 至 48 kHz。
Seed Audio 1.0 專為快速、彈性且表達方式可控的音訊合成而打造。
| 參數 | 必填 | 類型 | 預設值 | 範圍 / 選項 | 說明 |
|---|---|---|---|---|---|
| prompt* | 是 (*) | string | — | 自由文字 | 要合成的文字;請依序使用 @Audio1、@Audio2、@Audio3 引用參考音訊。 |
| voice | 否 | string | vivi_mixed_en_zh_ja_es_id | 預設聲音清單 | 用於合成的預設聲音。 |
| audio_urls | 否 | array | — | 最多 3 個 URL | 參考音訊(wav/mp3/pcm/ogg_opus),每段最長 30s、最大 10MB。 |
| image_url | 否 | string | — | jpeg/png/webp,最大 10MB | 一張參考圖片;不能與參考音訊同時使用。 |
| output_format | 否 | string | mp3 | wav, mp3, pcm, ogg_opus | 輸出音訊的容器格式。 |
| sample_rate | 否 | integer | 24000 | 8000 - 48000 | 輸出取樣率,以 Hz 為單位。 |
| speed | 否 | number | 1 | 0.5 - 2.0 | 朗讀速度;1.0 為正常節奏。 |
| volume | 否 | number | 1 | 0.5 - 2.0 | 輸出音量;1.0 為正常音量。 |
| pitch | 否 | integer | 0 | -12 - 12 | 以半音為單位調整音高。 |
RunComfy 上的 Seed Audio 1.0 依生成音訊的長度計費。
| 計費單位 | 費率 |
|---|---|
| 每分鐘生成音訊 | $0.075 |
預估費用範例
| 片長 | 預估費用 |
|---|---|
| 15 s | ~$0.019 |
| 30 s | ~$0.038 |
| 60 s | ~$0.075 |
| 120 s | ~$0.150 |
按照以下步驟,使用 Seed Audio 1.0 取得自然清晰的朗讀效果。
根據必填文字提示詞產生影片。可選擇六種長寬比、`540p`/`720p`/`1080p`、`5` 秒/`9` 秒,以及是否循環播放。
依提示詞讓起始圖像動起來,並設定 LoRA、影格數、FPS、解析度、長寬比、推論步數與隨機種子。
Hailuo 2.3 讓設計師輕鬆將靜態圖像轉化為逼真動態影片,精準掌控每個細節創意。
依照提示詞將現有影片延長 7 秒,以 720p 輸出,並可選擇是否產生音訊。
MiniMax H3:768p/2K 文字轉視頻,附原生立體聲音訊
將一張靜態影像生成含同步音訊的短影片。
Seed Audio 1.0 是 Bytedance 推出的文字轉音訊模型,可將文字提示詞轉換為清晰、自然的語音與口播音訊。在 RunComfy 的文字轉音訊工作流程中,輸入希望朗讀的內容,還可透過預設聲音、參考音訊片段或一張圖片引導表達方式。它適合希望無須安排錄音即可透過提示詞製作音訊的創作者。
Seed Audio 1.0 適合製作配音、旁白、角色台詞、音訊短劇和多語言朗讀。預設聲音與表達控制項可調整節奏、音量和音高,使其符合場景或品牌需求。Seed Audio 1.0 還支援參考音訊,因此也適合需要在多段音訊中維持目標表達方式一致的情況。
使用 Seed Audio 1.0 時,最多可加入三段參考音訊,並在提示詞中依序以 @Audio1、@Audio2 和 @Audio3 引用,藉此混合多個來源或把目標表達方式帶入朗讀。也可以改為提供一張參考圖片來引導語氣,但圖片與音訊參考不能在同一個請求中同時使用。為取得可靠結果,每段參考音訊應保持簡短,控制在約 30 秒、10MB 以內。
內容創作者、產品團隊和在地化工作室可以使用 Seed Audio 1.0 製作解說配音、應用程式語音提示、廣告口播和多語言配音。開發者還可將 Seed Audio 1.0 接入工作流程,根據腳本或行銷文案按需生成語音。預設聲音與參考素材驅動的表達方式兼顧快速草稿和更具體的角色需求,並可在同一個介面中完成。
Seed Audio 1.0 必須提供提示詞,還可選擇聲音、參考音訊和圖片輸入,並支援調整語速、音量和音高。輸出格式可選 wav、mp3、pcm 或 ogg_opus,取樣率範圍為 8 kHz 至 48 kHz。音訊大小和支援格式等確切限制可能隨供應商設定而變動,請在整合前查看 RunComfy 參數面板。
可以。你可以先在 RunComfy AI Playground Web UI 中調整提示詞、聲音、參考素材和表達控制項,直到 Seed Audio 1.0 的輸出符合目標。設定穩定後,使用完全相同的參數透過 RunComfy API 呼叫 Seed Audio 1.0,即可從後端或內容工作流程自動生成音訊。這樣既能在瀏覽器中迭代,也能在程式碼中執行正式任務,而不會改變模型行為。
Seed Audio 1.0 的生成任務會消耗 RunComfy 餘額中的 usd / credits;根據目前可用的供應商資訊,此模型按每分鐘生成音訊 $0.075 計費。新使用者通常會取得免費試用 usd 額度,之後的使用遵循模型頁面顯示的 Generation 規則。目前費率和各模式間可能存在的差異,請參閱 RunComfy 上 Seed Audio 1.0 頁面的 Generation 區段。
RunComfy 是首選的 ComfyUI 平台,提供 ComfyUI 在線 環境和服務,以及 ComfyUI 工作流程 具有驚豔的視覺效果。 RunComfy還提供 AI Models, 幫助藝術家利用最新的AI工具創作出令人驚艷的藝術作品。