logo
RunComfy
  • ComfyUI
  • トレーナー新着
  • モデル
  • API
  • 価格
discord logo
モデル
探索
すべてのモデル
ライブラリ
生成履歴
モデルAPI
APIドキュメント
APIキー
アカウント
使用量

Seed Audio 1.0:ボイスプリセット・参照音声対応のテキストから音声生成 | RunComfy Models・API

bytedance/seed-audio-1.0/text-to-audio

Seed Audio 1.0なら、テキスト、参照クリップ、画像から自然なスピーチや音声を生成できます。ボイスプリセットに加え、速度、ピッチ、出力形式を調整でき、RunComfyのブラウザとAPIから利用できます。

音声化するテキスト。参照クリップは順番に@Audio1、@Audio2、@Audio3と記述して指定します。
合成に使用するプリセット音声。
最大3つの参照クリップ。プロンプト内で@Audio1、@Audio2、@Audio3として指定します。各クリップは30秒・10MBまで。対応形式:wav/mp3/pcm/ogg_opus。
参照画像1枚(jpeg/png/webp、最大10MB)。参照音声とは併用できません。
出力する音声ファイルのコンテナ形式。
出力音声のサンプルレート(Hz)。
読み上げ速度。1.0が通常、0.5が半分、2.0が2倍の速度です。
出力音量。1.0が通常、0.5が半分、2.0が2倍の音量です。
音声のピッチを半音単位で変更します。0が標準、-12で1オクターブ下、12で1オクターブ上になります。
Idle
The rate is $0.21 per minute.

Seed Audio 1.0の紹介

BytedanceのSeed Audio 1.0は、文章から高品質で自然な音声を生成します。テキスト、最大3つの参照クリップ、または1枚の画像で表現を誘導でき、料金は1分あたり$0.21です。
台本収録や声優のスケジュール調整をプロンプトによる音声合成に置き換え、クリエイター、プロダクトチーム、ローカライズスタジオが数分で音声コンテンツを制作できるようにします。
RunComfyではブラウザとHTTP APIの両方から利用できるため、モデルを自前でホストしたりスケーリングしたりする必要はありません。
おすすめの用途:ボイスオーバー・ナレーション | 多言語ローカライズ | インタラクティブ音声のプロトタイピング

Bytedance / Seed Audio 1.0#


Seed Audio 1.0は、Bytedanceが提供するテキストから音声生成モデルです。文章によるプロンプトを、明瞭で自然なスピーチや音声へ変換します。出力は、テキストプロンプトのみ、最大3つの短い参照クリップ、または話し方の手がかりとなる1枚の参照画像という3つの方法で誘導できます。


出力形式:音声のみ / 形式 wav、mp3、pcm、ogg_opus / サンプルレート 8 kHz~48 kHz。


主な特長#


Seed Audio 1.0は、表現を調整できる高速で柔軟な音声合成モデルです。


  • 3つの誘導方法:テキストのみ、プリセット音声、独自の参照音声から合成できます。音声の代わりに参照画像で誘導することも可能です。
  • 順番で指定する参照音声:プロンプト内で最大3つのクリップを@Audio1、@Audio2、@Audio3として指定し、複数のソースを組み合わせたり、狙った話し方を読み上げに反映したりできます。
  • 多言語プリセット:英語、中国語、スペイン語、日本語、インドネシア語、ポルトガル語を組み合わせたプリセット音声から選べます。
  • 話し方を調整:速度、音量、ピッチを変更し、プロジェクトに必要なテンポやトーンに合わせられます。
  • 柔軟な出力:wav、mp3、pcm、ogg_opusで書き出せ、最大48 kHzのサンプルレートに対応。後工程の編集にも組み込みやすい形式です。

パラメータ#


パラメータ必須型デフォルト範囲 / 選択肢説明
prompt*はい (*)string—自由入力音声化するテキスト。参照クリップは@Audio1、@Audio2、@Audio3の順で指定します。
voiceいいえstringvivi_mixed_en_zh_ja_es_idプリセット音声一覧合成に使用するプリセット音声。
audio_urlsいいえarray—最大3件のURL参照クリップ(wav/mp3/pcm/ogg_opus)。各クリップは30秒・10MBまで。
image_urlいいえstring—jpeg/png/webp、最大10MB参照画像1枚。参照音声とは併用できません。
output_formatいいえstringmp3wav, mp3, pcm, ogg_opus出力する音声ファイルのコンテナ形式。
sample_rateいいえinteger240008000 - 48000出力サンプルレート(Hz)。
speedいいえnumber10.5 - 2.0読み上げ速度。1.0が通常です。
volumeいいえnumber10.5 - 2.0出力音量。1.0が通常です。
pitchいいえinteger0-12 - 12半音単位のピッチ変更。

料金#


RunComfy上のSeed Audio 1.0は、生成音声の長さに応じた時間制の料金体系です。


課金単位料金
生成音声1分あたり$0.21

料金の目安


長さ概算料金
15秒約$0.053
30秒約$0.105
60秒約$0.21
120秒約$0.42

使い方#


Seed Audio 1.0で聞き取りやすい音声を作る手順は次のとおりです。


  1. RunComfyでSeed Audio 1.0モデルを開き、生成パネルを表示します。
  2. 読み上げたいプロンプトを入力します。自然な句読点を使うと、フレーズや間が整いやすくなります。
  3. プリセット音声を選びます。特定の話し方を求める場合は、プリセットを使わず参照音声を添付します。
  4. 参照音声を使う場合は、最大3つのクリップURLを追加し、プロンプト内で@Audio1、@Audio2、@Audio3として指定します。
  5. 音声の代わりに、話し方のトーンを誘導する参照画像を1枚指定することもできます。
  6. 速度、音量、ピッチを調整し、制作フローに合うoutput_formatとsample_rateを選びます。
  7. 生成を実行し、結果をプレビューして、ジョブ履歴からファイルをダウンロードします。
  8. 自動化する場合は、同じフィールドをRunComfyのSeed Audio 1.0エンドポイントへ送信します。セルフホスティングは不要です。

プロンプトと参照素材のコツ#


  • 話してほしい形で文章を書きます。短い文と明確な句読点を使うと、Seed Audio 1.0の読み上げテンポが安定します。
  • 参照クリップは短くクリアなものを使います。安定した結果を得るため、各クリップを30秒・10MB以内に収めます。
  • @Audio1、@Audio2、@Audio3が意図したソースを指すよう、クリップの順番とプロンプト内の指定を一致させます。
  • すばやい下書きにはプリセット音声を使い、特定のキャラクター性が必要になったら参照音声へ切り替えます。
  • 画像と音声の参照モードは併用できないため、音声を渡さない場合のみ画像による誘導を使います。
  • 速度とピッチは少しずつ調整します。大幅に変えると、読み上げが不自然になる場合があります。

Seed Audio 1.0と他モデルの比較#


  • マルチモーダルなプロンプト:多くのテキスト専用音声ツールと異なり、Seed Audio 1.0はテキスト、参照音声、画像から出力を調整できます(公開情報に基づく)。
  • 参照素材の扱い:@Audioマーカーでクリップを順番に指定できるため、固定された音声スロットが1つだけのモデルより細かくソースを制御できます。
  • 柔軟な出力:複数のコンテナ形式と幅広いサンプルレートに対応し、Seed Audio 1.0の結果を既存の制作パイプラインへ簡単に組み込めます。

関連モデル

Hailuo Video 01 Director

直感操作で映画のような映像演出ができるAI映像制作ツール

video-background-removal/video-to-video

動画内の人物や物体を背景から分離し、コーデック、輪郭調整、被写体タイプを設定できます。

kling-3.0/standard/image-to-video

カメラとオーディオのコントロールを使用して、静止画を映画のようなモーション クリップに変換します。

sora-2/text-to-video

必須のテキストプロンプトから、音声付き動画を生成します。出力サイズは `1280x720` または `720x1280`、長さは `4`、`8`、`12` 秒から選べます。

ai-avatar/v2/standard

1枚のポートレートと1本の音声からトーキングアバター動画を生成し、任意のプロンプトで動きや話し方を指定できます。

happyhorse-1.1/text-to-video

テキスト、画像、参照素材からネイティブ音声付き動画を生成できるマルチモーダルAIモデル。

よくある質問

Seed Audio 1.0とは何ですか?テキストから音声を生成するワークフローで何ができますか?

Seed Audio 1.0は、文章によるプロンプトを明瞭で自然なスピーチや音声へ変換するBytedanceのモデルです。RunComfyでは、読み上げたい内容を入力し、任意でプリセット音声、参照クリップ、1枚の画像を使って話し方を調整できます。収録作業なしでプロンプトから音声を作りたいクリエイターに適しています。

Seed Audio 1.0はどのような生成タスクに向いていますか?

ボイスオーバー、ナレーション、キャラクターの台詞、オーディオドラマの短編、多言語の読み上げに適しています。プリセット音声と表現の設定を使い、シーンやブランドに合わせてテンポ、音量、ピッチを調整できます。参照音声にも対応するため、複数のクリップで狙った話し方を揃えたい場合にも役立ちます。

Seed Audio 1.0では参照音声と参照画像をどのように使いますか?

最大3つの参照クリップを添付し、プロンプト内で順番に@Audio1、@Audio2、@Audio3と指定できます。複数のソースを組み合わせたり、狙った話し方を読み上げに反映したりできます。音声の代わりに1枚の参照画像でトーンを誘導することもできますが、画像と音声は同じリクエストで併用できません。安定した結果を得るには、各参照クリップを約30秒・10MB以内に収めてください。

Seed Audio 1.0は、どのようなチームや本番用途に適していますか?

コンテンツ制作者、プロダクトチーム、ローカライズスタジオが、解説のボイスオーバー、アプリの音声案内、広告の読み上げ、多言語吹き替えに利用できます。開発者は、台本やキャンペーン文から必要に応じて音声を生成するパイプラインへ組み込めます。プリセット音声と参照素材による話し方の指定を1つの画面で使い分けられるため、すばやい下書きから特定のキャラクター表現まで対応できます。

Seed Audio 1.0を使う前に知っておくべき入出力オプションはありますか?

必須のプロンプトに加え、音声、参照音声、画像を任意で入力でき、速度、音量、ピッチも調整できます。出力形式はwav、mp3、pcm、ogg_opus、サンプルレートは8 kHz~48 kHzです。クリップサイズや対応形式などの正確な制限はプロバイダー設定で変わる場合があるため、実装前にRunComfyのパラメータパネルを確認してください。

開発者はRunComfy APIからSeed Audio 1.0を利用できますか?

はい。RunComfy AI PlaygroundのWeb UIでプロンプト、音声、参照素材、表現設定を調整し、目的の結果になるまで試せます。設定が固まったら、同じパラメータでRunComfy APIからSeed Audio 1.0を呼び出し、バックエンドやコンテンツ制作パイプラインを自動化できます。モデルの挙動を変えずに、ブラウザでの試行からコードによる本番実行へ移行できます。

RunComfyでSeed Audio 1.0を使う場合、料金はいくらですか?

Seed Audio 1.0の生成ではRunComfy残高のusd / creditsを消費します。利用可能なプロバイダー情報に基づく料金は、生成音声1分あたり$0.21です。新規ユーザーには通常、試用できる無料usd分が付与され、その後はモデルページに表示されるGenerationルールに従って課金されます。最新の料金とモード別の違いは、Seed Audio 1.0ページのGenerationセクションで確認してください。

フォローする
  • LinkedIn
  • Facebook
  • Instagram
  • Twitter
サポート
  • Discord
  • メール
  • システムステータス
  • アフィリエイト
ビデオモデル
  • Wan 3.0 Reference To Video
  • LTX 2.5 Pro
  • Wan 3.0
  • Wan 2.6 Flash
  • MiniMax H3 Open Image to Video
  • Happy Horse 1.1 reference to video
  • すべてのモデルを見る →
画像モデル
  • seedream 4.0
  • Seedream 5.0 Pro Image Edit
  • Flux 2 Flash Edit
  • Nano Banana Pro
  • Qwen Image Edit 2511 LoRA
  • Flux 2 Pro
  • すべてのモデルを見る →
法的情報
  • 利用規約
  • プライバシーポリシー
  • Cookieポリシー
RunComfy
著作権 2026 RunComfy. All Rights Reserved.

RunComfyは最高の ComfyUI プラットフォームです。次のものを提供しています: ComfyUIオンライン 環境とサービス、および ComfyUIワークフロー 魅力的なビジュアルが特徴です。 RunComfyはまた提供します AI Models, アーティストが最新のAIツールを活用して素晴らしいアートを作成できるようにする。