直感操作で映画のような映像演出ができるAI映像制作ツール
Seed Audio 1.0は、Bytedanceが提供するテキストから音声生成モデルです。文章によるプロンプトを、明瞭で自然なスピーチや音声へ変換します。出力は、テキストプロンプトのみ、最大3つの短い参照クリップ、または話し方の手がかりとなる1枚の参照画像という3つの方法で誘導できます。
出力形式:音声のみ / 形式 wav、mp3、pcm、ogg_opus / サンプルレート 8 kHz~48 kHz。
Seed Audio 1.0は、表現を調整できる高速で柔軟な音声合成モデルです。
| パラメータ | 必須 | 型 | デフォルト | 範囲 / 選択肢 | 説明 |
|---|---|---|---|---|---|
| prompt* | はい (*) | string | — | 自由入力 | 音声化するテキスト。参照クリップは@Audio1、@Audio2、@Audio3の順で指定します。 |
| voice | いいえ | string | vivi_mixed_en_zh_ja_es_id | プリセット音声一覧 | 合成に使用するプリセット音声。 |
| audio_urls | いいえ | array | — | 最大3件のURL | 参照クリップ(wav/mp3/pcm/ogg_opus)。各クリップは30秒・10MBまで。 |
| image_url | いいえ | string | — | jpeg/png/webp、最大10MB | 参照画像1枚。参照音声とは併用できません。 |
| output_format | いいえ | string | mp3 | wav, mp3, pcm, ogg_opus | 出力する音声ファイルのコンテナ形式。 |
| sample_rate | いいえ | integer | 24000 | 8000 - 48000 | 出力サンプルレート(Hz)。 |
| speed | いいえ | number | 1 | 0.5 - 2.0 | 読み上げ速度。1.0が通常です。 |
| volume | いいえ | number | 1 | 0.5 - 2.0 | 出力音量。1.0が通常です。 |
| pitch | いいえ | integer | 0 | -12 - 12 | 半音単位のピッチ変更。 |
RunComfy上のSeed Audio 1.0は、生成音声の長さに応じた時間制の料金体系です。
| 課金単位 | 料金 |
|---|---|
| 生成音声1分あたり | $0.21 |
料金の目安
| 長さ | 概算料金 |
|---|---|
| 15秒 | 約$0.053 |
| 30秒 | 約$0.105 |
| 60秒 | 約$0.21 |
| 120秒 | 約$0.42 |
Seed Audio 1.0で聞き取りやすい音声を作る手順は次のとおりです。
直感操作で映画のような映像演出ができるAI映像制作ツール
動画内の人物や物体を背景から分離し、コーデック、輪郭調整、被写体タイプを設定できます。
カメラとオーディオのコントロールを使用して、静止画を映画のようなモーション クリップに変換します。
必須のテキストプロンプトから、音声付き動画を生成します。出力サイズは `1280x720` または `720x1280`、長さは `4`、`8`、`12` 秒から選べます。
1枚のポートレートと1本の音声からトーキングアバター動画を生成し、任意のプロンプトで動きや話し方を指定できます。
テキスト、画像、参照素材からネイティブ音声付き動画を生成できるマルチモーダルAIモデル。
Seed Audio 1.0は、文章によるプロンプトを明瞭で自然なスピーチや音声へ変換するBytedanceのモデルです。RunComfyでは、読み上げたい内容を入力し、任意でプリセット音声、参照クリップ、1枚の画像を使って話し方を調整できます。収録作業なしでプロンプトから音声を作りたいクリエイターに適しています。
ボイスオーバー、ナレーション、キャラクターの台詞、オーディオドラマの短編、多言語の読み上げに適しています。プリセット音声と表現の設定を使い、シーンやブランドに合わせてテンポ、音量、ピッチを調整できます。参照音声にも対応するため、複数のクリップで狙った話し方を揃えたい場合にも役立ちます。
最大3つの参照クリップを添付し、プロンプト内で順番に@Audio1、@Audio2、@Audio3と指定できます。複数のソースを組み合わせたり、狙った話し方を読み上げに反映したりできます。音声の代わりに1枚の参照画像でトーンを誘導することもできますが、画像と音声は同じリクエストで併用できません。安定した結果を得るには、各参照クリップを約30秒・10MB以内に収めてください。
コンテンツ制作者、プロダクトチーム、ローカライズスタジオが、解説のボイスオーバー、アプリの音声案内、広告の読み上げ、多言語吹き替えに利用できます。開発者は、台本やキャンペーン文から必要に応じて音声を生成するパイプラインへ組み込めます。プリセット音声と参照素材による話し方の指定を1つの画面で使い分けられるため、すばやい下書きから特定のキャラクター表現まで対応できます。
必須のプロンプトに加え、音声、参照音声、画像を任意で入力でき、速度、音量、ピッチも調整できます。出力形式はwav、mp3、pcm、ogg_opus、サンプルレートは8 kHz~48 kHzです。クリップサイズや対応形式などの正確な制限はプロバイダー設定で変わる場合があるため、実装前にRunComfyのパラメータパネルを確認してください。
はい。RunComfy AI PlaygroundのWeb UIでプロンプト、音声、参照素材、表現設定を調整し、目的の結果になるまで試せます。設定が固まったら、同じパラメータでRunComfy APIからSeed Audio 1.0を呼び出し、バックエンドやコンテンツ制作パイプラインを自動化できます。モデルの挙動を変えずに、ブラウザでの試行からコードによる本番実行へ移行できます。
Seed Audio 1.0の生成ではRunComfy残高のusd / creditsを消費します。利用可能なプロバイダー情報に基づく料金は、生成音声1分あたり$0.21です。新規ユーザーには通常、試用できる無料usd分が付与され、その後はモデルページに表示されるGenerationルールに従って課金されます。最新の料金とモード別の違いは、Seed Audio 1.0ページのGenerationセクションで確認してください。
RunComfyは最高の ComfyUI プラットフォームです。次のものを提供しています: ComfyUIオンライン 環境とサービス、および ComfyUIワークフロー 魅力的なビジュアルが特徴です。 RunComfyはまた提供します AI Models, アーティストが最新のAIツールを活用して素晴らしいアートを作成できるようにする。