2本の音声と1枚の画像から動画を生成し、話者の再生順を指定できます。
Wan 3.0 Reference To Video は、テキスト プロンプトと参照メディアを取得し、それらを尊重する新しいクリップを作成します。参照画像、ビデオ、またはオーディオを指定し、プロンプトでそれらを画像 1、ビデオ 1、またはオーディオ 1 として指定して、誰が表示されるか、どのように動くか、シーンのサウンドがどのように聞こえるかを制御します。
この参照エンドポイントは、繰り返し登場するキャラクター、特定の製品、クリップから取得したモーション スタイル、または新しいショットに持ち込まれるオーディオ フィールなど、一貫性のある作業のために構築されています。参照は、指定した順序で照合されます。
| パラメータ | 必須 | タイプ | デフォルト | 範囲/オプション | 説明 |
|---|---|---|---|---|---|
| プロンプト* | はい (*) | 文字列 | - | - | シーン、被写体、モーション、カメラ、照明、スタイル。 |
| reference_images | 条件付き | 配列 | 空 | 最大 10 | 被写体やシーンの一貫性を保つための参考画像。 |
| reference_videos | 条件付き | 配列 | 空 | 最大 5 | 参考ビデオ (各 1 ~ 15 秒、合計 15 秒)。 |
| reference_audios | 条件付き | 配列 | 空 | 最大 5 | 参考音声 (合計 15 秒)。 |
| 解像度 | いいえ | 文字列 | 720p | 480p、720p、1080p | 出力解像度層。 |
| aspect_ratio | いいえ | 文字列 | 16:9 | 16:9、9:16、1:1、4:3、3:4、adaptive | 出力アスペクト比。 |
| 期間 | いいえ | 整数 | 5 | 2-30 | 秒単位の出力長。 |
| enable_audio | いいえ | ブール値 | 本当 | 真 / 偽 | 同期されたオーディオ トラックを含めます。 |
| 種子 | いいえ | 整数 | ランダム | 0-2147483647 | 再現可能な結果のシード。 |
reference_images、reference_videos、または reference_audios の少なくとも 1 つを指定します。
課金は課金秒数単位です。出力動画の長さに参照動画の合計長さを加えた秒数で計算します。料金は 480p で 0.049 ドル/秒、720p で 0.099 ドル/秒、1080p で 0.199 ドル/秒です。画像と音声の参照は長さとしては課金されません。オーディオのオン/オフで料金は変わりません。送信前の表示額は見積もりで、最終金額は実行後に確定します。
2本の音声と1枚の画像から動画を生成し、話者の再生順を指定できます。
画像をなめらかな映像へ。自然な動きと一貫した表現で創造力を広げるAI動画生成ツール。
静止画のポートレートを、表情豊かで自然な動画へ高精度に変換します。
テキスト プロンプトと 1 ~ 3 つの参照クリップから動画を作成し、長さ、出力サイズ、ショット構造、シード、ネガティブ プロンプト、音声生成をコントロールします。
開始フレームと終了フレームの間に、任意のネイティブ音声付き動画を生成
Dreamina 3.0がテキストを精密な映像に変換。手軽に映画のようなAI動画を創り出せます。
Wan 3.0 Reference To Video は、画像、ビデオ、オーディオなどの参照メディアと組み合わせたテキスト プロンプトからクリップを作成します。これは一貫性のある作業を目的として設計されており、手動で合成するのではなく、新しいショット全体でキャラクター、製品、またはモーション スタイルを認識できる状態に保ちます。
1 回のリクエストで最大 10 個の参照画像、最大 5 個の参照ビデオ、および最大 5 個の参照オーディオ クリップを受け入れます。画像はアイデンティティをロックするのに役立ち、ビデオはモーションやペースをガイドし、オーディオはサウンドを制御します。プロンプトでそれぞれを画像 1、ビデオ 1、またはオーディオ 1 として指定します。
直接の視覚参照を提供するため、Wan 3.0 Reference To Video は、プロンプトのみを使用する場合よりも、キャラクターまたはオブジェクトの外観を生成されたシーンに確実に反映できます。一般に、クリーンな単一被写体の参照画像は、最も強力なアイデンティティ ロックを提供します。
参照ビデオは MP4 または MOV で、それぞれ 1 ~ 15 秒、参照ビデオの合計時間は 15 秒以内である必要があります。参考音声も合計約15秒以内に収まります。実行前に、RunComfy パラメータ パネルで正確な電流制限を確認してください。
出力は 480p、720p、または 1080p で利用でき、長さは 2 ~ 30 秒、アスペクト比は 16:9、9:16、1:1、4:3、3:4 などです。同期されたオーディオ トラックを生成したり、クリップをサイレントでエクスポートしたりすることもできます。
複数の参照間で一貫性が必要な場合、または画像、ビデオ、および音声ガイダンスを 1 回のショットで組み合わせて使用する必要がある場合は、Wan 3.0 Reference To Video を使用します。既存の 1 つの最初のフレームを単にアニメーション化したい場合は、画像からビデオへの変換を使用します。
はい。 RunComfy モデル UI で Wan 3.0 Reference To Video をプロトタイプ化し、同じパラメーターを使用して RunComfy HTTP API を介して同じモデルを呼び出すことができます。これにより、ブラウザーのテストと運用の自動化の間で、リファレンス駆動のセットアップの一貫性が保たれます。
課金秒数あたりの料金は、480p で 1 秒あたり 0.049 ドル、720p で 0.099 ドル、1080p で 0.199 ドルです。課金秒数は生成動画の長さに、添付した参照動画の合計長さを加えたものです(画像・音声は長さとしては課金されません)。参照動画の長さは実行後に確定するため、送信前の表示額は見積もりです。通常、新規ユーザーは、大規模な実行の前に Wan 3.0 Reference To Video を試すための無料試用期間を取得します。
RunComfyは最高の ComfyUI プラットフォームです。次のものを提供しています: ComfyUIオンライン 環境とサービス、および ComfyUIワークフロー 魅力的なビジュアルが特徴です。 RunComfyはまた提供します AI Models, アーティストが最新のAIツールを活用して素晴らしいアートを作成できるようにする。





