FLUX 3 Draft: 720p での高速かつ低コストのテキストからビデオへのプレビュー
Wan 3.0 Reference To Video は、テキスト プロンプトと参照メディアを取得し、それらを尊重する新しいクリップを作成します。参照画像、ビデオ、またはオーディオを指定し、プロンプトでそれらを画像 1、ビデオ 1、またはオーディオ 1 として指定して、誰が表示されるか、どのように動くか、シーンのサウンドがどのように聞こえるかを制御します。
この参照エンドポイントは、繰り返し登場するキャラクター、特定の製品、クリップから取得したモーション スタイル、または新しいショットに持ち込まれるオーディオ フィールなど、一貫性のある作業のために構築されています。参照は、指定した順序で照合されます。
| パラメータ | 必須 | タイプ | デフォルト | 範囲/オプション | 説明 |
|---|---|---|---|---|---|
| プロンプト* | はい (*) | 文字列 | - | - | シーン、被写体、モーション、カメラ、照明、スタイル。 |
| reference_images | 条件付き | 配列 | 空 | 最大 10 | 被写体やシーンの一貫性を保つための参考画像。 |
| reference_videos | 条件付き | 配列 | 空 | 最大 5 | 参考ビデオ (各 1 ~ 15 秒、合計 15 秒)。 |
| reference_audios | 条件付き | 配列 | 空 | 最大 5 | 参考音声 (合計 15 秒)。 |
| 解像度 | いいえ | 文字列 | 720p | 480p、720p、1080p | 出力解像度層。 |
| aspect_ratio | いいえ | 文字列 | 16:9 | 16:9、9:16、1:1、4:3、3:4、adaptive | 出力アスペクト比。 |
| 期間 | いいえ | 整数 | 5 | 2-30 | 秒単位の出力長。 |
| thinking_mode | いいえ | ブール値 | 偽 | 真 / 偽 | 複雑なプロンプトのより深い解釈。 |
| enable_audio | いいえ | ブール値 | 本当 | 真 / 偽 | 同期されたオーディオ トラックを含めます。 |
| 種子 | いいえ | 整数 | ランダム | 0-2147483647 | 再現可能な結果のシード。 |
reference_images、reference_videos、または reference_audios の少なくとも 1 つを指定します。
価格は選択した解像度によって異なります。480p では 1 秒あたり 0.06 ドル、720p では 1 秒あたり 0.12 ドル、1080p では 1 秒あたり 0.25 ドルです。オーディオを有効または無効にしてもレートは変わりません。
FLUX 3 Draft: 720p での高速かつ低コストのテキストからビデオへのプレビュー
Kling 2.5 Turboでプロンプトから動画を生成し、長さ、アスペクト比、ネガティブプロンプトを設定します。
Seedance 2.5 FLF2V 480p: 低コストでの最初から最後のフレームのドラフト移行
静止画を滑らかな映像に変換。Dreamina 3.0が2K品質のリアリズムで創作を実現。
必須の参照画像と要素定義から動画を生成します。配列順に対応する @Image/@Element トークンを使い、長さとアスペクト比を正確に指定できます。
Pikadditionsで画像内の人物や物体を既存の動画に追加します。
Wan 3.0 Reference To Video は、画像、ビデオ、オーディオなどの参照メディアと組み合わせたテキスト プロンプトからクリップを作成します。これは一貫性のある作業を目的として設計されており、手動で合成するのではなく、新しいショット全体でキャラクター、製品、またはモーション スタイルを認識できる状態に保ちます。
1 回のリクエストで最大 10 個の参照画像、最大 5 個の参照ビデオ、および最大 5 個の参照オーディオ クリップを受け入れます。画像はアイデンティティをロックするのに役立ち、ビデオはモーションやペースをガイドし、オーディオはサウンドを制御します。プロンプトでそれぞれを画像 1、ビデオ 1、またはオーディオ 1 として指定します。
直接の視覚参照を提供するため、Wan 3.0 Reference To Video は、プロンプトのみを使用する場合よりも、キャラクターまたはオブジェクトの外観を生成されたシーンに確実に反映できます。一般に、クリーンな単一被写体の参照画像は、最も強力なアイデンティティ ロックを提供します。
参照ビデオは MP4 または MOV で、それぞれ 1 ~ 15 秒、参照ビデオの合計時間は 15 秒以内である必要があります。参考音声も合計約15秒以内に収まります。実行前に、RunComfy パラメータ パネルで正確な電流制限を確認してください。
出力は 480p、720p、または 1080p で利用でき、長さは 2 ~ 30 秒、アスペクト比は 16:9、9:16、1:1、4:3、3:4 などです。同期されたオーディオ トラックを生成したり、クリップをサイレントでエクスポートしたりすることもできます。
複数の参照間で一貫性が必要な場合、または画像、ビデオ、および音声ガイダンスを 1 回のショットで組み合わせて使用する必要がある場合は、Wan 3.0 Reference To Video を使用します。既存の 1 つの最初のフレームを単にアニメーション化したい場合は、画像からビデオへの変換を使用します。
はい。 RunComfy モデル UI で Wan 3.0 Reference To Video をプロトタイプ化し、同じパラメーターを使用して RunComfy HTTP API を介して同じモデルを呼び出すことができます。これにより、ブラウザーのテストと運用の自動化の間で、リファレンス駆動のセットアップの一貫性が保たれます。
世代は解像度と期間に基づいて米ドルまたはクレジットを消費します: 480p では 1 秒あたり 0.06 ドル、720p では 1 秒あたり 0.12 ドル、1080p では 1 秒あたり 0.25 ドル。通常、新規ユーザーは、大規模な実行の前に Wan 3.0 Reference To Video を試すための無料試用期間を取得します。
RunComfyは最高の ComfyUI プラットフォームです。次のものを提供しています: ComfyUIオンライン 環境とサービス、および ComfyUIワークフロー 魅力的なビジュアルが特徴です。 RunComfyはまた提供します AI Models, アーティストが最新のAIツールを活用して素晴らしいアートを作成できるようにする。





