logo
RunComfy
  • ComfyUI
  • トレーナー新着
  • モデル
  • API
  • 価格
discord logo
モデル
探索
すべてのモデル
ライブラリ
生成履歴
モデルAPI
APIドキュメント
APIキー
アカウント
使用量

Wan 3.0 Reference To Video: Models and API でのマルチモーダル リファレンス ビデオの生成 | RunComfy

wan-ai/wan-3.0/reference-to-video

Wan 3.0 Reference To Video は、プロンプトと画像、ビデオ、オーディオのリファレンスを組み合わせて、一貫した主題、モーション、サウンドを含む一貫したクリップを作成します。

シーン、被写体、モーション、カメラの動き、照明、スタイルを説明します。画像 1、ビデオ 1、音声 1 の順に参考資料を参照してください。
Image 1
被写体、物体、シーンの一貫性を保つための最大 10 枚の参照画像。少なくとも 1 つの参照 (画像、ビデオ、またはオーディオ) が必要です。
モーションまたはシーンのガイダンス用に、最大 5 つのリファレンス ビデオ (MP4 または MOV、それぞれ 1 ~ 15 秒、合計 15 秒以内)。
サウンドやタイミングをガイドするための最大 5 つのリファレンス オーディオ クリップ (合計 15 秒以内)。
出力解像度層。素早いドラフトには 480p を使用し、高品質の出力には 1080p を使用します。
生成されたビデオの出力アスペクト比。
生成されたビデオの長さ (秒単位)。範囲は 2 ~ 30 です。反復するには短く始めて、モーションが正しく見えるようになったら増やします。
When on, the model may rewrite your prompt for richer scene detail before generation. Turn off for faster turnaround if your prompt is already precise.
オンの場合、出力ビデオには同期されたオーディオ トラックが含まれます。無音クリップの場合はオフにします。
再現可能な結果のためのランダムシード。範囲は 0 ~ 2147483647 です。
Idle
The rate per counted second (generated video duration plus the combined duration of reference videos) is $0.049 for 480p, $0.099 for 720p, and $0.199 for 1080p. Image and audio references are not billed as duration.

Wan 3.0 Reference To Video の紹介

Wan 3.0 Reference To Video は、プロンプトに加えて、画像、ビデオ、オーディオなどのマルチモーダルな参照から一貫したクリップを組み立てます。長さは 2 ~ 30 秒で、アスペクト比を制御できます。脆弱な合成をリファレンスに基づいた一貫性と引き換えに、スタジオ、広告チーム、クリエイターがショット全体でキャラクター、オブジェクト、モーション、サウンドをブランドに沿った状態に保つのに役立ちます。開発者にとって、RunComfy の Wan 3.0 Reference To Video はブラウザーと HTTP API の両方で使用できるため、モデルを自分でホストしたりスケールしたりする必要はありません。
理想的な用途: 文字の一貫性 |ブランド製品のシーン |マルチモーダルなストーリーテリング

Wan-AI / Wan 3.0 Reference To Video#


Wan 3.0 Reference To Video は、テキスト プロンプトと参照メディアを取得し、それらを尊重する新しいクリップを作成します。参照画像、ビデオ、またはオーディオを指定し、プロンプトでそれらを画像 1、ビデオ 1、またはオーディオ 1 として指定して、誰が表示されるか、どのように動くか、シーンのサウンドがどのように聞こえるかを制御します。


この参照エンドポイントは、繰り返し登場するキャラクター、特定の製品、クリップから取得したモーション スタイル、または新しいショットに持ち込まれるオーディオ フィールなど、一貫性のある作業のために構築されています。参照は、指定した順序で照合されます。


ハイライト#


  • マルチモーダル リファレンス: 最大 10 個の画像、5 個のビデオ、5 個のオーディオ クリップを使用してショットをガイドします。
  • 主題の一貫性: クリップ全体でキャラクター、製品、またはオブジェクトを認識できるようにします。
  • モーションとタイミングのキュー: リファレンスビデオから動きやペースを借用します。
  • オーディオ ガイダンス: リファレンス オーディオを使用して、結果のサウンドとリズムを調整します。
  • 柔軟な出力: 2 ~ 30 秒を設定し、最終的な配置のアスペクト比を選択します。

パラメータ#


パラメータ必須タイプデフォルト範囲/オプション説明
プロンプト*はい (*)文字列--シーン、被写体、モーション、カメラ、照明、スタイル。
reference_images条件付き配列空最大 10被写体やシーンの一貫性を保つための参考画像。
reference_videos条件付き配列空最大 5参考ビデオ (各 1 ~ 15 秒、合計 15 秒)。
reference_audios条件付き配列空最大 5参考音声 (合計 15 秒)。
解像度いいえ文字列720p480p、720p、1080p出力解像度層。
aspect_ratioいいえ文字列16:916:9、9:16、1:1、4:3、3:4、adaptive出力アスペクト比。
期間いいえ整数52-30秒単位の出力長。
enable_audioいいえブール値本当真 / 偽同期されたオーディオ トラックを含めます。
種子いいえ整数ランダム0-2147483647再現可能な結果のシード。

reference_images、reference_videos、または reference_audios の少なくとも 1 つを指定します。


価格設定#


課金は課金秒数単位です。出力動画の長さに参照動画の合計長さを加えた秒数で計算します。料金は 480p で 0.049 ドル/秒、720p で 0.099 ドル/秒、1080p で 0.199 ドル/秒です。画像と音声の参照は長さとしては課金されません。オーディオのオン/オフで料金は変わりません。送信前の表示額は見積もりで、最終金額は実行後に確定します。

関連モデル

infinite-talk/fast/multi

2本の音声と1枚の画像から動画を生成し、話者の再生順を指定できます。

hunyuan/image-to-video

画像をなめらかな映像へ。自然な動きと一貫した表現で創造力を広げるAI動画生成ツール。

live-avatar

静止画のポートレートを、表情豊かで自然な動画へ高精度に変換します。

wan-2-6/video-to-video

テキスト プロンプトと 1 ~ 3 つの参照クリップから動画を作成し、長さ、出力サイズ、ショット構造、シード、ネガティブ プロンプト、音声生成をコントロールします。

flux-3/first-last-frame-to-video

開始フレームと終了フレームの間に、任意のネイティブ音声付き動画を生成

dreamina-3-0/pro/text-to-video

Dreamina 3.0がテキストを精密な映像に変換。手軽に映画のようなAI動画を創り出せます。

よくある質問

Wan 3.0 Reference To Video は何に使用されますか?

Wan 3.0 Reference To Video は、画像、ビデオ、オーディオなどの参照メディアと組み合わせたテキスト プロンプトからクリップを作成します。これは一貫性のある作業を目的として設計されており、手動で合成するのではなく、新しいショット全体でキャラクター、製品、またはモーション スタイルを認識できる状態に保ちます。

Wan 3.0 Reference To Video はどのような種類の参照を受け入れることができますか?

1 回のリクエストで最大 10 個の参照画像、最大 5 個の参照ビデオ、および最大 5 個の参照オーディオ クリップを受け入れます。画像はアイデンティティをロックするのに役立ち、ビデオはモーションやペースをガイドし、オーディオはサウンドを制御します。プロンプトでそれぞれを画像 1、ビデオ 1、またはオーディオ 1 として指定します。

Wan 3.0 Reference To Video はどのようにして主題の一貫性を保っているのでしょうか?

直接の視覚参照を提供するため、Wan 3.0 Reference To Video は、プロンプトのみを使用する場合よりも、キャラクターまたはオブジェクトの外観を生成されたシーンに確実に反映できます。一般に、クリーンな単一被写体の参照画像は、最も強力なアイデンティティ ロックを提供します。

参考ビデオとオーディオの制限は何ですか?

参照ビデオは MP4 または MOV で、それぞれ 1 ~ 15 秒、参照ビデオの合計時間は 15 秒以内である必要があります。参考音声も合計約15秒以内に収まります。実行前に、RunComfy パラメータ パネルで正確な電流制限を確認してください。

Wan 3.0 Reference To Video はどのような出力設定をサポートしていますか?

出力は 480p、720p、または 1080p で利用でき、長さは 2 ~ 30 秒、アスペクト比は 16:9、9:16、1:1、4:3、3:4 などです。同期されたオーディオ トラックを生成したり、クリップをサイレントでエクスポートしたりすることもできます。

画像からビデオへの代わりに参照からビデオへの参照を使用する必要があるのはどのような場合ですか?

複数の参照間で一貫性が必要な場合、または画像、ビデオ、および音声ガイダンスを 1 回のショットで組み合わせて使用​​する必要がある場合は、Wan 3.0 Reference To Video を使用します。既存の 1 つの最初のフレームを単にアニメーション化したい場合は、画像からビデオへの変換を使用します。

開発者は RunComfy API を通じて Wan 3.0 Reference To Video を使用できますか?

はい。 RunComfy モデル UI で Wan 3.0 Reference To Video をプロトタイプ化し、同じパラメーターを使用して RunComfy HTTP API を介して同じモデルを呼び出すことができます。これにより、ブラウザーのテストと運用の自動化の間で、リファレンス駆動のセットアップの一貫性が保たれます。

Wan 3.0 Reference To Video の RunComfy の価格はいくらですか?

課金秒数あたりの料金は、480p で 1 秒あたり 0.049 ドル、720p で 0.099 ドル、1080p で 0.199 ドルです。課金秒数は生成動画の長さに、添付した参照動画の合計長さを加えたものです(画像・音声は長さとしては課金されません)。参照動画の長さは実行後に確定するため、送信前の表示額は見積もりです。通常、新規ユーザーは、大規模な実行の前に Wan 3.0 Reference To Video を試すための無料試用期間を取得します。

フォローする
  • LinkedIn
  • Facebook
  • Instagram
  • Twitter
サポート
  • Discord
  • メール
  • システムステータス
  • アフィリエイト
ビデオモデル
  • Seedance 2.5 Reference to Video 1080p
  • Seedance 2.5 1080p Text to video
  • Seedance 2.5 1080p
  • MiniMax H3 Open
  • Wan 2.6 Flash
  • Happy Horse 1.1 reference to video
  • すべてのモデルを見る →
画像モデル
  • Qwen Image 3.0 Edit
  • Qwen Image 3.0 Pro Edit
  • Qwen Image 3.0
  • seedream 4.0
  • Flux 2 Flash Edit
  • Nano Banana Pro
  • すべてのモデルを見る →
法的情報
  • 利用規約
  • プライバシーポリシー
  • Cookieポリシー
RunComfy
著作権 2026 RunComfy. All Rights Reserved.

RunComfyは最高の ComfyUI プラットフォームです。次のものを提供しています: ComfyUIオンライン 環境とサービス、および ComfyUIワークフロー 魅力的なビジュアルが特徴です。 RunComfyはまた提供します AI Models, アーティストが最新のAIツールを活用して素晴らしいアートを作成できるようにする。

Wan 3.0 Reference To Video の例

Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...