logo
RunComfy
  • ComfyUI
  • トレーナー新着
  • モデル
  • API
  • 価格
discord logo
モデル
探索
すべてのモデル
ライブラリ
生成履歴
モデルAPI
APIドキュメント
APIキー
アカウント
使用量

Wan 3.0: Models and API での画像からビデオ、最初から最後のフレーム、オーディオ | RunComfy

wan-ai/wan-3.0/image-to-video

Wan 3.0 は、オプションの最終フレーム制御、柔軟な持続時間、アスペクト比、および洗練された短いクリップのオーディオを使用して、最初のフレームの画像を一貫したビデオにアニメーション化します。

最初のフレームをアニメーション化するモーション、アクション、カメラの動き、照明、スタイルを説明します。
モデルがビデオにアニメーション化する最初のフレーム画像。被写体をより良く保存するには、鮮明で高品質の画像を使用してください。
ビデオの最後のポーズ、構図、またはシーンをガイドするために使用されるオプションの最後のフレーム画像。
出力解像度層。素早いドラフトには 480p を使用し、高品質の出力には 1080p を使用します。
出力アスペクト比。 adaptive を使用して、入力画像の比率を一致させます。
生成されたビデオの長さ (秒単位)。範囲は 2 ~ 30 です。反復するには短く始めて、モーションが正しく見えるようになったら増やします。
複数の動きや構成要件がある複雑なシーンに対して、より深いプロンプト解釈を可能にします。
オンの場合、出力ビデオには同期されたオーディオ トラックが含まれます。無音クリップの場合はオフにします。
再現可能な結果のためのランダムシード。範囲は 0 ~ 2147483647 です。
Idle
The rate is $0.06 per second for 480p, $0.12 per second for 720p, and $0.25 per second for 1080p.

Wan 3.0 の紹介

Wan 3.0 image-to-video は、オプションの最終フレーム ガイダンス、2 ~ 30 秒の長さ、アスペクト比制御、および同期されたオーディオを使用して、単一の最初のフレーム画像を映画のようなクリップとして生き生きとさせます。遅い手動キーフレーミングと引き換えに、被写体とシーンの一貫性を保つプロンプト駆動のモーションを実現することで、製品マーケティング担当者、ポートレートやライフスタイルのクリエイター、短いクリップを迅速に配信するソーシャル チームに適しています。開発者にとって、RunComfy 上の Wan 3.0 はブラウザーと HTTP API 経由の両方で使用できるため、モデルを自分でホストしたりスケールしたりする必要はありません。
最適な用途: 製品およびマーケティング クリップ |ポートレートアニメーション |縦型ソーシャルビデオ

Wan 3.0 を選ぶ理由#


Wan 3.0 は、テキスト、画像、ビデオ、オーディオ、ファイル、Web ページを、同期したサウンドを備えた一貫したクリップに変換する Wan-AI のオールインワン ビデオ生成モデルです。このページには Wan 3.0 Image to Video が用意されています。最初のフレームの画像とプロンプトを指定すると、そのフレームが 2 ~ 30 秒のクリップにアニメーション化され、オプションでショットの終了方法を固定する最後のフレームも追加されます。同じ基礎となるモデルでテキストからビデオへの変換や参照からビデオへの変換も実行されるため、ここで開発した外観はファミリー全体に転送されます。


Wan 3.0 の利点それはあなたにとって何を意味しますか
1 つのモデル、多数の入力Wan 3.0 はテキスト、最初/最後のフレーム画像、参照画像、ビデオ、オーディオ、ドキュメント、リンクを処理するため、アイデア間でツールを切り替える必要はほとんどありません。
最初と最後のフレームの制御このページでは、開始フレームと終了フレームの両方を設定できるため、Wan 3.0 は最初のフレームのみのアニメーションよりもショットの開始方法と解決方法をより厳密に制御できます。
柔軟な 2 ~ 30 秒の出力Wan 3.0 は短いドラフトまたは長いシングルテイクをレンダリングするため、素早い反復と完成したショットが同じエンドポイントから得られます。
同期オーディオ、オプションすべての Wan 3.0 結果には、一致するオーディオ トラックを含めることができます。また、サイレント クリップをエクスポートすることもできます。オーディオを切り替えても価格は変わりません。

ベストユースケース#


  • 製品およびマーケティング ビデオ: Wan 3.0 を使用して、製品またはパックショットを、制御されたモーションとフレーミングを備えた短いプロモーション クリップに変換します。
  • ポートレートとライフスタイルのアニメーション: Wan 3.0 を使用して、ポートレート、ファッション、またはライフスタイルを自然なブランドの瞬間にアニメーション化しましょう。
  • ソーシャル メディア コンテンツ: リール、ショート、ストーリー、またはフィードの配置用に、単一の画像から垂直、正方形、またはワイドスクリーンの Wan 3.0 クリップを作成します。
  • クリエイティブ プロトタイピング: 完全なプロダクション パスにコミットする前に、Wan 3.0 を使用して固定フレームからカメラの方向、動き、およびビジュアル スタイルをテストします。

仕組み#


  1. 開始フレームを設定します: Wan 3.0 によって生命を吹き込まれる、クリーンで高解像度の最初のフレーム画像をアップロードします。
  2. 動きの説明: Wan 3.0 に、何が動くのか、カメラがどのように動くのか、時間の経過とともに光とシーンがどのように変化するのかを伝えます。
  3. エンディングのガイド (オプション): 最終的なポーズ、構図、またはシーンが重要な場合は、最後のフレーム画像を追加します。Wan 3.0 は、その 2 つの橋渡しとなります。
  4. 配信形式を選択します: 解像度、アスペクト比、2 ~ 30 秒の長さ、音声を生成するかどうかを選択し、Wan 3.0 の結果を確認して、一度に 1 つの命令を調整します。

パラメータ#


最初の表には、このページの Wan 3.0 Image to Video ツールによって公開されるコントロールがリストされています。


パラメータ必須タイプデフォルト範囲/オプション選び方
プロンプト*はい (*)文字列プロンプトの例最大 20,000 文字被写体、その動き、カメラの動き、照明、スタイルを説明します。明確な構造は長さよりも重要です。
image_url*はい (*)文字列サンプル画像画像 URL または Base64最初のフレーム Wan 3.0 からアニメーション化されます。被写体を最大限に保存するには、鮮明で明るい、整然とした画像を使用してください。
end_image_urlいいえ文字列空画像 URL または Base64オプションの最後のフレーム。エンディングのポーズや構図が決まったときに設定します。
解像度いいえ文字列720p480p、720p、1080p簡単なドラフトには 480p を使用し、より詳細な配信には 1080p を使用します。
aspect_ratioいいえ文字列adaptiveadaptive、16:9、9:16、1:1、4:3、3:4`adaptive' のままにして入力画像に従うか、特定の配置の比率を強制します。
期間いいえ整数52–30 秒モーションを調整する間は短く保ち、方向を確認したら上げます。
thinking_modeいいえブール値偽true / false複数の動きや構成ルールを組み合わせた複雑なプロンプトを有効にします。
enable_audioいいえブール値本当true / false同期されたオーディオトラックを聴き続けます。無音クリップの場合はオフにします。
シードいいえ整数ランダム0–2147483647シードを修正して、比較可能な小さな編集を行うときに結果を再現します。

  • 必須フィールドです。

次の表は、より広範な Wan 3.0 モデルをまとめたものです。参照、ドキュメント、およびテキストのみの入力は、この画像からビデオへのページのコントロールとしてではなく、モデルの他のモードおよび兄弟ツールを通じて使用できます。


コア寸法Wan 3.0
モデルwan3.0-video
生成モードテキストからビデオへ。 Image-to-Video (最初のフレーム、または最初と最後のフレーム)。画像、ビデオ、オーディオからのビデオへの参照。加えて、ドキュメントと Web リンクの参照も含まれます。
出力期間2 ~ 30 秒。ビデオ入力の場合、入力と出力は 30 秒以内に留まります。スマート持続時間オプションを使用すると、Wan 3.0 で長さを推奨できます。
解決策480P、720P、または 1080P。
出力アスペクト比adaptive (入力から推奨) または 16:9、4:3、1:1、3:4、9:16。
音声を出力オプションの同期オーディオ。画像とともに生成され、デフォルトでオンになります。
最初/最後のフレーム入力first_frame と last_frame は 1 つまで。画像: JPEG、JPG、PNG、BMP、または WEBP。片面あたり「240 ~ 8000」ピクセル。アスペクト比は最大「8:1」。それぞれ最大 20 MB。
参考画像被写体、物体、シーンの一貫性を保つための最大 10 枚の参照画像。
参考ビデオ最大 5 つのクリップ。 MP4 または MOV;それぞれ「1 ~ 15」秒。ビデオを組み合わせて最大 15 秒まで。片側あたり「240 ~ 4096」ピクセル。クリップごとに最大 100 MB。
参考音声最大 5 つのクリップ。 WAV または MP3;合計 15 秒までの音声。それぞれ最大 15 MB。
ドキュメント / Web 入力1 つのドキュメント (DOCX、PDF、PPTX、XLSX、TXT など、最大 50 ページ) または 1 つのパブリック Web リンク。
モードの独占性最初/最後のフレームの入力を、同じリクエスト内の参照、ドキュメント、またはリンクの入力と組み合わせることはできません。
プロンプト制限最大 20,000 文字。

価格設定#


Wan 3.0 の価格は、選択した解像度と生成される期間によって異なります。 Wan 3.0 オーディオを有効または無効にしても、レートは変わりません。


解像度1 秒あたりの料金5秒10代30代
480p$0.06$0.30$0.60$1.80
720p$0.12$0.60$1.20$3.60
1080p$0.25$1.25$2.50$7.50

1 ~ 4 個の出力のバッチの場合、合計を「期間 × 1 秒あたりのレート × 出力数」として計算します。


プロンプトと参照のヒント#


この再利用可能な Wan 3.0 構造を使用します。


[主題 + 詳細の定義] + [時間にわたる 1 つのモーション] + [カメラのフレーミングと動き] + [設定 + 照明] + [視覚的処理] + [音声] + [終了フレームまたは制約]


  • 件名で始めます: 最初のフレームに含まれる内容に名前を付けてから、Wan 3.0 がそれをどのように移動するかを説明します。
  • カメラを被写体から分離する: よりきれいな Wan 3.0 結果を得るために、被写体の動きとカメラの動きを個別に記述します。
  • 鮮明な最初のフレームを使用します: ビデオへの入力のぼやけ、乱雑さ、または低解像度。
  • エンディングを固定する: 特定の最終的なポーズや構図が交渉の余地のない場合は、最後のフレームの画像に手を伸ばします。
  • 思考モードをオンにする: Wan 3.0 ショットが複数の動きや構成ルールを重ねている場合に有効にします。
  • シードを修正する: テイクが正しく見えたらシードをロックし、小さなプロンプト編集を公平に比較​​できるようにします。

Wan 3.0 の比較#


この Wan 3.0 の比較をモデルファミリーのガイドとして使用してください。最大解像度と継続時間は同時に利用できない場合があり、ツールが異なれば、異なる入力やコントロールが公開される可能性があります。公開されている情報に基づいています。


モデル解像度最大持続時間オーディオ目立つ
Wan 3.0480p–1080p30代オプションの同期オーディオテキスト、最初/最後のフレーム、画像、ビデオ、オーディオからのビデオへの参照に加え、ドキュメントと Web 入力を網羅する 1 つのオールインワン モデル。
クリング3.0最大4K15秒リップシンク付きネイティブオーディオスクリプト化された広告やキャラクター シーンのマルチショット カメラの変更やスピーカー割り当てのダイアログを調整します。
海洛021080p~10代なし物理に焦点を当てたモーションと、サイレントアクションと製品ショットに対する強力な即時準拠。
シーダンス 2.51080p30代共同オーディオとビデオ同期された音声とエフェクトを使用したリファレンスを多用した生成により、アイデンティティに敏感な編集が可能です。
ヴェオ3.14K8秒ネイティブのダイアログとエフェクト映画のようなトランジションや組み立てられたシーケンスに適した最初/最後のフレームとリファレンス コントロール。

Wan 3.0 の特徴はその幅の広さです。最初のフレームをアニメーション化し、最後のフレームを尊重し、画像、ビデオ、オーディオ、ドキュメント、リンクから取得できる単一のモデルで、オプションの同期サウンドも生成できます。生命を吹き込む開始フレームがある場合は Wan 3.0 Image to Video を選択し、開始点が変更された場合はテキスト ツールまたは参照ツールに移動します。


さらに試してみたいモデル#


  • Wan 3.0 Text to Video: 開始画像がない場合は、プロンプトのみからクリップを生成します。
  • Wan 3.0 ビデオへのリファレンス: キャラクターとオブジェクトの一貫性を保つために、画像、ビデオ、オーディオのリファレンスを結合します。
  • Seedance 2.5 Text to Video: テキストから高速かつ低コストのドラフト レンダリングを生成します。
  • Kling 3.0: オプションの終了フレームと同期したオーディオを使用して開始画像をアニメーション化します。

公式リソース#


  • Wan 3.0 ビデオ生成 API リファレンス (Alibaba Cloud Model Studio)
  • Wan モデル ファミリの概要

関連モデル

seedance-2.5/first-last-frame/720p

開始静止画と終了静止画を滑らかな映画のようなビデオにブリッジします

wan-2-1/fusionx/image-to-video

画像から映画のような高品質動画を生成。直感操作で創造力を広げるFusionX。

minimax-h3-open/text-to-video

480p/768p およびネイティブ ステレオ オーディオによるオープンウェイトのテキストからビデオへの変換。

kling-video-o1/video-to-video/reference

参照動画から新しいショットを生成し、プロンプト、要素、画像、アスペクト比、長さ、元の音声で結果を調整できます。

video-background-removal/fast/video-to-video

Fast版で動画背景を除去し、コーデック、輪郭調整、被写体タイプを設定できます。

wan-2-2/image-to-video

AIが画像を滑らかに動画化。Wan 2.2で創造性あふれる映像制作をスマートに実現。

よくある質問

Wan 3.0 は画像からビデオへのワークフローで何に使用されますか?

Wan 3.0 image-to-video は、単一の最初のフレーム画像を取得し、テキスト プロンプトに基づいてそれを短く一貫したクリップにアニメーション化します。リギングや手動キーフレームを使用せずに、製品ショット、ポートレート、ライフスタイル写真、またはコンセプト アートをモーションに変換するのに適しています。

Wan 3.0 の最初と最後のフレーム オプションはどのように機能しますか?

常に最初のフレームの画像を指定します。最後のポーズや構図が重要な場合は、オプションで最後のフレームの画像を追加できます。 Wan 3.0 は、最初のフレームから開始して最後のフレームに向かって解決する連続モーションを生成し、ショットの開始と終了をより厳密に制御できるようにします。

Wan 3.0 は入力画像から被写体をどの程度保存しますか?

最初のフレームはビデオの冒頭として直接使用されるため、Wan 3.0 はクリップ全体を通じて被写体の外観とフレーミングの一貫性を保つ傾向があります。鮮明で明るい、整然とした入力画像を使用すると、被写体を最大限に保存できます。

Wan 3.0 画像からビデオへの変換はどのような解像度、長さ、アスペクト比をサポートしていますか?

Wan 3.0 は、480p、720p、および 1080p 出力をサポートしており、720p が共通のデフォルトとして使用されます。期間は 2 ~ 30 秒の範囲で調整でき、アスペクト比はワイドスクリーン、垂直、正方形、またはクラシックにすることも、入力画像に従うように adaptive に設定することもできます。正確な電流制限については、RunComfy パラメータ パネルを確認してください。

Wan 3.0 はビデオと一緒に音声を生成できますか?

はい。 Wan 3.0 は、クリップとともに同期されたオーディオ トラックを生成でき、サイレント映像のみが必要な場合はオーディオをオフにすることができます。オーディオを切り替えても生成コストは変わりません。

Wan 3.0 を使用する前に知っておくべき入力制限は何ですか?

入力画像は、適切な解像度とアスペクト比を備えた、JPEG、PNG、WEBP などの一般的な形式である必要があります。非常に低品質のフレームや非常に乱雑なフレームはモーションの品質を低下させる可能性があるため、クリーンで高解像度の最初のフレームを推奨します。制限はプロバイダーの設定によって異なる場合があります。

開発者は RunComfy API を通じて Wan 3.0 を使用できますか?

はい。 RunComfy モデル UI で Wan 3.0 のプロトタイプを作成し、本番または自動化のために同じパラメーターを使用して RunComfy HTTP API を介して同じモデルを呼び出すことができます。これにより、モデルを変更せずに、ブラウザー テストから統合パイプラインに移行できます。

RunComfy で Wan 3.0 を使用して生成するといくらかかりますか?

生成では、出力解像度と期間に基づいて米ドルまたはクレジットが消費されます。480p では 1 秒あたり 0.06 ドル、720p では 1 秒あたり 0.12 ドル、1080p では 1 秒あたり 0.25 ドルです。通常、新規ユーザーは、大規模な実行にコミットする前に Wan 3.0 を試すための無料トライアル期間を取得します。

フォローする
  • LinkedIn
  • Facebook
  • Instagram
  • Twitter
サポート
  • Discord
  • メール
  • システムステータス
  • アフィリエイト
ビデオモデル
  • MiniMax H3 Open
  • FLUX 3 Image to Video
  • MiniMax H3 Open Image to Video
  • Wan 2.6 Flash
  • Happy Horse 1.1 reference to video
  • Seedance 1.5 Pro Text to Video
  • すべてのモデルを見る →
画像モデル
  • Seedream 5.0 Pro Image Edit
  • Flux 2 Flash Edit
  • Nano Banana Pro
  • seedream 4.0
  • GPT Image 2
  • Qwen Image Edit 2511 LoRA
  • すべてのモデルを見る →
法的情報
  • 利用規約
  • プライバシーポリシー
  • Cookieポリシー
RunComfy
著作権 2026 RunComfy. All Rights Reserved.

RunComfyは最高の ComfyUI プラットフォームです。次のものを提供しています: ComfyUIオンライン 環境とサービス、および ComfyUIワークフロー 魅力的なビジュアルが特徴です。 RunComfyはまた提供します AI Models, アーティストが最新のAIツールを活用して素晴らしいアートを作成できるようにする。

Wan 3.0 の例

Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...