参照画像とプロンプトから、音声が同期した短い動画を生成します。
FLUX 3 は、画像、動画、音声を同時に学習し、動きと音を同じ基盤から理解する Black Forest Labs の次世代統合モデルです。このページでは動画機能に焦点を当て、制作現場で FLUX 3 Video を使う際の体験を先行して紹介します。
注:FLUX 3 Video は近日公開予定です。このページでは、Black Forest Labs が一般公開モデルと API の最終調整を進める間、予定されている使用体験をプレビューできます。
クリエイターが FLUX 3 Video を選ぶ理由は次のとおりです。
FLUX 3 Video でできることを簡潔にまとめると、次のようになります。
Black Forest Labs は FLUX 3 Video を、複数の生成モードを備え、すべての出力にネイティブ音声を付けられる 1 つのマルチモーダルモデルと説明しています。公式に確認されているタスクは次のとおりです。
これらに加えて、FLUX 3 Video は次の機能も備えます。
FLUX 3 Video が際立つ理由は、映像と音を後から継ぎ合わせるのではなく、最初から一体として設計している点です。1 回の生成で、動きに同期したセリフ、フォーリー、環境音、音楽を作れます。ドアが閉まる瞬間に衝撃音が鳴り、警告灯の点滅に合わせてアラームが響き、カメラが動く同じショットの中で人物に発話させる、といった表現が可能です。
この同期はモデルの学習方法から生まれています。Black Forest Labs によると、FLUX 3 の学習計算量の 95% 超を動画予測が占めています。そのためモデルは、接触、動き、重さ、因果関係、つまり現実世界の物理的な振る舞いを学ぶ必要がありました。音声はこの世界モデルから生じる結果として学習されるため、画面上の出来事とその音が一致し、発話に口の動きが追従します。クリエイターにとっては、動きが物理的に自然に見え、音が編集の邪魔をするのではなく、映像の説得力を高めることを意味します。
プレビュー期間中も安定した結果を得るため、次のポイントを意識してください。
FLUX 3 Video はまだ早期アクセス段階にあるため、現時点で最も明確な根拠は、音声付き 10 秒・720p の映像を使った Black Forest Labs の暫定評価です。この一対比較では、評価者が FLUX 3 を選んだ割合は、Luma Ray 3.2 に対して 93%、Runway Gen-4.5 に対して 77%、Grok Imagine Video に対して最大 69%、Kling v3 Pro に対して 60%、Seedance 2.0 と Gemini Omni Flash に対してそれぞれ 52% でした。初期段階の数値で今後変わる可能性はありますが、以下の比較を単なる期待ではなく、現時点の能力に基づいて考える手掛かりになります。
FLUX 3 Video は限定早期アクセス中のモデルを先行公開するものです。現時点では、次のように考えるとよいでしょう。
FLUX 3 Video は、モデルが目指す方向を先行して示すものです。一般公開に向かう過程で、機能と制約は引き続き変化します。
Black Forest Labs は FLUX 3 AI を、複数のエディションからなる 1 つのマルチモーダル基盤として展開します。各エディションはそれぞれの早期アクセス期間を経て、段階的に提供される予定です。公式の公開計画は次のとおりです。
Black Forest Labs はオープンウェイトを公開する計画も明らかにしています。FLUX 3 Dev の基盤が提供されれば、以前の FLUX シリーズで大規模な LoRA エコシステムが育ったのと同様に、繰り返し登場するキャラクター、スタイル、ブランドルック向けの FLUX 3 dev LoRA ファインチューニングを含む、コミュニティ製の FLUX 3 LoRA ワークフローが次の自然な展開になるでしょう。
多くのチームでは、日常的な動画制作を FLUX 3 Video が担い、FLUX 3 Dev と FLUX 3 dev LoRA がセルフホストによるカスタマイズの可能性を広げます。
まとめると、FLUX 3 Video は RunComfy で近日公開予定です。プロンプトと参照素材から、同期したネイティブ音声付きのシネマティック映像を作る、統合マルチモーダル基盤です。
参照画像とプロンプトから、音声が同期した短い動画を生成します。
テキストと画像から高品質な映像を自在に生成・編集可能
自然な動きとカメラワークで高品質な映像表現を実現
Seedance 2.5 近日公開:静止画からシネマティックなAI動画を生成
既存動画をプロンプトに沿って 7 秒延長し、720p で出力します。音声生成のオン・オフも選べます。
画像、音声、プロンプトから動画を生成し、テキストと音声の反映度を個別に調整できます。
FLUX 3 Video は近日公開予定です。このページでは、Black Forest Labs が統合マルチモーダルモデルと API の一般公開に向けた最終調整を進める間、一足先に FLUX 3 Video の使用感を確認できます。FLUX 3 のバックエンドが有効になるまでは、画面に表示される入力項目と上限値は、現在このプレビューを動かしているモデルの仕様に基づきます。
FLUX 3 Video は、プロンプトと、必要に応じて追加する画像、動画、音声の参照素材から、ネイティブ音声付きの短いシネマティック映像を生成するモデルです。参照素材との一貫性や映像と音の同期が重要な、動画広告、映画のプリビジュアライゼーション、ブランドストーリーの制作に適しています。
FLUX 3 Video は、Black Forest Labs の技術を映像と音声へ広げ、1 つのマルチモーダル基盤に統合するモデルです。公式に確認されている機能は、テキストから動画、画像から動画、動画から動画、動画と音声の続きを生成、キーフレームから動画、の 5 種類です。さらにネイティブ音声、多言語のセリフ、1 回の生成で最長 20 秒の映像にも対応する予定です。実際の向上幅は素材によって異なるため、公開後に同じプロンプトで映像を比較するのがおすすめです。
FLUX 3 Video は 1 回で最長 20 秒の映像を生成できます。一般的な動画モデルに多い 10 秒の上限のおよそ 2 倍で、会話の間やゆったりしたドラマチックなショットも表現しやすくなります。さらに、キャラクターの一貫性を保ちながら複数のショットをつなぎ、数分間のシーケンスにすることも想定されています。現在このプレビューを動かしているモデルでは 4~15 秒を指定でき、正式版の FLUX 3 Video は最長 20 秒に対応する設計です。
はい。ネイティブ音声は FLUX 3 Video の中核機能です。現在このプレビューを動かしているモデルでも音声生成を有効にすると、セリフ、効果音、音楽が映像に同期した、多言語のリップシンク映像を出力できます。無音の映像が必要な場合は無効にできます。リップシンクの品質は、プロンプトの明確さや指定するシーンによって変わります。
FLUX 3 は学習計算の大半を動画予測に使っており、接触、動き、重さ、因果関係といった、現実世界の物理的な振る舞いを学ぶ必要がありました。ネイティブ音声もこの世界モデルを基盤に学習されているため、画面上の出来事とその音が一致し、発話に口の動きが追従します。実際に FLUX 3 Video は、表情豊かな顔と物理的に自然な動きが強みとされています。
はい。参照素材によるガイドは FLUX 3 Video の中核です。参照画像と明確なプロンプトを組み合わせることで、フレームをまたいで人物の特徴、衣装、雰囲気を揃えやすくなります。また FLUX 3 は、元動画の被写体を新しいシーンへ引き継ぐことも想定しています。現在このプレビューを動かしているモデルでも、対応する上限内で画像、動画、音声を参照素材として追加し、一貫性を高められます。
現在このプレビューを動かしているモデルでは、prompt は中国語なら約 500 文字以内、英語なら約 1000 語以内が推奨です。参照用の images は最大 9 枚、videos は最大 3 本(各 2~15 秒)、audios は最大 3 本(各 2~15 秒、15 MB 未満)まで追加できます。必須なのは prompt だけです。FLUX 3 Video の公開時には上限が変わるため、最新のパラメーターパネルをご確認ください。
resolution は 480p、720p(デフォルト)、1080p、4K から選べます。aspect_ratio は adaptive(デフォルト。モデルが最も近い比率を選択)のほか、16:9、9:16、4:3、3:4、1:1、21:9 に固定できます。現在このプレビューを動かしているモデルでは、duration に 4~15 の整数を指定でき、デフォルトは 5 秒です。正式版の FLUX 3 Video は、1 回の生成で最長 20 秒に対応する設計です。
FLUX 3 AI は、複数のエディションを備えた 1 つの基盤として計画されています。ホスト型の FLUX 3 Video に加えて、Black Forest Labs は FLUX 3 Image、FLUX 3 Action(ロボティクス向けの FLUX-mimic)、オープンウェイトのマルチモーダル基盤である FLUX 3 Dev を発表しています。オープンウェイトの公開予定も確認されているため、FLUX 3 Dev の提供後は、繰り返し登場するキャラクター、スタイル、ブランドルック向けの FLUX 3 dev LoRA 学習を含む、コミュニティ製の FLUX 3 LoRA ワークフローが登場すると見込まれます。
まず RunComfy のモデル画面で試作し、その後、同じ Input フィールド(prompt、images、videos、audios、aspect_ratio、duration、resolution、generate_audio、seed)を指定して RunComfy API から同じテンプレートを呼び出します。UI でプロンプトとメディアの上限を確認してから、アカウントの API キーとクレジットを使って処理を自動化してください。
現在このプレビューを動かしている Seedance 2.0 Pro では、生成する動画の長さに応じてクレジットを消費します。料金は 1 秒あたり 480p が $0.08、720p が $0.175、1080p が $0.40、4K が $0.90 です。FLUX 3 Video の公開時に料金も更新されるため、このページに表示される最新価格をご確認ください。
RunComfyは最高の ComfyUI プラットフォームです。次のものを提供しています: ComfyUIオンライン 環境とサービス、および ComfyUIワークフロー 魅力的なビジュアルが特徴です。 RunComfyはまた提供します AI Models, アーティストが最新のAIツールを活用して素晴らしいアートを作成できるようにする。





