logo
RunComfy
  • ComfyUI
  • トレーナー新着
  • モデル
  • API
  • 価格
discord logo
モデル
探索
すべてのモデル
ライブラリ
生成履歴
モデルAPI
APIドキュメント
APIキー
アカウント
使用量

FLUX 3 Video:ネイティブ音声付きマルチモーダル動画生成をモデルと API で提供 | RunComfy

blackforestlabs/flux-3/video

FLUX 3 Video は、同期したネイティブ音声付きの最長 20 秒の映像を生成します。現在は限定早期アクセス中で、RunComfy ではまだ一般公開されていません。

動画の内容を記述するテキストプロンプトです(中国語は約 500 文字以内、英語は約 1000 語以内を推奨)。
マルチモーダル参照モードで使用する画像(0~9 枚)。jpeg、png、webp、bmp、tiff、gif に対応します。
マルチモーダル参照モードで使用する動画(0~3 本)。mp4、mov に対応し、動画の長さは 2~15 秒にしてください。
マルチモーダル参照モードで使用する音声(0~3 本)。wav、mp3 に対応し、音声の長さは 2~15 秒、ファイルサイズは 15 MB 未満にしてください。
デフォルトは `adaptive` です。モデルが最も近い比率を選び、実際の比率はタスクの照会結果で返されます。
4~15 の整数で指定します。
`true` にすると、セリフ、効果音、音楽が同期した動画を出力します。
動画生成に使用するランダムシードです。
`web_search` を含めると、プロンプトの内容(特定の商品や現在の天気など)に応じてモデルがオンライン検索を行う場合があります。情報の鮮度は高まりますが、処理時間も長くなります。
Idle
FLUX 3 Video is coming soon. Now the model is Seedance 2.0 Pro. Billed on total video seconds (input + output). The rate per second is $0.08 for 480p, $0.175 for 720p, $0.40 for 1080p, and $0.90 for 4k.

FLUX 3 Video による動画生成の概要

FLUX 3 Video は RunComfy で近日公開予定です。Black Forest Labs の統合マルチモーダルモデルを動画と音声に活用し、プロンプトや参照素材から、同期したネイティブ音声付きのシネマティック映像を生成します。フレーム単位の編集、手作業のマスキング、別工程の吹き替えをプロンプト中心の生成フローに置き換えられるため、シネマティックな短編をすばやく必要とするマーケティングチーム、制作会社、映画のプリビジュアライゼーション担当者、ゲームスタジオに適しています。開発者は RunComfy 上の FLUX 3 Video をブラウザでも HTTP API でも利用でき、モデルを自社でホストしたりスケールさせたりする必要はありません。
最適な用途:成果につながる動画広告 | ショット設計に忠実な映画プリビジュアライゼーション | 多言語でリップシンクするブランドストーリー

Black Forest Labs / FLUX 3 Video#


FLUX 3 は、画像、動画、音声を同時に学習し、動きと音を同じ基盤から理解する Black Forest Labs の次世代統合モデルです。このページでは動画機能に焦点を当て、制作現場で FLUX 3 Video を使う際の体験を先行して紹介します。


注:FLUX 3 Video は近日公開予定です。このページでは、Black Forest Labs が一般公開モデルと API の最終調整を進める間、予定されている使用体験をプレビューできます。


FLUX 3 Video の主な特長#


クリエイターが FLUX 3 Video を選ぶ理由は次のとおりです。


  • 編集ソフトでの作業を削減: テキストで制作意図を伝えるだけで、タイムライン編集、吹き替え、手作業の後処理を置き換えられます。
  • ショットを演出する感覚で指示: カメラアングル、雰囲気、テンポを言葉で指定できます。
  • 映像と音を同時に生成: 別途吹き替えるのではなく、すべての映像に同期したネイティブ音声を付けられます。
  • 実際の納品物に対応: テスト映像だけでなく、広告、プリビズ、SNS 掲載用の形式を想定した出力です。

FLUX 3 Video の概要#


FLUX 3 Video でできることを簡潔にまとめると、次のようになります。


  • 映像の長さ: 1 回の生成で最長 20 秒。一般的な動画モデルに多い 10 秒の上限のおよそ 2 倍で、複数のショットをつないで数分間のシーケンスにする余地もあります。
  • 音声: 映像と同時に生成される、同期済みのネイティブ音声。無音映像が必要な場合はオフにできます。
  • 入力: テキストプロンプトに加え、画像、動画、音声の参照素材(画像は最大約 10 枚)を利用できます。ゼロからの生成だけでなく、編集やリミックスにも対応します。
  • 解像度: 早期アクセス中は 720p。モデルの成熟に伴い、より高い解像度への対応が見込まれます。
  • アスペクト比: SNS、映画、商品映像向けに、縦長の 9:16 から超横長の 21:9 まで幅広く対応します。
  • スタイル: 素のカムコーダー映像、アニメーション、洗練されたシネマティック表現まで、1 つのモデルで生成できます。
  • 提供状況: 現在は限定早期アクセス中で、RunComfy では近日公開予定です。

FLUX 3 Video の主要機能#


Black Forest Labs は FLUX 3 Video を、複数の生成モードを備え、すべての出力にネイティブ音声を付けられる 1 つのマルチモーダルモデルと説明しています。公式に確認されているタスクは次のとおりです。


  • テキストから動画: テキストプロンプトだけで、音声を含む最長 20 秒の映像を生成します。
  • 画像から動画: 開始フレームを動かすほか、指定した画像を視覚的な参照として使い、動きの方向性を定めます。
  • 動画から動画: 元動画の主要な要素、たとえば同じキャラクターや物体を、新しいシーンや状況へ引き継ぎます。
  • 動画と音声の続き: 最初から作り直さず、入力動画とそのサウンドトラックを延長します。
  • キーフレームから動画: 要所となる瞬間を指定し、その間を意図に沿った動きで補間します。

これらに加えて、FLUX 3 Video は次の機能も備えます。


  • 発話に合った口の動きを伴う 多言語のセリフ。
  • キャラクターの一貫性を保ちながら映像をつなぎ、数分間のシーケンスを構成する エージェント型マルチショット連結。
  • 素のカムコーダー映像からアニメーション、シネマティック表現までを網羅する 幅広いスタイルとアスペクト比。
  • フレーム内へ直接描画される 高品質なタイポグラフィとモーショングラフィックス。
  • 現実に根差した表現: Black Forest Labs は、FLUX 3 Video が表情豊かな顔と、画面上の物理現象に合う音の生成ですでに際立っていると説明しています。

FLUX 3 Video のネイティブ音声と現実に根差した動き#


FLUX 3 Video が際立つ理由は、映像と音を後から継ぎ合わせるのではなく、最初から一体として設計している点です。1 回の生成で、動きに同期したセリフ、フォーリー、環境音、音楽を作れます。ドアが閉まる瞬間に衝撃音が鳴り、警告灯の点滅に合わせてアラームが響き、カメラが動く同じショットの中で人物に発話させる、といった表現が可能です。


この同期はモデルの学習方法から生まれています。Black Forest Labs によると、FLUX 3 の学習計算量の 95% 超を動画予測が占めています。そのためモデルは、接触、動き、重さ、因果関係、つまり現実世界の物理的な振る舞いを学ぶ必要がありました。音声はこの世界モデルから生じる結果として学習されるため、画面上の出来事とその音が一致し、発話に口の動きが追従します。クリエイターにとっては、動きが物理的に自然に見え、音が編集の邪魔をするのではなく、映像の説得力を高めることを意味します。


FLUX 3 Video のプロンプトと参照素材のコツ#


プレビュー期間中も安定した結果を得るため、次のポイントを意識してください。


  • カメラ と 動き を具体的に指定します(ミディアムクローズアップ、ゆっくり寄る、手持ち撮影か固定撮影か、など)。
  • 変えたくない要素(顔、衣装、ロゴ)には 画像 を使い、変化させたい要素(アクション、雰囲気)は テキスト で指示します。
  • 参照用の 動画 と 音声 は 2~15 秒 に収め、音声ファイルは 15 MB 未満 にします。
  • 音声を有効にする場合は、セリフの調子や聞かせたい環境音も指定します。
  • 試行錯誤中は シード を固定し、ランダム性ではなくプロンプトの変更が結果に反映されるようにします。
  • 結果が散漫になったり指示同士が矛盾したりする場合は、プロンプトを簡潔にします。

FLUX 3 Video と他モデルの比較#


FLUX 3 Video はまだ早期アクセス段階にあるため、現時点で最も明確な根拠は、音声付き 10 秒・720p の映像を使った Black Forest Labs の暫定評価です。この一対比較では、評価者が FLUX 3 を選んだ割合は、Luma Ray 3.2 に対して 93%、Runway Gen-4.5 に対して 77%、Grok Imagine Video に対して最大 69%、Kling v3 Pro に対して 60%、Seedance 2.0 と Gemini Omni Flash に対してそれぞれ 52% でした。初期段階の数値で今後変わる可能性はありますが、以下の比較を単なる期待ではなく、現時点の能力に基づいて考える手掛かりになります。


FLUX 3 Video vs FLUX.2#


  • 静止画から動画へ: FLUX.2 を含む従来の FLUX は、いずれも静止画のみを生成します。FLUX 3 は初めて動画と同期音声を同じ基盤へ統合し、FLUX の参照素材への対応力、プロンプトへの忠実さ、文字描画を映像へ広げます。
  • 受け継がれる特長: キャラクター、商品、ロゴを安定して保つという FLUX 画像モデルの強みを、FLUX 3 Video はショット全体へ拡張します。
  • 新しい領域: 動き、時間方向の安定性、タイミングの合った音声は、画像を中心に開発してきた研究所にとって新しい課題です。その検証のために早期アクセス期間が設けられています。

FLUX 3 Video vs Seedance 2.0#


  • 評価結果: Black Forest Labs の初期テストでは、Seedance 2.0 との比較の 52% で FLUX 3 が選ばれました。成熟し実績のあるマルチモーダル動画モデルと、ほぼ互角の結果です。
  • 機能: Seedance 2.0 は 1 回のリクエストでテキスト、画像、動画、音声を組み合わせ、ネイティブで同期したマルチトラック音声を含む約 15 秒のマルチショット動画を 480p~4K で出力し、編集と延長にも対応します。FLUX 3 Video も同様のマルチモーダルな機能を目指し、Black Forest Labs によれば、特に表情豊かな顔、物理現象と音の一致、多言語のセリフに強みがあります。
  • 選び方: 今すぐ本番で使う必要があるなら、実績のある Seedance 2.0 が選択肢です。一般公開が近づく FLUX 3 Video は、今後注目すべきモデルです。

FLUX 3 Video vs Kling、Runway、Luma#


  • 評価結果: Black Forest Labs の初期比較では、Kling v3 Pro に対して 60%、Runway Gen-4.5 に対して 77%、Luma Ray 3.2 に対して 93% の割合で FLUX 3 が選ばれました。
  • 差が生まれる理由: これらの差は、FLUX 3 Video が掲げる強みと一致しています。表情豊かな顔、画面上の物理現象と同期する音、多言語のセリフ、一貫したマルチショットの連結といった細部が、短い映像をテスト生成ではなく完成品らしく見せます。

FLUX 3 Video の早期アクセスで期待できること#


FLUX 3 Video は限定早期アクセス中のモデルを先行公開するものです。現時点では、次のように考えるとよいでしょう。


  • すでに強い点: 長く一貫した映像、セリフ中心のドラマチックなシーン、同期したネイティブ音声は、初期の実機テストでも良好な結果を示しています。
  • 改善が続く点: 初期ビルドでは、画像から動画を作る際に参照画像への忠実さが安定しない場合があります。また、非常に速く激しいアクションでは、動きに特化した競合モデルほどの躍動感にはまだ届きません。
  • 段階的な提供: 解像度は 720p 前後から始まり、今後さらに高解像度へ対応する見込みです。価格とオープンウェイトについては、Black Forest Labs からの正式発表を待つ段階です。

FLUX 3 Video は、モデルが目指す方向を先行して示すものです。一般公開に向かう過程で、機能と制約は引き続き変化します。


FLUX 3 Video のエディションと FLUX 3 AI ファミリー#


Black Forest Labs は FLUX 3 AI を、複数のエディションからなる 1 つのマルチモーダル基盤として展開します。各エディションはそれぞれの早期アクセス期間を経て、段階的に提供される予定です。公式の公開計画は次のとおりです。


  • FLUX 3 Video: API とプライベートウェイトへのアクセスを通じて動画と音声の生成・編集を提供します。このページで紹介しているエディションです。
  • FLUX 3 Image: 画像の生成と編集を、同じく API とプライベートウェイトへのアクセスを通じて提供します。
  • FLUX 3 Action(FLUX-mimic): mimic robotics などのパートナーと開発するロボティクス向けの行動予測モデルで、すでに Audi の生産ラインでテストされています。
  • FLUX 3 Dev: 画像、動画、音声の生成と行動予測をカバーするオープンウェイトのマルチモーダル基盤です。モデルを自社で運用し、用途に合わせて調整したいチーム向けです。

Black Forest Labs はオープンウェイトを公開する計画も明らかにしています。FLUX 3 Dev の基盤が提供されれば、以前の FLUX シリーズで大規模な LoRA エコシステムが育ったのと同様に、繰り返し登場するキャラクター、スタイル、ブランドルック向けの FLUX 3 dev LoRA ファインチューニングを含む、コミュニティ製の FLUX 3 LoRA ワークフローが次の自然な展開になるでしょう。


多くのチームでは、日常的な動画制作を FLUX 3 Video が担い、FLUX 3 Dev と FLUX 3 dev LoRA がセルフホストによるカスタマイズの可能性を広げます。


FLUX 3 Video 公式リソース#


  • Black Forest Labs

まとめると、FLUX 3 Video は RunComfy で近日公開予定です。プロンプトと参照素材から、同期したネイティブ音声付きのシネマティック映像を作る、統合マルチモーダル基盤です。

関連モデル

gemini-omni-flash/reference-to-video

参照画像とプロンプトから、音声が同期した短い動画を生成します。

runway-aleph/video-to-video

テキストと画像から高品質な映像を自在に生成・編集可能

Veo 2

自然な動きとカメラワークで高品質な映像表現を実現

seedance-2.5/image-to-video

Seedance 2.5 近日公開:静止画からシネマティックなAI動画を生成

veo-3-1/extend-video

既存動画をプロンプトに沿って 7 秒延長し、720p で出力します。音声生成のオン・オフも選べます。

aurora

画像、音声、プロンプトから動画を生成し、テキストと音声の反映度を個別に調整できます。

よくある質問

FLUX 3 Video は現在 RunComfy で利用できますか?

FLUX 3 Video は近日公開予定です。このページでは、Black Forest Labs が統合マルチモーダルモデルと API の一般公開に向けた最終調整を進める間、一足先に FLUX 3 Video の使用感を確認できます。FLUX 3 のバックエンドが有効になるまでは、画面に表示される入力項目と上限値は、現在このプレビューを動かしているモデルの仕様に基づきます。

FLUX 3 Video はどのような用途に向いていますか?

FLUX 3 Video は、プロンプトと、必要に応じて追加する画像、動画、音声の参照素材から、ネイティブ音声付きの短いシネマティック映像を生成するモデルです。参照素材との一貫性や映像と音の同期が重要な、動画広告、映画のプリビジュアライゼーション、ブランドストーリーの制作に適しています。

FLUX 3 Video は従来の動画生成手法から何が進化していますか?

FLUX 3 Video は、Black Forest Labs の技術を映像と音声へ広げ、1 つのマルチモーダル基盤に統合するモデルです。公式に確認されている機能は、テキストから動画、画像から動画、動画から動画、動画と音声の続きを生成、キーフレームから動画、の 5 種類です。さらにネイティブ音声、多言語のセリフ、1 回の生成で最長 20 秒の映像にも対応する予定です。実際の向上幅は素材によって異なるため、公開後に同じプロンプトで映像を比較するのがおすすめです。

FLUX 3 Video では最長何秒の映像を生成できますか?

FLUX 3 Video は 1 回で最長 20 秒の映像を生成できます。一般的な動画モデルに多い 10 秒の上限のおよそ 2 倍で、会話の間やゆったりしたドラマチックなショットも表現しやすくなります。さらに、キャラクターの一貫性を保ちながら複数のショットをつなぎ、数分間のシーケンスにすることも想定されています。現在このプレビューを動かしているモデルでは 4~15 秒を指定でき、正式版の FLUX 3 Video は最長 20 秒に対応する設計です。

FLUX 3 Video はネイティブ音声とリップシンクに対応していますか?

はい。ネイティブ音声は FLUX 3 Video の中核機能です。現在このプレビューを動かしているモデルでも音声生成を有効にすると、セリフ、効果音、音楽が映像に同期した、多言語のリップシンク映像を出力できます。無音の映像が必要な場合は無効にできます。リップシンクの品質は、プロンプトの明確さや指定するシーンによって変わります。

FLUX 3 Video の動きと音がリアルに感じられるのはなぜですか?

FLUX 3 は学習計算の大半を動画予測に使っており、接触、動き、重さ、因果関係といった、現実世界の物理的な振る舞いを学ぶ必要がありました。ネイティブ音声もこの世界モデルを基盤に学習されているため、画面上の出来事とその音が一致し、発話に口の動きが追従します。実際に FLUX 3 Video は、表情豊かな顔と物理的に自然な動きが強みとされています。

FLUX 3 Video は映像内でキャラクターやスタイルの一貫性を保てますか?

はい。参照素材によるガイドは FLUX 3 Video の中核です。参照画像と明確なプロンプトを組み合わせることで、フレームをまたいで人物の特徴、衣装、雰囲気を揃えやすくなります。また FLUX 3 は、元動画の被写体を新しいシーンへ引き継ぐことも想定しています。現在このプレビューを動かしているモデルでも、対応する上限内で画像、動画、音声を参照素材として追加し、一貫性を高められます。

RunComfy で FLUX 3 Video を使う前に、どの入力上限を確認すべきですか?

現在このプレビューを動かしているモデルでは、prompt は中国語なら約 500 文字以内、英語なら約 1000 語以内が推奨です。参照用の images は最大 9 枚、videos は最大 3 本(各 2~15 秒)、audios は最大 3 本(各 2~15 秒、15 MB 未満)まで追加できます。必須なのは prompt だけです。FLUX 3 Video の公開時には上限が変わるため、最新のパラメーターパネルをご確認ください。

この FLUX 3 Video プレビューでは、どの解像度、アスペクト比、長さを指定できますか?

resolution は 480p、720p(デフォルト)、1080p、4K から選べます。aspect_ratio は adaptive(デフォルト。モデルが最も近い比率を選択)のほか、16:9、9:16、4:3、3:4、1:1、21:9 に固定できます。現在このプレビューを動かしているモデルでは、duration に 4~15 の整数を指定でき、デフォルトは 5 秒です。正式版の FLUX 3 Video は、1 回の生成で最長 20 秒に対応する設計です。

FLUX 3 Video はオープンウェイトや LoRA のファインチューニングに対応する予定ですか?

FLUX 3 AI は、複数のエディションを備えた 1 つの基盤として計画されています。ホスト型の FLUX 3 Video に加えて、Black Forest Labs は FLUX 3 Image、FLUX 3 Action(ロボティクス向けの FLUX-mimic)、オープンウェイトのマルチモーダル基盤である FLUX 3 Dev を発表しています。オープンウェイトの公開予定も確認されているため、FLUX 3 Dev の提供後は、繰り返し登場するキャラクター、スタイル、ブランドルック向けの FLUX 3 dev LoRA 学習を含む、コミュニティ製の FLUX 3 LoRA ワークフローが登場すると見込まれます。

ブラウザで試した FLUX 3 Video を、本番の API 連携へ移行するにはどうすればよいですか?

まず RunComfy のモデル画面で試作し、その後、同じ Input フィールド(prompt、images、videos、audios、aspect_ratio、duration、resolution、generate_audio、seed)を指定して RunComfy API から同じテンプレートを呼び出します。UI でプロンプトとメディアの上限を確認してから、アカウントの API キーとクレジットを使って処理を自動化してください。

この FLUX 3 Video プレビューの生成料金はいくらですか?

現在このプレビューを動かしている Seedance 2.0 Pro では、生成する動画の長さに応じてクレジットを消費します。料金は 1 秒あたり 480p が $0.08、720p が $0.175、1080p が $0.40、4K が $0.90 です。FLUX 3 Video の公開時に料金も更新されるため、このページに表示される最新価格をご確認ください。

フォローする
  • LinkedIn
  • Facebook
  • Instagram
  • Twitter
サポート
  • Discord
  • メール
  • システムステータス
  • アフィリエイト
ビデオモデル
  • Wan 2.6 Flash
  • Wan 2.6 Text to Video
  • Hailuo 2.3 Fast Standard
  • Happy Horse 1.1 reference to video
  • Seedance 2.5 Reference to Video
  • Seedance 2.0 Pro
  • すべてのモデルを見る →
画像モデル
  • Seedream 5.0 Pro Image Edit
  • seedream 4.0
  • Flux 2 Flash Edit
  • Nano Banana Pro
  • Nano Banana 2 Edit
  • GPT Image 2 Image Edit
  • すべてのモデルを見る →
法的情報
  • 利用規約
  • プライバシーポリシー
  • Cookieポリシー
RunComfy
著作権 2026 RunComfy. All Rights Reserved.

RunComfyは最高の ComfyUI プラットフォームです。次のものを提供しています: ComfyUIオンライン 環境とサービス、および ComfyUIワークフロー 魅力的なビジュアルが特徴です。 RunComfyはまた提供します AI Models, アーティストが最新のAIツールを活用して素晴らしいアートを作成できるようにする。

FLUX 3 Video の生成例

Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...