logo
RunComfy
  • ComfyUI
  • 訓練器新
  • 模型
  • API
  • 定價
discord logo
模型
探索
所有模型
資源庫
生成記錄
模型 API
API 文檔
API 金鑰
帳戶
使用情況

FLUX 3 Video:透過模型頁面與 API 生成帶原生音訊的多模態影片 | RunComfy

blackforestlabs/flux-3/video

FLUX 3 Video 可生成最長 20 秒、帶同步原生音訊的短片。目前處於限量早期存取階段,尚未在 RunComfy 正式上線。

描述影片內容的文字提示詞(中文建議不超過約 500 個字元,英文建議不超過約 1000 個單字)。
多模態參考模式使用的圖像(0~9 張)。支援 jpeg、png、webp、bmp、tiff、gif。
多模態參考模式使用的影片(0~3 個)。支援 mp4、mov,影片時長必須為 2~15 秒。
多模態參考模式使用的音訊(0~3 個)。支援 wav、mp3,音訊時長必須為 2~15 秒,檔案大小應小於 15 MB。
預設為 `adaptive`。模型會選擇最接近的比例,實際比例會在任務查詢結果中回傳。
填寫 4~15 之間的整數。
設為 `true` 時,模型會輸出帶同步音訊(對白、音效、音樂)的影片。
影片生成使用的隨機種子。
加入 `web_search` 後,模型可能根據提示詞內容(例如特定產品、目前天氣)進行線上搜尋。這樣有助於提高事實時效性,但也會增加處理時間。
Idle
FLUX 3 Video is coming soon. Now the model is Seedance 2.0 Pro. Billed on total video seconds (input + output). The rate per second is $0.08 for 480p, $0.175 for 720p, $0.40 for 1080p, and $0.90 for 4k.

FLUX 3 Video 影片生成簡介

FLUX 3 Video 即將在 RunComfy 上線。它把 Black Forest Labs 的統一多模態模型應用於影片與音訊,可根據提示詞和參考素材生成電影感短片,並配有同步的原生音訊。它以提示詞驅動的生成流程取代逐幀編輯、手動蒙版和另行配音,適合需要快速製作電影感短片的行銷團隊、代理商、影視預演人員和遊戲工作室。開發者既可在瀏覽器中使用 RunComfy 上的 FLUX 3 Video,也可透過 HTTP API 呼叫,無需自行託管或擴充模型。
適用場景:高轉換率影片廣告 | 鏡頭設計準確的影視預演 | 多語言口型同步品牌敘事

Black Forest Labs / FLUX 3 Video#


FLUX 3 是 Black Forest Labs 的下一代統一模型,同時使用圖像、影片和音訊進行訓練,讓動作與聲音建立在同一套理解基礎上。本頁聚焦它的影片能力,搶先展示 FLUX 3 Video 在正式製作環境中的使用體驗。


注意:FLUX 3 Video 即將上線。在 Black Forest Labs 完成公開模型和 API 之前,本頁可預覽其規劃中的使用體驗。


FLUX 3 Video 核心亮點#


創作者選擇 FLUX 3 Video 的原因包括:


  • 減少剪輯軟體中的工作: 一份文字需求即可取代時間線剪輯、配音和手動清理。
  • 像導演鏡頭一樣下指令: 攝影機角度、氛圍和節奏都由你寫下的文字決定。
  • 一次生成畫面與聲音: 每段影片都可自帶同步的原生音訊,無需另行配音。
  • 符合實際交付需求: 輸出格式適用於廣告、預演和社群媒體版位,而不只是測試片段。

FLUX 3 Video 概覽#


FLUX 3 Video 的主要能力如下:


  • 影片長度: 單次最長 20 秒,約為多數影片模型常見 10 秒上限的兩倍,也為串聯多個鏡頭、組成數分鐘序列留出空間。
  • 音訊: 與畫面同時生成的同步原生聲音;需要無聲影片時可關閉。
  • 輸入: 文字提示詞加圖像、影片和音訊參考素材(參考圖最多約 10 張),因此無論從零生成、編輯還是混合重構都能靈活處理。
  • 解析度: 早期存取階段為 720p;隨著模型成熟,預計會支援更高解析度。
  • 長寬比: 從直式 9:16 到超寬幅 21:9,覆蓋社群媒體、影視和產品影片格式。
  • 風格: 一個模型即可生成自然的手持攝影機質感、動畫和精緻的電影感畫面。
  • 狀態: 目前處於限量早期存取階段,即將在 RunComfy 上線。

FLUX 3 Video 關鍵能力#


Black Forest Labs 將 FLUX 3 Video 描述為一款包含多種生成模式的多模態模型,並且每次輸出都可帶原生音訊。官方已確認的任務包括:


  • 文字轉影片: 只需文字提示詞,即可生成最長 20 秒、包含完整配音的影片。
  • 圖像轉影片: 讓起始影格動起來,或把提供的圖像作為視覺參考來引導動作。
  • 影片轉影片: 將源影片中的核心元素——同一個角色或物體——帶入新的場景或情境。
  • 影片與音訊續寫: 延長輸入影片及其音軌,無需從頭生成。
  • 關鍵影格生成影片: 定義關鍵時刻,由模型補全其間受控的過渡。

除上述模式外,FLUX 3 Video 還提供:


  • 嘴部動作跟隨對白的 多語言對話。
  • 在保持角色一致性的同時串聯多個片段,形成數分鐘序列的 智慧多鏡頭串聯。
  • 從自然的手持攝影機畫面到動畫、電影感視覺的 廣泛風格和長寬比。
  • 直接生成在畫面中的 清晰文字排版和動態設計。
  • 基於現實的表現: Black Forest Labs 表示,FLUX 3 Video 已在富有表現力的臉部,以及讓聲音匹配螢幕中的物理事件方面表現突出。

FLUX 3 Video 的原生音訊與真實運動#


FLUX 3 Video 的獨特之處,在於畫面和聲音從一開始就共同設計,而不是生成後再拼接。一次生成即可製作與動作同步的對白、擬音、環境聲和音樂:門猛然關上時響起撞擊聲,警告燈閃爍時警報同步鳴響,人物也能在攝影機移動的同一鏡頭中說話。


這種同步源於模型的訓練方式。Black Forest Labs 表示,影片預測佔 FLUX 3 訓練算力的 95% 以上,迫使模型學習接觸、運動、重量和因果關係,也就是物理世界實際的運作方式。音訊作為這一世界模型的結果進行學習,因此聲音會與造成聲響的畫面事件對齊,對白也會跟隨嘴部動作。對創作者而言,這意味著動作在物理上更可信,配樂能夠強化剪輯,而不是與畫面衝突。


FLUX 3 Video 提示詞與參考素材技巧#


在 FLUX 3 Video 預覽階段,可透過以下方法獲得更穩定的結果:


  • 具體說明 攝影機 和 動作,例如中近景、緩慢推進、手持或固定機位。
  • 用 圖像 鎖定必須保持穩定的內容,如臉部、服裝、標誌;用 文字 描述需要變化的內容,如動作、氛圍。
  • 參考 影片 與 音訊 應控制在 2~15 秒,參考音訊需小於 15 MB。
  • 開啟音訊時,明確說明想聽到的對白語氣或環境聲。
  • 迭代時固定 隨機種子,讓變化來自提示詞調整,而不是隨機性。
  • 如果結果顯得嘈雜或要求相互衝突,請簡化提示詞。

FLUX 3 Video 與其他模型的比較#


由於 FLUX 3 Video 仍處於早期存取階段,目前最清晰的依據來自 Black Forest Labs 的初步評估,測試樣本為帶音訊的 10 秒 720p 影片。在這些兩兩對比中,評估者選擇 FLUX 3 的比例為:比較 Luma Ray 3.2 時為 93%,比較 Runway Gen-4.5 時為 77%,比較 Grok Imagine Video 時最高為 69%,比較 Kling v3 Pro 時為 60%,比較 Seedance 2.0 和 Gemini Omni Flash 時均為 52%。這些資料仍處於早期階段,預計還會變化,但能讓下面的比較更多基於能力,而不是宣傳。


FLUX 3 Video vs FLUX.2#


  • 從靜態圖像到動態影片: 包括 FLUX.2 在內的所有早期 FLUX 都只能生成靜態圖。FLUX 3 首次把影片和同步音訊整合進同一個基礎模型,讓 FLUX 的參考素材處理、提示詞遵循和文字排版能力延伸到動態片段。
  • 延續的優勢: 讓 FLUX 圖像模型值得信賴的特點——穩定保持角色、產品或標誌——被 FLUX 3 Video 延伸到整個鏡頭。
  • 全新領域: 動作、時間穩定性和節奏同步音訊,都是一家以圖像起步的實驗室需要解決的新問題,這也正是設定早期存取階段的原因。

FLUX 3 Video vs Seedance 2.0#


  • 評估資料: 在 Black Forest Labs 的早期測試中,與 Seedance 2.0 比較時有 52% 的結果更偏好 FLUX 3,與一個成熟、經過驗證的多模態影片模型基本持平。
  • 能力: Seedance 2.0 可在一次請求中混合文字、圖像、影片和音訊,生成約 15 秒、480p~4K 的多鏡頭影片,配有原生同步多軌音訊,並支援編輯與延長。FLUX 3 Video 追求同等規模的多模態能力;Black Forest Labs 表示,它尤其擅長富有表現力的臉部、與物理事件匹配的聲音和多語言對白。
  • 如何選擇: 如果現在就必須投入正式製作,Seedance 2.0 已有成熟表現;隨著公開版即將推出,FLUX 3 Video 則是值得關注的選擇。

FLUX 3 Video vs Kling、Runway 與 Luma#


  • 評估資料: 在 Black Forest Labs 的早期比較中,FLUX 3 與 Kling v3 Pro 的偏好率為 60%,與 Runway Gen-4.5 為 77%,與 Luma Ray 3.2 為 93%。
  • 差距來源: 這些優勢與 FLUX 3 Video 宣稱的強項一致:富有表現力的人臉、與螢幕物理事件同步的音訊、多語言對白和穩定的多鏡頭串聯。正是這些細節,讓一段短片更像完成作品,而不是測試渲染。

FLUX 3 Video 早期存取階段的預期#


FLUX 3 Video 目前仍處於限量早期存取階段,合理的預期包括:


  • 目前的強項: 較長且連貫的影片、由對白推動的戲劇性場景、原生同步音訊,在早期實際測試中都有良好表現。
  • 仍在成熟: 早期版本的圖像轉影片功能對參考圖的遵循可能不穩定;面對速度很快、動作非常激烈的場景時,動態張力尚未達到部分專攻運動表現的競爭模型。
  • 逐步推出: 解析度從約 720p 起步,預計後續支援更高解析度;價格和開放權重仍待 Black Forest Labs 確認。

可將 FLUX 3 Video 視為模型未來方向的預覽:隨著它朝正式上線邁進,功能和限制仍會持續變化。


FLUX 3 Video 版本與完整的 FLUX 3 AI 系列#


Black Forest Labs 正在把 FLUX 3 AI 定位為包含多個版本的統一多模態基礎模型逐步推出。每個版本都會經過各自的早期存取期,再分階段釋出。根據官方釋出計劃:


  • FLUX 3 Video: 透過 API 和私有權重存取提供影片與音訊生成、編輯,即本頁預覽的體驗。
  • FLUX 3 Image: 提供圖像生成與編輯,同樣透過 API 和私有權重存取交付。
  • FLUX 3 Action(FLUX-mimic): 面向機器人的動作預測,與 mimic robotics 等合作夥伴共同開發,並已在 Audi 生產線上測試。
  • FLUX 3 Dev: 覆蓋圖像、影片、音訊生成及動作預測的開放權重多模態基礎模型,適合希望自行執行並調整模型的團隊。

Black Forest Labs 已確認規劃開放權重。待 FLUX 3 Dev 基礎模型釋出後,社群推出 FLUX 3 LoRA 工作流程將是自然的下一步,其中包括針對固定角色、風格和品牌視覺的 FLUX 3 dev LoRA 微調,就像早期 FLUX 版本所催生的大型 LoRA 生態一樣。


對大多數團隊而言,FLUX 3 Video 可承擔日常影片製作,而 FLUX 3 Dev 與 FLUX 3 dev LoRA 則為自託管客製化提供更多可能。


FLUX 3 Video 官方資源#


  • Black Forest Labs

簡而言之,FLUX 3 Video 即將在 RunComfy 上線:這個統一多模態基礎模型可將提示詞與參考素材轉化為帶同步原生音訊的電影感短片。

相關模型

seedance-2.5/reference-to-video

Seedance 2.5 即將推出:依參考素材產生電影級 AI 影片

kling/lipsync/audio-to-video

透過兩個必填 URL,將音訊軌道與現有影片同步。

bytedance/upscale/video

將來源影片放大至所選目標解析度與影格率。

aurora

依照圖片、音訊和提示詞產生影片,並分別調整文字與音訊的引導強度。

kling-video-o3/standard/text-to-video

根據文字生成 3–15 秒電影感影片,並可選擇同步音訊。

kling-video-o3/standard/reference-to-video

根據參考素材生成 3–15 秒影片,起價為每秒 $0.084。

常見問題

FLUX 3 Video 現在可以在 RunComfy 上使用嗎?

FLUX 3 Video 即將上線。在 Black Forest Labs 完成統一多模態模型及其 API 的公開版本之前,你可以透過這個預覽頁提前瞭解 FLUX 3 Video 的使用體驗。在 FLUX 3 後端正式啟用前,頁面目前顯示的輸入項目與限制來自支援此預覽的現有模型。

FLUX 3 Video 適合用來做什麼?

FLUX 3 Video 可根據提示詞以及選用的圖像、影片和音訊參考素材,生成帶原生音訊的電影感短片。它適合製作重視參考素材一致性和聲畫同步的廣告創意、影視預演和品牌敘事內容。

與過去的影片生成方式相比,FLUX 3 Video 有哪些提升?

FLUX 3 Video 將 Black Forest Labs 的能力延伸到動態畫面和聲音,並整合到統一的多模態基礎模型中。官方已確認五類任務:文字生成影片、圖像生成影片、影片生成影片、影片與音訊續寫,以及關鍵影格生成影片。此外,它還將支援原生音訊、多語言對白和單次最長 20 秒的影片。實際提升幅度會因內容而異,模型上線後建議使用相同提示詞比較生成結果。

FLUX 3 Video 最長可以生成多少秒的影片?

FLUX 3 Video 單次最多可生成 20 秒影片,約為許多影片模型常見 10 秒上限的兩倍,能為對白節奏和舒緩的戲劇性鏡頭保留更多空間。它還可以在維持角色一致性的同時,將多個鏡頭串連成數分鐘的序列。目前支援此預覽的模型可設定 4~15 秒;完整的 FLUX 3 Video 目標是支援單次 20 秒生成。

FLUX 3 Video 支援原生音訊和嘴型同步嗎?

支援。原生音訊是 FLUX 3 Video 的核心能力。目前支援此預覽的模型也可以開啟音訊生成,輸出與畫面同步的對白、音效和音樂,並支援多語言嘴型同步;需要無聲影片時可以關閉。嘴型同步品質會受到提示詞清晰度和場景設定的影響。

為什麼 FLUX 3 Video 的動作和聲音看起來更真實?

FLUX 3 的大部分訓練算力用於影片預測,因此模型必須學習接觸、運動、重量和因果關係,也就是現實世界的物理規律。原生音訊建立在這個世界模型之上,所以聲音能與觸發它的畫面事件對應,對白也能跟隨嘴部動作。實際表現中,FLUX 3 Video 尤其擅長富有表現力的臉部和符合物理規律的運動。

FLUX 3 Video 能在整段影片中維持角色或風格一致嗎?

可以。參考素材引導是 FLUX 3 Video 的核心能力。參考圖搭配明確的提示詞,有助於在不同影格中穩定角色特徵、服裝和氛圍;FLUX 3 還被設計為可以將來源影片中的主體帶入新的場景。目前支援此預覽的模型允許你在規定範圍內加入參考圖、參考影片和參考音訊,以進一步提高一致性。

在 RunComfy 上使用 FLUX 3 Video 前,需要瞭解哪些輸入限制?

目前支援此預覽的模型建議中文 prompt 不超過約 500 個字元,英文 prompt 不超過約 1000 個單字。最多可加入 9 張參考圖 images、3 段參考影片 videos(每段 2~15 秒)和 3 段參考音訊 audios(每段 2~15 秒且小於 15 MB)。只有 prompt 是必填項目。FLUX 3 Video 上線時限制可能會變更,請以頁面上的最新參數面板為準。

這個 FLUX 3 Video 預覽提供哪些解析度、長寬比和時長選項?

resolution 可選 480p、720p(預設)、1080p 和 4K。aspect_ratio 可設為 adaptive(預設,由模型選擇最接近的比例),或固定為 16:9、9:16、4:3、3:4、1:1、21:9。目前支援此預覽的模型允許在 duration 中填寫 4~15 的整數,預設值為 5 秒;完整的 FLUX 3 Video 目標是支援單次最長 20 秒生成。

FLUX 3 Video 會提供開放權重或 LoRA 微調嗎?

FLUX 3 AI 規劃為一個包含多個版本的統一基礎模型。除託管版 FLUX 3 Video 外,Black Forest Labs 還公布了 FLUX 3 Image、FLUX 3 Action(面向機器人的 FLUX-mimic)和開放權重多模態基礎模型 FLUX 3 Dev。Black Forest Labs 已確認開放權重在計畫中;待 FLUX 3 Dev 發布後,預計社群會推出 FLUX 3 LoRA 工作流程,包括針對固定角色、風格和品牌視覺的 FLUX 3 dev LoRA 訓練。

如何將瀏覽器中測試完成的 FLUX 3 Video 接入正式環境 API?

先在 RunComfy 模型頁面中完成原型測試,再使用相同的 Input 欄位(prompt、images、videos、audios、aspect_ratio、duration、resolution、generate_audio、seed)透過 RunComfy API 呼叫同一個範本。建議先在 UI 中驗證提示詞和媒體限制,再使用帳戶的 API 金鑰和點數執行自動化工作。

使用這個 FLUX 3 Video 預覽生成影片需要多少費用?

目前預覽由 Seedance 2.0 Pro 提供生成能力,並按生成影片的時長扣除相應點數:480p 每秒 $0.08、720p 每秒 $0.175、1080p 每秒 $0.40、4K 每秒 $0.90。FLUX 3 Video 上線時價格會同步更新,請以本頁面顯示的最新價格為準。

關注我們
  • 領英
  • Facebook
  • Instagram
  • Twitter
支持
  • Discord
  • 電子郵件
  • 系統狀態
  • 附屬
視頻模型
  • Wan 2.6 Flash
  • Wan 2.6 Text to Video
  • Hailuo 2.3 Fast Standard
  • Happy Horse 1.1 reference to video
  • Seedance 2.5 Reference to Video
  • Seedance 2.0 Pro
  • 查看所有模型 →
影像模型
  • Seedream 5.0 Pro Image Edit
  • seedream 4.0
  • Flux 2 Flash Edit
  • Nano Banana Pro
  • Nano Banana 2 Edit
  • GPT Image 2 Image Edit
  • 查看所有模型 →
法律
  • 服務條款
  • 隱私政策
  • Cookie 政策
RunComfy
版權 2026 RunComfy. 保留所有權利。

RunComfy 是首選的 ComfyUI 平台,提供 ComfyUI 在線 環境和服務,以及 ComfyUI 工作流程 具有驚豔的視覺效果。 RunComfy還提供 AI Models, 幫助藝術家利用最新的AI工具創作出令人驚艷的藝術作品。

FLUX 3 Video 生成範例

Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...