Seedance 2.5 即將推出:依參考素材產生電影級 AI 影片
FLUX 3 是 Black Forest Labs 的下一代統一模型,同時使用圖像、影片和音訊進行訓練,讓動作與聲音建立在同一套理解基礎上。本頁聚焦它的影片能力,搶先展示 FLUX 3 Video 在正式製作環境中的使用體驗。
注意:FLUX 3 Video 即將上線。在 Black Forest Labs 完成公開模型和 API 之前,本頁可預覽其規劃中的使用體驗。
創作者選擇 FLUX 3 Video 的原因包括:
FLUX 3 Video 的主要能力如下:
Black Forest Labs 將 FLUX 3 Video 描述為一款包含多種生成模式的多模態模型,並且每次輸出都可帶原生音訊。官方已確認的任務包括:
除上述模式外,FLUX 3 Video 還提供:
FLUX 3 Video 的獨特之處,在於畫面和聲音從一開始就共同設計,而不是生成後再拼接。一次生成即可製作與動作同步的對白、擬音、環境聲和音樂:門猛然關上時響起撞擊聲,警告燈閃爍時警報同步鳴響,人物也能在攝影機移動的同一鏡頭中說話。
這種同步源於模型的訓練方式。Black Forest Labs 表示,影片預測佔 FLUX 3 訓練算力的 95% 以上,迫使模型學習接觸、運動、重量和因果關係,也就是物理世界實際的運作方式。音訊作為這一世界模型的結果進行學習,因此聲音會與造成聲響的畫面事件對齊,對白也會跟隨嘴部動作。對創作者而言,這意味著動作在物理上更可信,配樂能夠強化剪輯,而不是與畫面衝突。
在 FLUX 3 Video 預覽階段,可透過以下方法獲得更穩定的結果:
由於 FLUX 3 Video 仍處於早期存取階段,目前最清晰的依據來自 Black Forest Labs 的初步評估,測試樣本為帶音訊的 10 秒 720p 影片。在這些兩兩對比中,評估者選擇 FLUX 3 的比例為:比較 Luma Ray 3.2 時為 93%,比較 Runway Gen-4.5 時為 77%,比較 Grok Imagine Video 時最高為 69%,比較 Kling v3 Pro 時為 60%,比較 Seedance 2.0 和 Gemini Omni Flash 時均為 52%。這些資料仍處於早期階段,預計還會變化,但能讓下面的比較更多基於能力,而不是宣傳。
FLUX 3 Video 目前仍處於限量早期存取階段,合理的預期包括:
可將 FLUX 3 Video 視為模型未來方向的預覽:隨著它朝正式上線邁進,功能和限制仍會持續變化。
Black Forest Labs 正在把 FLUX 3 AI 定位為包含多個版本的統一多模態基礎模型逐步推出。每個版本都會經過各自的早期存取期,再分階段釋出。根據官方釋出計劃:
Black Forest Labs 已確認規劃開放權重。待 FLUX 3 Dev 基礎模型釋出後,社群推出 FLUX 3 LoRA 工作流程將是自然的下一步,其中包括針對固定角色、風格和品牌視覺的 FLUX 3 dev LoRA 微調,就像早期 FLUX 版本所催生的大型 LoRA 生態一樣。
對大多數團隊而言,FLUX 3 Video 可承擔日常影片製作,而 FLUX 3 Dev 與 FLUX 3 dev LoRA 則為自託管客製化提供更多可能。
簡而言之,FLUX 3 Video 即將在 RunComfy 上線:這個統一多模態基礎模型可將提示詞與參考素材轉化為帶同步原生音訊的電影感短片。
Seedance 2.5 即將推出:依參考素材產生電影級 AI 影片
透過兩個必填 URL,將音訊軌道與現有影片同步。
將來源影片放大至所選目標解析度與影格率。
依照圖片、音訊和提示詞產生影片,並分別調整文字與音訊的引導強度。
根據文字生成 3–15 秒電影感影片,並可選擇同步音訊。
根據參考素材生成 3–15 秒影片,起價為每秒 $0.084。
FLUX 3 Video 即將上線。在 Black Forest Labs 完成統一多模態模型及其 API 的公開版本之前,你可以透過這個預覽頁提前瞭解 FLUX 3 Video 的使用體驗。在 FLUX 3 後端正式啟用前,頁面目前顯示的輸入項目與限制來自支援此預覽的現有模型。
FLUX 3 Video 可根據提示詞以及選用的圖像、影片和音訊參考素材,生成帶原生音訊的電影感短片。它適合製作重視參考素材一致性和聲畫同步的廣告創意、影視預演和品牌敘事內容。
FLUX 3 Video 將 Black Forest Labs 的能力延伸到動態畫面和聲音,並整合到統一的多模態基礎模型中。官方已確認五類任務:文字生成影片、圖像生成影片、影片生成影片、影片與音訊續寫,以及關鍵影格生成影片。此外,它還將支援原生音訊、多語言對白和單次最長 20 秒的影片。實際提升幅度會因內容而異,模型上線後建議使用相同提示詞比較生成結果。
FLUX 3 Video 單次最多可生成 20 秒影片,約為許多影片模型常見 10 秒上限的兩倍,能為對白節奏和舒緩的戲劇性鏡頭保留更多空間。它還可以在維持角色一致性的同時,將多個鏡頭串連成數分鐘的序列。目前支援此預覽的模型可設定 4~15 秒;完整的 FLUX 3 Video 目標是支援單次 20 秒生成。
支援。原生音訊是 FLUX 3 Video 的核心能力。目前支援此預覽的模型也可以開啟音訊生成,輸出與畫面同步的對白、音效和音樂,並支援多語言嘴型同步;需要無聲影片時可以關閉。嘴型同步品質會受到提示詞清晰度和場景設定的影響。
FLUX 3 的大部分訓練算力用於影片預測,因此模型必須學習接觸、運動、重量和因果關係,也就是現實世界的物理規律。原生音訊建立在這個世界模型之上,所以聲音能與觸發它的畫面事件對應,對白也能跟隨嘴部動作。實際表現中,FLUX 3 Video 尤其擅長富有表現力的臉部和符合物理規律的運動。
可以。參考素材引導是 FLUX 3 Video 的核心能力。參考圖搭配明確的提示詞,有助於在不同影格中穩定角色特徵、服裝和氛圍;FLUX 3 還被設計為可以將來源影片中的主體帶入新的場景。目前支援此預覽的模型允許你在規定範圍內加入參考圖、參考影片和參考音訊,以進一步提高一致性。
目前支援此預覽的模型建議中文 prompt 不超過約 500 個字元,英文 prompt 不超過約 1000 個單字。最多可加入 9 張參考圖 images、3 段參考影片 videos(每段 2~15 秒)和 3 段參考音訊 audios(每段 2~15 秒且小於 15 MB)。只有 prompt 是必填項目。FLUX 3 Video 上線時限制可能會變更,請以頁面上的最新參數面板為準。
resolution 可選 480p、720p(預設)、1080p 和 4K。aspect_ratio 可設為 adaptive(預設,由模型選擇最接近的比例),或固定為 16:9、9:16、4:3、3:4、1:1、21:9。目前支援此預覽的模型允許在 duration 中填寫 4~15 的整數,預設值為 5 秒;完整的 FLUX 3 Video 目標是支援單次最長 20 秒生成。
FLUX 3 AI 規劃為一個包含多個版本的統一基礎模型。除託管版 FLUX 3 Video 外,Black Forest Labs 還公布了 FLUX 3 Image、FLUX 3 Action(面向機器人的 FLUX-mimic)和開放權重多模態基礎模型 FLUX 3 Dev。Black Forest Labs 已確認開放權重在計畫中;待 FLUX 3 Dev 發布後,預計社群會推出 FLUX 3 LoRA 工作流程,包括針對固定角色、風格和品牌視覺的 FLUX 3 dev LoRA 訓練。
先在 RunComfy 模型頁面中完成原型測試,再使用相同的 Input 欄位(prompt、images、videos、audios、aspect_ratio、duration、resolution、generate_audio、seed)透過 RunComfy API 呼叫同一個範本。建議先在 UI 中驗證提示詞和媒體限制,再使用帳戶的 API 金鑰和點數執行自動化工作。
目前預覽由 Seedance 2.0 Pro 提供生成能力,並按生成影片的時長扣除相應點數:480p 每秒 $0.08、720p 每秒 $0.175、1080p 每秒 $0.40、4K 每秒 $0.90。FLUX 3 Video 上線時價格會同步更新,請以本頁面顯示的最新價格為準。
RunComfy 是首選的 ComfyUI 平台,提供 ComfyUI 在線 環境和服務,以及 ComfyUI 工作流程 具有驚豔的視覺效果。 RunComfy還提供 AI Models, 幫助藝術家利用最新的AI工具創作出令人驚艷的藝術作品。





