将一张静态图像生成带同步音频的短视频。
FLUX 3 是 Black Forest Labs 的下一代统一模型,同时使用图像、视频和音频进行训练,让动作与声音建立在同一套理解基础上。本页聚焦它的视频能力,提前展示 FLUX 3 Video 在生产环境中的使用体验。
注意:FLUX 3 Video 即将上线。在 Black Forest Labs 完成公开模型和 API 之前,本页用于预览其计划中的使用体验。
创作者选择 FLUX 3 Video 的原因包括:
FLUX 3 Video 的主要能力如下:
Black Forest Labs 将 FLUX 3 Video 描述为一款包含多种生成模式的多模态模型,并且每次输出都可带原生音频。官方已确认的任务包括:
除上述模式外,FLUX 3 Video 还提供:
FLUX 3 Video 的独特之处,在于画面和声音从一开始就共同设计,而不是生成后再拼接。一次生成即可制作与动作同步的对白、拟音、环境声和音乐:门猛然关上时响起撞击声,警告灯闪烁时警报同步鸣响,人物也能在摄影机移动的同一镜头中说话。
这种同步源于模型的训练方式。Black Forest Labs 表示,视频预测占 FLUX 3 训练算力的 95% 以上,迫使模型学习接触、运动、重量和因果关系,也就是物理世界真实的运行方式。音频作为这一世界模型的结果进行学习,因此声音会与引发它的屏幕事件对齐,对白也会跟随嘴部动作。对创作者而言,这意味着动作在物理上更可信,配乐能够强化剪辑,而不是与画面冲突。
在 FLUX 3 Video 预览阶段,可通过以下方法获得更稳定的结果:
由于 FLUX 3 Video 仍处于早期访问阶段,目前最清晰的依据来自 Black Forest Labs 的初步评测,测试样本为带音频的 10 秒 720p 视频。在这些两两对比中,评测者选择 FLUX 3 的比例为:对比 Luma Ray 3.2 时为 93%,对比 Runway Gen-4.5 时为 77%,对比 Grok Imagine Video 时最高为 69%,对比 Kling v3 Pro 时为 60%,对比 Seedance 2.0 和 Gemini Omni Flash 时均为 52%。这些数据仍处于早期阶段,预计还会变化,但能让下面的比较更多基于能力,而不是宣传。
FLUX 3 Video 目前仍处于限量早期访问阶段,合理的预期包括:
可将 FLUX 3 Video 视为模型未来方向的预览:随着它走向全面发布,功能和限制仍会持续变化。
Black Forest Labs 正在把 FLUX 3 AI 作为一个包含多个版本的统一多模态基础模型逐步推出。每个版本都会经过各自的早期访问期,再分阶段发布。根据官方发布计划:
Black Forest Labs 已确认计划开放权重。待 FLUX 3 Dev 基础模型发布后,社区推出 FLUX 3 LoRA 工作流将是自然的下一步,其中包括针对固定角色、风格和品牌视觉的 FLUX 3 dev LoRA 微调,就像早期 FLUX 版本所催生的大型 LoRA 生态一样。
对大多数团队而言,FLUX 3 Video 可承担日常视频制作,而 FLUX 3 Dev 与 FLUX 3 dev LoRA 则为自托管定制提供更多可能。
简而言之,FLUX 3 Video 即将在 RunComfy 上线:这个统一多模态基础模型可将提示词与参考素材转化为带同步原生音频的电影感短片。
将一张静态图像生成带同步音频的短视频。
根据必填提示词生成 5 秒或 8 秒视频,并可设置负面提示词、四种精确尺寸和随机种子。
根据风格标签和歌词生成最长 4 分钟、带人声的歌曲。
快速、低成本的多镜头 AI 视频模型,原生支持音频和参考素材。
内置镜头运动指令与分镜模板,轻松实现高质量影视创作
以Seedance 1.0将静态图像瞬间变成电影级动态视频,创作过程高效流畅。
FLUX 3 Video 即将上线。在 Black Forest Labs 完成统一多模态模型及其 API 的公开版本之前,你可以通过这个预览页提前了解 FLUX 3 Video 的使用体验。在 FLUX 3 后端正式启用前,页面当前显示的输入项和限制来自支撑该预览的现有模型。
FLUX 3 Video 可根据提示词以及可选的图像、视频和音频参考素材,生成带原生音频的电影感短片。它适合制作强调参考素材一致性和声画同步的广告创意、影视预演和品牌叙事内容。
FLUX 3 Video 把 Black Forest Labs 的能力扩展到动态画面和声音,并整合到统一的多模态基础模型中。官方已确认五类任务:文本生成视频、图像生成视频、视频生成视频、视频与音频续写,以及关键帧生成视频。此外,它还将支持原生音频、多语言对白和单次最长 20 秒的视频。实际提升会因内容而异,模型上线后建议使用相同提示词对比生成结果。
FLUX 3 Video 单次最多可生成 20 秒视频,约为许多视频模型常见 10 秒上限的两倍,为对白节奏和舒缓的戏剧性镜头留出更多空间。它还可以在保持角色一致性的同时,把多个镜头串联成数分钟的序列。当前支撑该预览的模型支持 4~15 秒;完整的 FLUX 3 Video 目标是支持单次 20 秒生成。
支持。原生音频是 FLUX 3 Video 的核心能力。当前支撑该预览的模型也可以开启音频生成,输出与画面同步的对白、音效和音乐,并支持多语言口型同步;需要无声视频时可以关闭。口型同步质量会受到提示词清晰度和场景设置的影响。
FLUX 3 的大部分训练算力用于视频预测,因此模型必须学习接触、运动、重量和因果关系,也就是现实世界的物理规律。原生音频建立在这一世界模型之上,所以声音能与引发它的画面事件对应,对白也能跟随嘴部动作。实际表现中,FLUX 3 Video 尤其擅长富有表现力的面部和符合物理规律的运动。
可以。参考素材引导是 FLUX 3 Video 的核心能力。参考图配合明确的提示词,有助于在不同帧中稳定角色特征、服装和氛围;FLUX 3 还被设计为可以把源视频中的主体带入新的场景。当前支撑该预览的模型允许你在规定范围内添加参考图、参考视频和参考音频,以进一步提高一致性。
当前支撑该预览的模型建议中文 prompt 不超过约 500 个字符,英文 prompt 不超过约 1000 个单词。最多可添加 9 张参考图 images、3 个参考视频 videos(每个 2~15 秒)和 3 段参考音频 audios(每段 2~15 秒且小于 15 MB)。只有 prompt 是必填项。FLUX 3 Video 上线时限制可能会变化,请以页面上的最新参数面板为准。
resolution 可选 480p、720p(默认)、1080p 和 4K。aspect_ratio 可设为 adaptive(默认,由模型选择最接近的比例),或固定为 16:9、9:16、4:3、3:4、1:1、21:9。当前支撑该预览的模型允许在 duration 中填写 4~15 的整数,默认值为 5 秒;完整的 FLUX 3 Video 目标是支持单次最长 20 秒生成。
FLUX 3 AI 规划为一个包含多个版本的统一基础模型。除托管版 FLUX 3 Video 外,Black Forest Labs 还公布了 FLUX 3 Image、FLUX 3 Action(面向机器人的 FLUX-mimic)和开放权重多模态基础模型 FLUX 3 Dev。Black Forest Labs 已确认开放权重在计划中;待 FLUX 3 Dev 发布后,预计社区会推出 FLUX 3 LoRA 工作流,包括面向固定角色、风格和品牌视觉的 FLUX 3 dev LoRA 训练。
先在 RunComfy 模型页面中完成原型测试,再使用相同的 Input 字段(prompt、images、videos、audios、aspect_ratio、duration、resolution、generate_audio、seed)通过 RunComfy API 调用同一个模板。建议先在 UI 中验证提示词和媒体限制,再使用账户的 API 密钥和积分运行自动化任务。
当前预览由 Seedance 2.0 Pro 提供生成能力,并按生成视频的时长消耗相应积分:480p 每秒 $0.08、720p 每秒 $0.175、1080p 每秒 $0.40、4K 每秒 $0.90。FLUX 3 Video 上线时价格会同步更新,请以本页面显示的最新价格为准。
RunComfy 是首选的 ComfyUI 平台,提供 ComfyUI 在线 环境和服务,以及 ComfyUI 工作流 具有惊艳的视觉效果。 RunComfy还提供 AI Models, 帮助艺术家利用最新的AI工具创作出令人惊叹的艺术作品。





