logo
RunComfy
  • ComfyUI
  • 训练器新
  • 模型
  • API
  • 定价
discord logo
模型
探索
所有模型
资源库
生成记录
模型 API
API 文档
API 密钥
账户
使用情况

FLUX 3 Video:通过模型页面与 API 生成带原生音频的多模态视频 | RunComfy

blackforestlabs/flux-3/video

FLUX 3 Video 可生成最长 20 秒、带同步原生音频的短片。目前处于限量早期访问阶段,尚未在 RunComfy 正式上线。

描述视频内容的文本提示词(中文建议不超过约 500 个字符,英文建议不超过约 1000 个单词)。
多模态参考模式使用的图像(0~9 张)。支持 jpeg、png、webp、bmp、tiff、gif。
多模态参考模式使用的视频(0~3 个)。支持 mp4、mov,视频时长必须为 2~15 秒。
多模态参考模式使用的音频(0~3 个)。支持 wav、mp3,音频时长必须为 2~15 秒,文件大小应小于 15 MB。
默认为 `adaptive`。模型会选择最接近的比例,实际比例将在任务查询结果中返回。
填写 4~15 之间的整数。
设为 `true` 时,模型会输出带同步音频(对白、音效、音乐)的视频。
视频生成使用的随机种子。
加入 `web_search` 后,模型可能根据提示词内容(例如特定产品、当前天气)进行在线搜索。这样有助于提高事实时效性,但也会增加处理时间。
Idle
FLUX 3 Video is coming soon. Now the model is Seedance 2.0 Pro. Billed on total video seconds (input + output). The rate per second is $0.08 for 480p, $0.175 for 720p, $0.40 for 1080p, and $0.90 for 4k.

FLUX 3 Video 视频生成简介

FLUX 3 Video 即将在 RunComfy 上线。它把 Black Forest Labs 的统一多模态模型应用于视频与音频,可根据提示词和参考素材生成电影感短片,并配有同步的原生音频。它以提示词驱动的生成流程取代逐帧编辑、手动蒙版和单独配音,适合需要快速制作电影感短片的营销团队、代理公司、影视预演人员和游戏工作室。开发者既可在浏览器中使用 RunComfy 上的 FLUX 3 Video,也可通过 HTTP API 调用,无需自行托管或扩展模型。
适用场景:高转化视频广告 | 镜头设计准确的影视预演 | 多语言口型同步品牌叙事

Black Forest Labs / FLUX 3 Video#


FLUX 3 是 Black Forest Labs 的下一代统一模型,同时使用图像、视频和音频进行训练,让动作与声音建立在同一套理解基础上。本页聚焦它的视频能力,提前展示 FLUX 3 Video 在生产环境中的使用体验。


注意:FLUX 3 Video 即将上线。在 Black Forest Labs 完成公开模型和 API 之前,本页用于预览其计划中的使用体验。


FLUX 3 Video 核心亮点#


创作者选择 FLUX 3 Video 的原因包括:


  • 减少剪辑软件中的工作: 一段文字制作要求即可代替时间线剪辑、配音和手动清理。
  • 像导演镜头一样下指令: 摄影机角度、氛围和节奏都由你写下的文字决定。
  • 一次生成画面与声音: 每段视频都可自带同步的原生音频,无需另行配音。
  • 面向真实交付: 输出针对广告、预演和社交媒体版位设计,而不只是测试片段。

FLUX 3 Video 概览#


FLUX 3 Video 的主要能力如下:


  • 视频长度: 单次最长 20 秒,约为多数视频模型常见 10 秒上限的两倍,也为连接多个镜头、组成数分钟序列留出空间。
  • 音频: 与画面同时生成的同步原生声音;需要无声视频时可关闭。
  • 输入: 文本提示词加图像、视频和音频参考素材(参考图最多约 10 张),因此无论从零生成、编辑还是混合重构都能灵活处理。
  • 分辨率: 早期访问阶段为 720p;随着模型成熟,预计会支持更高分辨率。
  • 宽高比: 从竖屏 9:16 到超宽屏 21:9,覆盖社交媒体、影视和产品视频格式。
  • 风格: 一个模型即可生成自然的手持摄像机质感、动画和精致的电影感画面。
  • 状态: 目前处于限量早期访问阶段,即将在 RunComfy 上线。

FLUX 3 Video 关键能力#


Black Forest Labs 将 FLUX 3 Video 描述为一款包含多种生成模式的多模态模型,并且每次输出都可带原生音频。官方已确认的任务包括:


  • 文本生成视频: 只需文本提示词,即可生成最长 20 秒、带完整声音的视频。
  • 图像生成视频: 让起始帧动起来,或把提供的图像作为视觉参考来引导动作。
  • 视频生成视频: 将源视频中的核心元素——同一个角色或物体——带入新的场景或情境。
  • 视频与音频续写: 延长输入视频及其音轨,无需从头生成。
  • 关键帧生成视频: 定义关键时刻,由模型补全其间受控的过渡。

除上述模式外,FLUX 3 Video 还提供:


  • 嘴部动作跟随对白的 多语言对话。
  • 在保持角色一致性的同时连接多个片段,形成数分钟序列的 智能多镜头串联。
  • 从自然的手持摄像机画面到动画、电影感视觉的 广泛风格和宽高比。
  • 直接生成在画面中的 清晰文字排版和动态设计。
  • 基于现实的表现: Black Forest Labs 表示,FLUX 3 Video 已在富有表现力的面部,以及让声音匹配屏幕中的物理事件方面表现突出。

FLUX 3 Video 的原生音频与真实运动#


FLUX 3 Video 的独特之处,在于画面和声音从一开始就共同设计,而不是生成后再拼接。一次生成即可制作与动作同步的对白、拟音、环境声和音乐:门猛然关上时响起撞击声,警告灯闪烁时警报同步鸣响,人物也能在摄影机移动的同一镜头中说话。


这种同步源于模型的训练方式。Black Forest Labs 表示,视频预测占 FLUX 3 训练算力的 95% 以上,迫使模型学习接触、运动、重量和因果关系,也就是物理世界真实的运行方式。音频作为这一世界模型的结果进行学习,因此声音会与引发它的屏幕事件对齐,对白也会跟随嘴部动作。对创作者而言,这意味着动作在物理上更可信,配乐能够强化剪辑,而不是与画面冲突。


FLUX 3 Video 提示词与参考素材技巧#


在 FLUX 3 Video 预览阶段,可通过以下方法获得更稳定的结果:


  • 具体说明 摄影机 和 动作,例如中近景、缓慢推进、手持或固定机位。
  • 用 图像 锁定必须保持稳定的内容,如面部、服装、徽标;用 文本 描述需要变化的内容,如动作、氛围。
  • 参考 视频 与 音频 应控制在 2~15 秒,参考音频需小于 15 MB。
  • 开启音频时,明确说明想听到的对白语气或环境声。
  • 迭代时固定 随机种子,让变化来自提示词调整,而不是随机性。
  • 如果结果显得嘈杂或要求相互冲突,请简化提示词。

FLUX 3 Video 与其他模型的对比#


由于 FLUX 3 Video 仍处于早期访问阶段,目前最清晰的依据来自 Black Forest Labs 的初步评测,测试样本为带音频的 10 秒 720p 视频。在这些两两对比中,评测者选择 FLUX 3 的比例为:对比 Luma Ray 3.2 时为 93%,对比 Runway Gen-4.5 时为 77%,对比 Grok Imagine Video 时最高为 69%,对比 Kling v3 Pro 时为 60%,对比 Seedance 2.0 和 Gemini Omni Flash 时均为 52%。这些数据仍处于早期阶段,预计还会变化,但能让下面的比较更多基于能力,而不是宣传。


FLUX 3 Video vs FLUX.2#


  • 从静态图像到动态视频: 包括 FLUX.2 在内的所有早期 FLUX 都只能生成静态图。FLUX 3 首次把视频和同步音频整合进同一个基础模型,让 FLUX 的参考素材处理、提示词遵循和文字排版能力延伸到动态片段。
  • 延续的优势: 让 FLUX 图像模型值得信赖的特点——稳定保持角色、产品或徽标——被 FLUX 3 Video 扩展到整个镜头。
  • 全新领域: 动作、时间稳定性和卡点音频,都是一家以图像起步的实验室需要解决的新问题,这也正是设置早期访问阶段的原因。

FLUX 3 Video vs Seedance 2.0#


  • 评测数据: 在 Black Forest Labs 的早期测试中,与 Seedance 2.0 对比时有 52% 的结果更偏好 FLUX 3,与一个成熟、经过验证的多模态视频模型基本持平。
  • 能力: Seedance 2.0 可在一次请求中混合文本、图像、视频和音频,生成约 15 秒、480p~4K 的多镜头视频,配有原生同步多轨音频,并支持编辑与延长。FLUX 3 Video 追求同等规模的多模态能力;Black Forest Labs 表示,它尤其擅长富有表现力的面部、与物理事件匹配的声音和多语言对白。
  • 如何选择: 如果现在就必须投入生产,Seedance 2.0 已有成熟表现;随着公开发布临近,FLUX 3 Video 则是值得关注的选择。

FLUX 3 Video vs Kling、Runway 与 Luma#


  • 评测数据: 在 Black Forest Labs 的早期对比中,FLUX 3 对 Kling v3 Pro 的偏好率为 60%,对 Runway Gen-4.5 为 77%,对 Luma Ray 3.2 为 93%。
  • 差距来源: 这些优势与 FLUX 3 Video 宣称的强项一致:富有表现力的人脸、与屏幕物理事件同步的音频、多语言对白和稳定的多镜头串联。正是这些细节,让一段短片更像完成作品,而不是测试渲染。

FLUX 3 Video 早期访问阶段的预期#


FLUX 3 Video 目前仍处于限量早期访问阶段,合理的预期包括:


  • 目前的强项: 较长且连贯的视频、由对白推动的戏剧性场景、原生同步音频,在早期实际测试中都有较好表现。
  • 仍在成熟: 早期版本的图像生成视频功能对参考图的遵循可能不稳定;面对速度很快、能量很强的动作时,动态张力尚未达到部分专攻运动表现的竞争模型。
  • 逐步推出: 分辨率从约 720p 起步,预计后续支持更高分辨率;价格和开放权重仍待 Black Forest Labs 确认。

可将 FLUX 3 Video 视为模型未来方向的预览:随着它走向全面发布,功能和限制仍会持续变化。


FLUX 3 Video 版本与完整的 FLUX 3 AI 系列#


Black Forest Labs 正在把 FLUX 3 AI 作为一个包含多个版本的统一多模态基础模型逐步推出。每个版本都会经过各自的早期访问期,再分阶段发布。根据官方发布计划:


  • FLUX 3 Video: 通过 API 和私有权重访问提供视频与音频生成、编辑,即本页预览的体验。
  • FLUX 3 Image: 提供图像生成与编辑,同样通过 API 和私有权重访问交付。
  • FLUX 3 Action(FLUX-mimic): 面向机器人的动作预测,与 mimic robotics 等合作伙伴共同开发,并已在 Audi 生产线上测试。
  • FLUX 3 Dev: 覆盖图像、视频、音频生成及动作预测的开放权重多模态基础模型,适合希望自行运行并调整模型的团队。

Black Forest Labs 已确认计划开放权重。待 FLUX 3 Dev 基础模型发布后,社区推出 FLUX 3 LoRA 工作流将是自然的下一步,其中包括针对固定角色、风格和品牌视觉的 FLUX 3 dev LoRA 微调,就像早期 FLUX 版本所催生的大型 LoRA 生态一样。


对大多数团队而言,FLUX 3 Video 可承担日常视频制作,而 FLUX 3 Dev 与 FLUX 3 dev LoRA 则为自托管定制提供更多可能。


FLUX 3 Video 官方资源#


  • Black Forest Labs

简而言之,FLUX 3 Video 即将在 RunComfy 上线:这个统一多模态基础模型可将提示词与参考素材转化为带同步原生音频的电影感短片。

相关模型

gemini-omni-flash/image-to-video

将一张静态图像生成带同步音频的短视频。

hunyuan-video-v1.5/text-to-video

根据必填提示词生成 5 秒或 8 秒视频,并可设置负面提示词、四种精确尺寸和随机种子。

ace-step-1.5/text-to-audio

根据风格标签和歌词生成最长 4 分钟、带人声的歌曲。

seedance-2.0-mini/text-to-video

快速、低成本的多镜头 AI 视频模型,原生支持音频和参考素材。

Hailuo Video 01 Director

内置镜头运动指令与分镜模板,轻松实现高质量影视创作

seedance-1-0/pro/image-to-video

以Seedance 1.0将静态图像瞬间变成电影级动态视频,创作过程高效流畅。

常见问题

FLUX 3 Video 现在可以在 RunComfy 上使用吗?

FLUX 3 Video 即将上线。在 Black Forest Labs 完成统一多模态模型及其 API 的公开版本之前,你可以通过这个预览页提前了解 FLUX 3 Video 的使用体验。在 FLUX 3 后端正式启用前,页面当前显示的输入项和限制来自支撑该预览的现有模型。

FLUX 3 Video 适合用来做什么?

FLUX 3 Video 可根据提示词以及可选的图像、视频和音频参考素材,生成带原生音频的电影感短片。它适合制作强调参考素材一致性和声画同步的广告创意、影视预演和品牌叙事内容。

与以往的视频生成方式相比,FLUX 3 Video 有哪些提升?

FLUX 3 Video 把 Black Forest Labs 的能力扩展到动态画面和声音,并整合到统一的多模态基础模型中。官方已确认五类任务:文本生成视频、图像生成视频、视频生成视频、视频与音频续写,以及关键帧生成视频。此外,它还将支持原生音频、多语言对白和单次最长 20 秒的视频。实际提升会因内容而异,模型上线后建议使用相同提示词对比生成结果。

FLUX 3 Video 最长可以生成多少秒的视频?

FLUX 3 Video 单次最多可生成 20 秒视频,约为许多视频模型常见 10 秒上限的两倍,为对白节奏和舒缓的戏剧性镜头留出更多空间。它还可以在保持角色一致性的同时,把多个镜头串联成数分钟的序列。当前支撑该预览的模型支持 4~15 秒;完整的 FLUX 3 Video 目标是支持单次 20 秒生成。

FLUX 3 Video 支持原生音频和口型同步吗?

支持。原生音频是 FLUX 3 Video 的核心能力。当前支撑该预览的模型也可以开启音频生成,输出与画面同步的对白、音效和音乐,并支持多语言口型同步;需要无声视频时可以关闭。口型同步质量会受到提示词清晰度和场景设置的影响。

为什么 FLUX 3 Video 的动作和声音看起来更真实?

FLUX 3 的大部分训练算力用于视频预测,因此模型必须学习接触、运动、重量和因果关系,也就是现实世界的物理规律。原生音频建立在这一世界模型之上,所以声音能与引发它的画面事件对应,对白也能跟随嘴部动作。实际表现中,FLUX 3 Video 尤其擅长富有表现力的面部和符合物理规律的运动。

FLUX 3 Video 能在整段视频中保持角色或风格一致吗?

可以。参考素材引导是 FLUX 3 Video 的核心能力。参考图配合明确的提示词,有助于在不同帧中稳定角色特征、服装和氛围;FLUX 3 还被设计为可以把源视频中的主体带入新的场景。当前支撑该预览的模型允许你在规定范围内添加参考图、参考视频和参考音频,以进一步提高一致性。

在 RunComfy 上使用 FLUX 3 Video 前,需要了解哪些输入限制?

当前支撑该预览的模型建议中文 prompt 不超过约 500 个字符,英文 prompt 不超过约 1000 个单词。最多可添加 9 张参考图 images、3 个参考视频 videos(每个 2~15 秒)和 3 段参考音频 audios(每段 2~15 秒且小于 15 MB)。只有 prompt 是必填项。FLUX 3 Video 上线时限制可能会变化,请以页面上的最新参数面板为准。

这个 FLUX 3 Video 预览提供哪些分辨率、宽高比和时长选项?

resolution 可选 480p、720p(默认)、1080p 和 4K。aspect_ratio 可设为 adaptive(默认,由模型选择最接近的比例),或固定为 16:9、9:16、4:3、3:4、1:1、21:9。当前支撑该预览的模型允许在 duration 中填写 4~15 的整数,默认值为 5 秒;完整的 FLUX 3 Video 目标是支持单次最长 20 秒生成。

FLUX 3 Video 会提供开放权重或 LoRA 微调吗?

FLUX 3 AI 规划为一个包含多个版本的统一基础模型。除托管版 FLUX 3 Video 外,Black Forest Labs 还公布了 FLUX 3 Image、FLUX 3 Action(面向机器人的 FLUX-mimic)和开放权重多模态基础模型 FLUX 3 Dev。Black Forest Labs 已确认开放权重在计划中;待 FLUX 3 Dev 发布后,预计社区会推出 FLUX 3 LoRA 工作流,包括面向固定角色、风格和品牌视觉的 FLUX 3 dev LoRA 训练。

如何把浏览器中测试好的 FLUX 3 Video 接入生产环境 API?

先在 RunComfy 模型页面中完成原型测试,再使用相同的 Input 字段(prompt、images、videos、audios、aspect_ratio、duration、resolution、generate_audio、seed)通过 RunComfy API 调用同一个模板。建议先在 UI 中验证提示词和媒体限制,再使用账户的 API 密钥和积分运行自动化任务。

使用这个 FLUX 3 Video 预览生成视频需要多少钱?

当前预览由 Seedance 2.0 Pro 提供生成能力,并按生成视频的时长消耗相应积分:480p 每秒 $0.08、720p 每秒 $0.175、1080p 每秒 $0.40、4K 每秒 $0.90。FLUX 3 Video 上线时价格会同步更新,请以本页面显示的最新价格为准。

关注我们
  • 领英
  • Facebook
  • Instagram
  • Twitter
支持
  • Discord
  • 电子邮件
  • 系统状态
  • 附属
视频模型
  • Wan 2.6 Flash
  • Wan 2.6 Text to Video
  • Hailuo 2.3 Fast Standard
  • Happy Horse 1.1 reference to video
  • Seedance 2.5 Reference to Video
  • Seedance 2.0 Pro
  • 查看所有模型 →
图像模型
  • Seedream 5.0 Pro Image Edit
  • seedream 4.0
  • Flux 2 Flash Edit
  • Nano Banana Pro
  • Nano Banana 2 Edit
  • GPT Image 2 Image Edit
  • 查看所有模型 →
法律
  • 服务条款
  • 隐私政策
  • Cookie 政策
RunComfy
版权 2026 RunComfy. 保留所有权利。

RunComfy 是首选的 ComfyUI 平台,提供 ComfyUI 在线 环境和服务,以及 ComfyUI 工作流 具有惊艳的视觉效果。 RunComfy还提供 AI Models, 帮助艺术家利用最新的AI工具创作出令人惊叹的艺术作品。

FLUX 3 Video 生成示例

Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...
Video thumbnail
Loading...