AI 快讯 | Black Forest Labs 开源 FLUX 3 Action:7B「世界动作模型」在 RoboLab-120 登顶

:fire: 一句话核心:Black Forest Labs(FLUX 图像模型的团队)发布 FLUX 3 Action——一个 7B 参数的开源权重「世界动作模型(World Action Model, WAM)」,用于机器人控制。官方称它在 RoboLab-120 榜单上以不到此前最好开源模型一半的参数量创下新的成功率纪录(官方表格口径 42.92%),同时最高快 3.95 倍。这是「生成模型团队转向物理 AI」的一个具体落点。

Black Forest Labs 官方模型图:FLUX 3 Action(来源:bfl.ai/models/flux-3-action)


:pushpin: 背景脉络

  • BFL 是 FLUX 图像模型的团队;本条是一家做图像/视频生成的实验室,把「预测未来帧」的能力改造成「预测机器人动作」——官方把这一整类能力称为「Visual Intelligence」里的一支:action prediction。
  • 与本周已发条目的关系:topic 170(小米 MiMo-V2.6)、**topic 176(Gemini 4 进入后训练)**讲的是模型能力与节奏;本条补的是「模型往哪里去」这条线里最少被写到的一支——具身/机器人。
  • 时间:9 月 24 日(据媒体报道);:warning: 制品自身的发布日期本次未取到。

:key: 关键细节(官方模型页原文)

定位

「We present FLUX 3 Action, an open-weight 7B world-action-model derived from our multimodal FLUX 3 backbone, that was pretrained on a large-scale collection of video, image and audio data — with a strong emphasis on videos.」

能力与输入输出

  • 接收相机观测、机器人当前状态与自然语言指令,直接转成物理动作(据媒体报道);
  • 官方的表述是「从一系列观测(例如机器人工作站上多路摄像头的视频)预测智能体的下一个动作及其环境状态」。

榜单成绩(官方表格,RoboLab-120)

模型 是否开源 类型 成功率 参数量
FLUX 3 Action 开源 WAM 42.92% 7B
OASIS 闭源 VLM + WAM 39.0% —
Cosmos3-Nano-Policy 开源 WAM 36.8% 16B
Phoenix 闭源 TAMP+FM 34.4% —
BiMind v0.1 闭源 VLA 33.3% —
π0.5 开源 VLA 28.0% 3.3B
DreamZero 开源 WAM 25.7% 14B
Cosmos3-Edge-Policy 开源 WAM 22.9% 4B
π0-FAST 开源 VLA 15.5% 3B
GR00T N1.6 开源 VLA 7.2% 3B
π0 开源 VLA 5.0% 3.3B
paligemma-binning 开源 VLA 3.4% 3B

(上表为官方 Table 1 的全部 12 行;图注原文:「RoboLab-120 overall success rates. Types and weight availability follow the RoboLab leaderboard.」)

官方原话:「On the RoboLab-120 leaderboard it sets a new state-of-the-art success rate at less than half the parameters of the previous best open model, while running up to 3.95x faster.」

开放范围与一个官方强调

  • 权重已发布(Hugging Face black-forest-labs/flux-3-action-base);官方称同时发布技术报告,覆盖预训练 → 中训练 → 微调 → 推理优化全过程;
  • 官方特别强调:「In robotics, the fine-tuning recipe is just as important as the weights.」(在机器人领域,微调配方和权重一样重要)——这正是他们连报告一起发的理由。

两个可核的实测细节

  • 他们把同一套微调配方用在廉价的 SO-101 机器人上,称策略「30 次尝试完成 28 次」;
  • 官方还分析了混合系统:把快速动作预测与前沿推理模型的规划能力结合,称「up to 53.64% more success per dollar」。

合作与硬件(官方致谢原文):与 NVIDIA(Jetson 集成、在 SO-101 上测参数高效微调)、Hugging Face 与 LeRobot 合作;评测基础来自 NVIDIA Isaac Lab 与 RoboLab 团队;模型在 NVIDIA GB200 上训练,自定义 kernel 用 NVIDIA 的 CuTe DSL 编写。


:bar_chart: 数据解读与口径

一、:warning: 官方页自己给出了多个不同的成功率,引用时必须指明是哪一个

同一页面上至少出现五个数值,对应不同检查点与不同精度/GPU:

数值 官方出处 对应对象
42.92% Table 1(榜单汇总表) 官方未标注该行对应的检查点与精度(本文标题与表格采用此值)
42.2% ± 0.36 正文 guidance-distilled 检查点
42.24% 正文(B200、FP8) 同上检查点、实时因子 0.048
38.3% ± 0.38 正文 single step 7B 检查点
37.92% 正文 step-distilled 变体(实时因子 0.015)

:warning: 两点必须说清:① Table 1 的图注原文只写「RoboLab-120 overall success rates. Types and weight availability follow the RoboLab leaderboard.」——它并未标注 42.92% 那一行对应哪个检查点与精度,不要自行把它对到 guidance-distilled 上;② 42.92% 与 42.2%/42.24% 不是同一个口径。⇒ 本文统一采用表格的 42.92%,并在此列出其余数值——不要把几个数混用,也不要把某一个说成「唯一的官方数字」。

二、加速倍数是两组区间,而且不是「每次调用延迟」

官方原话有两处,比较对象不同:

  • 对 Cosmos 3 Nano(FP8):「1.52x through 3.95x speedup」(跨消费级、工作站与数据中心 GPU);
  • 对 π0.5:「1.34x through 2.28x improvement in speed per second of robot motion」(工作站与数据中心 GPU)。

官方还专门注明:这里的速度优势是「实时因子(real-time factor)」,不是每次调用的延迟——因为作为 WAM,它能一次预测 2.13 秒的运动,而 π0.5 是 1.0 秒。

⇒ 本文标题沿用官方概述句的「up to 3.95x faster」;二手媒体出现的「1.43 倍」与官方两组区间都不吻合,不采用。

三、「高 6.1 分」不是官方表述,但可从官方表格算出

官方表格:FLUX 3 Action 42.92% vs Cosmos3-Nano-Policy 36.8%(开源模型中前一名;榜单里 39.0% 的 OASIS 是闭源)⇒ 差值约 6.1 个百分点。这是计算值,不是官方原话。

四、「WAM」是厂商自创的类别名

World Action Model 与通常说的「世界模型(world model)」不是一回事 ⇒ 不要混写。

五、制品核到的范围有限

官方称发布权重与技术报告;权重在 Hugging Face。:warning: BFL 的 GitHub 路径返回 404,且本文未逐一核到「代码/微调配方/可复现示例」是否已实际发布 ⇒ 引用「将发布」时须保留该限定。

六、榜单里开源与闭源混排,参数列并不齐

部分闭源模型未标参数量 ⇒ 做「参数量对比」时必须注明哪些是开源,否则会把「闭源未标参数」误读成「参数很小」。


:money_bag: 价格与成本

权重开源、无 API 定价,但官方给出了一组很具体的成本对照(均为官方自测,在 H200/$3 每小时的口径下):

方案 每次成功成本 每次成功耗时
纯推理(GPT-6 Astra 最大推理档) $13.47 约 16 分钟
F3A 单独跑 $0.09 不到 2 分钟
混合(Astra 把控制权交给 F3A、必要时介入) $8.77 8 分钟
  • 官方称混合策略仍能解决 90% 的回合(含纯动作策略单独解不了的复杂任务),比最佳替代配置便宜 29%、快 40%;
  • 纯推理的代价是每次推理调用要为每秒钟机器人动作多花约 35.77 秒;
  • 官方同时给出效率口径「up to 53.64% more success per dollar」。
  • :warning: 以上全部是官方自测,无第三方复现;且纯推理档仍达到最高准确率——官方自己写明「可靠性与成本之间的权衡依然存在」。

:balance_scale: 辩证评估

为什么值得跟:

  • 一个做图像生成的团队,用 7B 的开源权重在机器人控制榜单登顶——这说明「视频生成」练出来的表征,可以迁移到「动作预测」;
  • 更实际的一点:他们把「微调配方」与「报告」一并公开。对具身智能社区,配方往往比权重更有迁移价值(官方自己也这么说);
  • 成本对照很硬:纯推理 $13.47/次 vs F3A 单独 $0.09/次——相差两个数量级,这对「要不要给机器人上大模型」是个直接的算账依据。

反向视角:

  1. 全部为厂商自测,无第三方复现;
  2. 榜单为官方自建的 RoboLab-120(与 NVIDIA 团队合作提供评测基础);
  3. 官方页自身口径不一致(成功率五个数值,见上);
  4. 制品发布日期未取到(9/24 只是媒体报道日);
  5. 「代码/微调配方」官方称发布,本文未逐一核到;
  6. 绝对水平不高:成功率 42.92% 说明机器人任务本身很难——「榜单第一」不等于「能用」。

:white_check_mark: 已知 vs 待验证

已证实(官方模型页一手):7B 开源权重 WAM 的定位与来源(FLUX 3 多模态主干、预训练偏重视频);RoboLab-120 表格(42.92% 居首、7B、前一名开源为 16B/36.8%);两组加速区间(对 Cosmos 3 Nano FP8 1.52x–3.95x;对 π0.5 1.34x–2.28x,且为实时因子);正文另给的 42.2%±0.36/42.24%/38.3%±0.38/37.92%;SO-101 上 28/30;成本对照($13.47/$0.09/$8.77)与 53.64%;致谢中的合作方(NVIDIA/Hugging Face/LeRobot)与训练硬件(GB200)。

待验证 / 未取到:

  • 制品自身的发布日期——未取到;
  • 「代码/微调配方/可复现示例」是否已实际发布——未逐一核;
  • 第三方独立复现——未见;
  • RoboLab-120 的评测条件与榜单维护方——仅知与 NVIDIA 团队合作。

:compass: 给读者的建议

  • 做具身/机器人的团队:先去读技术报告里的「微调配方」那一节——官方明确说「在机器人领域,微调配方和权重一样重要」,这通常比权重更有迁移价值。
  • 做选型的:不要只看「榜单第一」——① 42.92% 的绝对成功率说明任务很难;② 官方页有四个成功率数值,务必确认你引的是哪一个;③ 确认你的本体(embodiment)是否在它覆盖的范围内(官方演示用的是 SO-101)。
  • 算成本账的:官方那组对照可以直接拿来估——纯推理约 $13.47/次、F3A 单独约 $0.09/次、混合约 $8.77/次(均为官方自测,H200/$3 每小时口径)。
  • 内容写作者:不要把「WAM」写成「世界模型」;不要把加速倍数的两组区间与二手的 1.43 倍混用;引用成功率必须指明是哪个检查点/哪张表;「第一名」须标「官方榜单/厂商自测」。

:link: 来源

官方来源

独立来源

本站相关(背景)

  • topic 170(小米 MiMo-V2.6)、topic 176(Gemini 4 进入后训练)

说明:本条为 9 月 24 日(据媒体报道)发布的此前遗漏条目,制品自身日期未取到。成功率与加速倍数均为官方口径,且官方页自身给出多个数值——本文统一采用表格的 42.92%,并列出其余数值;无第三方复现。配图为官方模型页主图,图注已标来源。