一句话核心:Black Forest Labs(FLUX 图像模型的团队)发布 FLUX 3 Action——一个 7B 参数的开源权重「世界动作模型(World Action Model, WAM)」,用于机器人控制。官方称它在 RoboLab-120 榜单上以不到此前最好开源模型一半的参数量创下新的成功率纪录(官方表格口径 42.92%),同时最高快 3.95 倍。这是「生成模型团队转向物理 AI」的一个具体落点。

背景脉络
- BFL 是 FLUX 图像模型的团队;本条是一家做图像/视频生成的实验室,把「预测未来帧」的能力改造成「预测机器人动作」——官方把这一整类能力称为「Visual Intelligence」里的一支:action prediction。
- 与本周已发条目的关系:topic 170(小米 MiMo-V2.6)、**topic 176(Gemini 4 进入后训练)**讲的是模型能力与节奏;本条补的是「模型往哪里去」这条线里最少被写到的一支——具身/机器人。
- 时间:9 月 24 日(据媒体报道);
制品自身的发布日期本次未取到。
关键细节(官方模型页原文)
定位
「We present FLUX 3 Action, an open-weight 7B world-action-model derived from our multimodal FLUX 3 backbone, that was pretrained on a large-scale collection of video, image and audio data — with a strong emphasis on videos.」
能力与输入输出
- 接收相机观测、机器人当前状态与自然语言指令,直接转成物理动作(据媒体报道);
- 官方的表述是「从一系列观测(例如机器人工作站上多路摄像头的视频)预测智能体的下一个动作及其环境状态」。
榜单成绩(官方表格,RoboLab-120)
| 模型 | 是否开源 | 类型 | 成功率 | 参数量 |
|---|---|---|---|---|
| FLUX 3 Action | 开源 | WAM | 42.92% | 7B |
| OASIS | 闭源 | VLM + WAM | 39.0% | — |
| Cosmos3-Nano-Policy | 开源 | WAM | 36.8% | 16B |
| Phoenix | 闭源 | TAMP+FM | 34.4% | — |
| BiMind v0.1 | 闭源 | VLA | 33.3% | — |
| π0.5 | 开源 | VLA | 28.0% | 3.3B |
| DreamZero | 开源 | WAM | 25.7% | 14B |
| Cosmos3-Edge-Policy | 开源 | WAM | 22.9% | 4B |
| π0-FAST | 开源 | VLA | 15.5% | 3B |
| GR00T N1.6 | 开源 | VLA | 7.2% | 3B |
| π0 | 开源 | VLA | 5.0% | 3.3B |
| paligemma-binning | 开源 | VLA | 3.4% | 3B |
(上表为官方 Table 1 的全部 12 行;图注原文:「RoboLab-120 overall success rates. Types and weight availability follow the RoboLab leaderboard.」)
官方原话:「On the RoboLab-120 leaderboard it sets a new state-of-the-art success rate at less than half the parameters of the previous best open model, while running up to 3.95x faster.」
开放范围与一个官方强调
- 权重已发布(Hugging Face
black-forest-labs/flux-3-action-base);官方称同时发布技术报告,覆盖预训练 → 中训练 → 微调 → 推理优化全过程; - 官方特别强调:「In robotics, the fine-tuning recipe is just as important as the weights.」(在机器人领域,微调配方和权重一样重要)——这正是他们连报告一起发的理由。
两个可核的实测细节
- 他们把同一套微调配方用在廉价的 SO-101 机器人上,称策略「30 次尝试完成 28 次」;
- 官方还分析了混合系统:把快速动作预测与前沿推理模型的规划能力结合,称「up to 53.64% more success per dollar」。
合作与硬件(官方致谢原文):与 NVIDIA(Jetson 集成、在 SO-101 上测参数高效微调)、Hugging Face 与 LeRobot 合作;评测基础来自 NVIDIA Isaac Lab 与 RoboLab 团队;模型在 NVIDIA GB200 上训练,自定义 kernel 用 NVIDIA 的 CuTe DSL 编写。
数据解读与口径
一、
官方页自己给出了多个不同的成功率,引用时必须指明是哪一个
同一页面上至少出现五个数值,对应不同检查点与不同精度/GPU:
| 数值 | 官方出处 | 对应对象 |
|---|---|---|
| 42.92% | Table 1(榜单汇总表) | 官方未标注该行对应的检查点与精度(本文标题与表格采用此值) |
| 42.2% ± 0.36 | 正文 | guidance-distilled 检查点 |
| 42.24% | 正文(B200、FP8) | 同上检查点、实时因子 0.048 |
| 38.3% ± 0.38 | 正文 | single step 7B 检查点 |
| 37.92% | 正文 | step-distilled 变体(实时因子 0.015) |
两点必须说清:① Table 1 的图注原文只写「RoboLab-120 overall success rates. Types and weight availability follow the RoboLab leaderboard.」——它并未标注 42.92% 那一行对应哪个检查点与精度,不要自行把它对到 guidance-distilled 上;② 42.92% 与 42.2%/42.24% 不是同一个口径。⇒ 本文统一采用表格的 42.92%,并在此列出其余数值——不要把几个数混用,也不要把某一个说成「唯一的官方数字」。
二、加速倍数是两组区间,而且不是「每次调用延迟」
官方原话有两处,比较对象不同:
- 对 Cosmos 3 Nano(FP8):「1.52x through 3.95x speedup」(跨消费级、工作站与数据中心 GPU);
- 对 π0.5:「1.34x through 2.28x improvement in speed per second of robot motion」(工作站与数据中心 GPU)。
官方还专门注明:这里的速度优势是「实时因子(real-time factor)」,不是每次调用的延迟——因为作为 WAM,它能一次预测 2.13 秒的运动,而 π0.5 是 1.0 秒。
⇒ 本文标题沿用官方概述句的「up to 3.95x faster」;二手媒体出现的「1.43 倍」与官方两组区间都不吻合,不采用。
三、「高 6.1 分」不是官方表述,但可从官方表格算出
官方表格:FLUX 3 Action 42.92% vs Cosmos3-Nano-Policy 36.8%(开源模型中前一名;榜单里 39.0% 的 OASIS 是闭源)⇒ 差值约 6.1 个百分点。这是计算值,不是官方原话。
四、「WAM」是厂商自创的类别名
World Action Model 与通常说的「世界模型(world model)」不是一回事 ⇒ 不要混写。
五、制品核到的范围有限
官方称发布权重与技术报告;权重在 Hugging Face。
BFL 的 GitHub 路径返回 404,且本文未逐一核到「代码/微调配方/可复现示例」是否已实际发布 ⇒ 引用「将发布」时须保留该限定。
六、榜单里开源与闭源混排,参数列并不齐
部分闭源模型未标参数量 ⇒ 做「参数量对比」时必须注明哪些是开源,否则会把「闭源未标参数」误读成「参数很小」。
价格与成本
权重开源、无 API 定价,但官方给出了一组很具体的成本对照(均为官方自测,在 H200/$3 每小时的口径下):
| 方案 | 每次成功成本 | 每次成功耗时 |
|---|---|---|
| 纯推理(GPT-6 Astra 最大推理档) | $13.47 | 约 16 分钟 |
| F3A 单独跑 | $0.09 | 不到 2 分钟 |
| 混合(Astra 把控制权交给 F3A、必要时介入) | $8.77 | 8 分钟 |
- 官方称混合策略仍能解决 90% 的回合(含纯动作策略单独解不了的复杂任务),比最佳替代配置便宜 29%、快 40%;
- 纯推理的代价是每次推理调用要为每秒钟机器人动作多花约 35.77 秒;
- 官方同时给出效率口径「up to 53.64% more success per dollar」。
以上全部是官方自测,无第三方复现;且纯推理档仍达到最高准确率——官方自己写明「可靠性与成本之间的权衡依然存在」。
辩证评估
为什么值得跟:
- 一个做图像生成的团队,用 7B 的开源权重在机器人控制榜单登顶——这说明「视频生成」练出来的表征,可以迁移到「动作预测」;
- 更实际的一点:他们把「微调配方」与「报告」一并公开。对具身智能社区,配方往往比权重更有迁移价值(官方自己也这么说);
- 成本对照很硬:纯推理 $13.47/次 vs F3A 单独 $0.09/次——相差两个数量级,这对「要不要给机器人上大模型」是个直接的算账依据。
反向视角:
- 全部为厂商自测,无第三方复现;
- 榜单为官方自建的 RoboLab-120(与 NVIDIA 团队合作提供评测基础);
- 官方页自身口径不一致(成功率五个数值,见上);
- 制品发布日期未取到(9/24 只是媒体报道日);
- 「代码/微调配方」官方称发布,本文未逐一核到;
- 绝对水平不高:成功率 42.92% 说明机器人任务本身很难——「榜单第一」不等于「能用」。
已知 vs 待验证
已证实(官方模型页一手):7B 开源权重 WAM 的定位与来源(FLUX 3 多模态主干、预训练偏重视频);RoboLab-120 表格(42.92% 居首、7B、前一名开源为 16B/36.8%);两组加速区间(对 Cosmos 3 Nano FP8 1.52x–3.95x;对 π0.5 1.34x–2.28x,且为实时因子);正文另给的 42.2%±0.36/42.24%/38.3%±0.38/37.92%;SO-101 上 28/30;成本对照($13.47/$0.09/$8.77)与 53.64%;致谢中的合作方(NVIDIA/Hugging Face/LeRobot)与训练硬件(GB200)。
待验证 / 未取到:
- 制品自身的发布日期——未取到;
- 「代码/微调配方/可复现示例」是否已实际发布——未逐一核;
- 第三方独立复现——未见;
- RoboLab-120 的评测条件与榜单维护方——仅知与 NVIDIA 团队合作。
给读者的建议
- 做具身/机器人的团队:先去读技术报告里的「微调配方」那一节——官方明确说「在机器人领域,微调配方和权重一样重要」,这通常比权重更有迁移价值。
- 做选型的:不要只看「榜单第一」——① 42.92% 的绝对成功率说明任务很难;② 官方页有四个成功率数值,务必确认你引的是哪一个;③ 确认你的本体(embodiment)是否在它覆盖的范围内(官方演示用的是 SO-101)。
- 算成本账的:官方那组对照可以直接拿来估——纯推理约 $13.47/次、F3A 单独约 $0.09/次、混合约 $8.77/次(均为官方自测,H200/$3 每小时口径)。
- 内容写作者:不要把「WAM」写成「世界模型」;不要把加速倍数的两组区间与二手的 1.43 倍混用;引用成功率必须指明是哪个检查点/哪张表;「第一名」须标「官方榜单/厂商自测」。
来源
官方来源
- Black Forest Labs 官方模型页《FLUX 3 Action: A 7B World Action Model for Robot Control》(September 2026;含 RoboLab-120 表格、两组加速区间、多个成功率数值与成本对照):https://bfl.ai/models/flux-3-action
- 权重仓(Hugging Face):https://huggingface.co/black-forest-labs/flux-3-action-base
独立来源
- VentureBeat:https://venturebeat.com/infrastructure/black-forest-labs-debuts-flux-3-action-an-open-weights-ai-robotics-model-that-tops-the-leaderboard-at-half-the-size-of-its-competition
- MarkTechPost(2026-09-24):https://www.marktechpost.com/2026/09/24/black-forest-labs-releases-flux-3-action-a-7b-open-weights-world-action-model-that-tops-robolab-120/
本站相关(背景)
- topic 170(小米 MiMo-V2.6)、topic 176(Gemini 4 进入后训练)
说明:本条为 9 月 24 日(据媒体报道)发布的此前遗漏条目,制品自身日期未取到。成功率与加速倍数均为官方口径,且官方页自身给出多个数值——本文统一采用表格的 42.92%,并列出其余数值;无第三方复现。配图为官方模型页主图,图注已标来源。