Meta 9 月 2 日发布 Muse Spark 1.3,在 agentic 与编码任务上全面提升,最大亮点是「更会协作」——主动问澄清、卡住时求助、执行高风险操作前先确认,工具调用减少约 20%、token 减少约 25%。
核心亮点
- 长程 agent 协作:可在单个长线程中并行处理多个工作流,主动向用户问澄清问题、被卡住时求助、在执行高风险操作前确认。与 1.2 相比,工具调用减少约 20%、token 消耗减少约 25%。
- 编码能力追近前沿:官方 benchmark 与 GPT-5.6 Sol(max)、Claude Opus 5(max)对比,总体改善显著;Zuckerberg 称「这是编码方面最大的跃升,性能近乎前沿却便宜到几乎不计成本」。
- 开放权重预告:Meta 在 X 推文中表示「即将推出更大模型、Muse Spark 开放权重等更多更新」。
- 定位升级:Axios 评价这是 Meta 在「个人 agent」长期战略中的一步——把 Muse Spark 定位为「可以替你完成工作的 AI」,而非仅仅「回答问题」。
官方 Benchmark
| 维度 | Muse Spark 1.3 | Muse Spark 1.2 | 变化 |
|---|---|---|---|
| 工具调用次数 | — | — | 减少约 20% |
| Token 消耗 | — | — | 减少约 25% |
| 编码能力 | 「最大跃升」 | — | 追近前沿 |
| 长程 agent 协作 | 多工作流并行 | 单线程 | 质变 |
数据来自 Meta AI Research 官方博客(9/2)、官方 X 推文及 Bloomberg 报道。官方博客包含与 GPT-5.6 Sol(max)和 Claude Opus 5(max)的六维 benchmark 对比图。
价格
Meta 未公开披露 1.3 的具体 API 定价,模型通过 Meta Model API(dev.meta.ai)和 Muse Code 提供。
参考:前代 Muse Spark 1.2 定价 $1.25/$4.25(输入/输出每 M token)。1.3 定价尚未公开,实际成本需自行验证。
硬核测评结果
DeepSWE v1.1:75.4,领先 GPT-5.6 Sol 和 Opus 5
来源:Neowin 独立评测
在 Meta 官方对比图中,Muse Spark 1.3 的 DeepSWE v1.1 得分 75.4,领先 GPT-5.6 Sol 和 Claude Opus 5。对长程编码任务尤其有利——模型更少「忘记」原始需求,主动发现自身计划的漏洞。
长程任务更少跑偏
Neowin 实测指出,在实际工作负载中「浪费更少时间」——更少冗长输出、更少不必要回合。这正是「主动澄清 + 卡住求助」机制的直接效果。
短任务优势不明显
工具调用和 token 减少带来的收益在长程 agent 编码中体现最明显;简单问答/短任务下,节省的 token 优势有限。
选型建议
长程 agent 编码任务:需要「主动协作」风格的场景,收益最大
工具调用密集任务:比 1.2 省约 20% token 成本
简单问答/短任务:节省的 token 优势不明显
定价未公开:实际成本需自行验证
影响评估
Muse Spark 1.3 把「更会协作」作为差异化卖点(主动澄清、卡住求助、确认高风险操作),直击当前 agent 模型「过度自信、不主动沟通」的痛点。工具调用和 token 减少 20-25% 意味着实际成本降低,配合开放权重预告,Meta 在「闭源发布 + 后续开源」的双轨策略上继续推进。
来源
- 官方博客:https://research.meta.ai/blog/introducing-muse-spark-1-3
- 官方 X 推文:https://x.com/AIatMeta/status/2095234385129963666
- Zuckerberg Threads:https://www.threads.com/@zuck/post/Dcy_A8pGo-m
- Bloomberg 报道:https://www.bloomberg.com/news/articles/2026-09-02/meta-releases-more-powerful-ai-model-edging-closer-to-rivals
- Neowin 独立评测:https://www.neowin.net/news/meta-rolls-out-muse-spark-13-with-stronger-coding-and-agentic-performance/
- Axios 报道:https://www.axios.com/2026/09/02/meta-debuts-muse-spark-13-as-personal-agent-work-continues
