AI 快讯 | Meta 发布 Muse Spark 1.3:更会协作的 agent 模型,编码跃升,开放权重预告

:fire: Meta 9 月 2 日发布 Muse Spark 1.3,在 agentic 与编码任务上全面提升,最大亮点是「更会协作」——主动问澄清、卡住时求助、执行高风险操作前先确认,工具调用减少约 20%、token 减少约 25%。


:key: 核心亮点

  • 长程 agent 协作:可在单个长线程中并行处理多个工作流,主动向用户问澄清问题、被卡住时求助、在执行高风险操作前确认。与 1.2 相比,工具调用减少约 20%、token 消耗减少约 25%。
  • 编码能力追近前沿:官方 benchmark 与 GPT-5.6 Sol(max)、Claude Opus 5(max)对比,总体改善显著;Zuckerberg 称「这是编码方面最大的跃升,性能近乎前沿却便宜到几乎不计成本」。
  • 开放权重预告:Meta 在 X 推文中表示「即将推出更大模型、Muse Spark 开放权重等更多更新」。
  • 定位升级:Axios 评价这是 Meta 在「个人 agent」长期战略中的一步——把 Muse Spark 定位为「可以替你完成工作的 AI」,而非仅仅「回答问题」。

:bar_chart: 官方 Benchmark

维度 Muse Spark 1.3 Muse Spark 1.2 变化
工具调用次数 — — 减少约 20%
Token 消耗 — — 减少约 25%
编码能力 「最大跃升」 — 追近前沿
长程 agent 协作 多工作流并行 单线程 质变

:pushpin: 数据来自 Meta AI Research 官方博客(9/2)、官方 X 推文及 Bloomberg 报道。官方博客包含与 GPT-5.6 Sol(max)和 Claude Opus 5(max)的六维 benchmark 对比图。


:money_bag: 价格

Meta 未公开披露 1.3 的具体 API 定价,模型通过 Meta Model API(dev.meta.ai)和 Muse Code 提供。

:warning: 参考:前代 Muse Spark 1.2 定价 $1.25/$4.25(输入/输出每 M token)。1.3 定价尚未公开,实际成本需自行验证。


:test_tube: 硬核测评结果

:white_check_mark: DeepSWE v1.1:75.4,领先 GPT-5.6 Sol 和 Opus 5

来源:Neowin 独立评测

在 Meta 官方对比图中,Muse Spark 1.3 的 DeepSWE v1.1 得分 75.4,领先 GPT-5.6 Sol 和 Claude Opus 5。对长程编码任务尤其有利——模型更少「忘记」原始需求,主动发现自身计划的漏洞。

:white_check_mark: 长程任务更少跑偏

Neowin 实测指出,在实际工作负载中「浪费更少时间」——更少冗长输出、更少不必要回合。这正是「主动澄清 + 卡住求助」机制的直接效果。

:warning: 短任务优势不明显

工具调用和 token 减少带来的收益在长程 agent 编码中体现最明显;简单问答/短任务下,节省的 token 优势有限。


:bullseye: 选型建议

  • :white_check_mark: 长程 agent 编码任务:需要「主动协作」风格的场景,收益最大
  • :white_check_mark: 工具调用密集任务:比 1.2 省约 20% token 成本
  • :cross_mark: 简单问答/短任务:节省的 token 优势不明显
  • :warning: 定价未公开:实际成本需自行验证

影响评估

Muse Spark 1.3 把「更会协作」作为差异化卖点(主动澄清、卡住求助、确认高风险操作),直击当前 agent 模型「过度自信、不主动沟通」的痛点。工具调用和 token 减少 20-25% 意味着实际成本降低,配合开放权重预告,Meta 在「闭源发布 + 后续开源」的双轨策略上继续推进。

来源