Anthropic 9 月 1 日发布 Claude Fable 5.1(同源 Mythos 5.1):官方称其为全球最强的编码与知识工作模型,编码 agent、科研、长时无人值守任务全面领先,典型负载成本较上一代 Fable 5 降约 25%。
这是 Anthropic 第一次把「前两代旗舰同堂」——Fable 5.1(通用可用、带防护)与 Mythos 5.1(仅限可信访问、面向网络安全与生命科学)是同一个底层模型,差别只在安全防护强度。而最让人意外的,是它的科研能力:用 NASA 麦哲伦雷达数据训出金星全球新高程图、高亲和蛋白设计通过实验室验证、自研 GPU kernel 提速 2.5 倍。
关键细节
- 性能全线领先:官方 benchmark 全面超越 Fable 5、Opus 5、GPT-5.6 Sol——Terminal-Bench 4.0 达 55.8%(Mythos 版本 60.9%)、CursorBench 73.4%、HLE(用工具)65.0%。
- 成本与隐私双改进:cache read 降价使典型负载较 Fable 5 省约 25%、高 agentic 场景省约 45%;推出 Enterprise Frontier Safeguards(EFS)提供类零数据留存的企业隐私。
- 长时无人值守:能连续 38 小时无人值守跑 ML 任务、自动根因定位,把「多步 agentic」推向新台阶。
Benchmark 对比
| 基准 | Fable 5.1 | Fable 5 | Opus 5 | GPT-5.6 Sol |
|---|---|---|---|---|
| Terminal-Bench 4.0(编码 agent) | 55.8% | 42.0% | 52.3% | 37.3% |
| Terminal-Bench-Science 0.1 | 52.6% | 24.7% | 29.0% | 22.4% |
| CursorBench 3.2.0 | 73.4% | 70.5% | 70.0% | 67.2% |
| HLE(用工具) | 65.0% | 63.8% | 63.6% | — |
| GDPval-AA v2 | 1853 | 1723 | 1824 | 1711 |
| OSWorld 2.0(strict) | 41.7% | 36.1% | 39.6% | — |
| AutomationBench | 31.4% | 17.1% | 26.9% | 19.6% |
(加粗为该行最佳;数据来自官方公告,Mythos 5.1 关闭防护版 Terminal-Bench 达 60.9% 单独标注)
价格对比
| 模型 | 输入 /M token | 输出 /M token |
|---|---|---|
| Fable 5.1 | $10 | $50 |
| Opus 5(前代旗舰) | $5 | $25 |
| Sonnet 5(均衡款) | $2 | $10 |
Fable 5.1 标价 $10/$50 属旗舰价位,但 cache read 降价后典型负载较 Fable 5 省约 25%、高 agentic 场景省约 45%,实际成本明显下探。
影响评估
Fable 5.1 把「长时、无人值守、多步 agentic」能力推到新台阶,并用前瞻科研能力(金星地形图、蛋白设计 lab 验证、GPU kernel 提速 2.5x)展示模型对科学进展的直接贡献。价格侧 cache 降价 + EFS 隐私机制,直击企业采用的两大痛点。Anthropic 在编码/科研赛道对 OpenAI(GPT-5.6 Sol)形成明显压制。
