AI 快讯 | OpenAI 发布 GPT-6 Astra:Terminal-Bench 58.2%,两项基准直接饱和,Agent 新范式

:fire: OpenAI 9 月 3 日发布 GPT-6 Astra(代号 Astra),声称「世界最智能、最对齐的模型」:Terminal-Bench 4.0 达 58.2%(Fable 5.1 57.9%、GPT-5.6 Sol 37.3%),FrontierMath Tier 4 饱和 98%,ARC-AGI-3 饱和 99.9%,ExploitBench 100% 饱和。

背景脉络

GPT-6 Astra 是 OpenAI 自 2025 年 GPT-5 系列以来的首次大版本换代。就在发布前两天(9/1),OpenAI 主动披露了 Astra 的内部安全评估,坦诚其是首个达到「Critical 网络安全能力阈值」的模型——可自主发现未知漏洞、跨多系统无需人工指导。这份安全坦诚加上随后的正式发布,标志着 OpenAI 在「能力」与「安全」之间踩出了一条新路。分阶段推出(Daybreak 先行 → ChatGPT Plus/Pro/API 随后),意味着普通用户还需要等几天才能上手。

:key: 核心亮点

  • 科学推理与数学全面领先,编码微弱领先:Terminal-Bench 4.0 58.2%(Fable 5.1 57.9%、GPT-5.6 Sol 37.3%),Terminal-Bench Science 0.1 64.6%,ExploitBench 100% 饱和。
  • 两项基准直接饱和:FrontierMath Tier 4 98%、ARC-AGI-3 99.9%,意味着这两个测试已无法区分 Astra 与更高能力——「基准测试不够用」的时代来了。
  • Computer Use 与 Browsing 首次成为宣传核心:Agent 全面取代纯聊天成为新范式。
  • 安全对齐双突破:首个 Critical 级网安能力公开模型,经强化保护后发布,同时称其为「最对齐的模型」。

:bar_chart: 官方 Benchmark

基准 GPT-6 Astra GPT-5.6 Sol Claude Fable 5.1
Terminal-Bench 4.0(编码) 58.2% 37.3% 57.9%
Terminal-Bench Science 0.1 64.6% — —
FrontierMath Tier 4(数学) 98%(饱和) — —
ARC-AGI-3(推理) 99.9%(饱和) — —
ExploitBench(网络安全) 100%(饱和) — —

:pushpin: 数据来自 OpenAI 官方博客(9/3)。部分测试使用 Daybreak 较高权限访问能力,非默认产品版本。第三方独立评测尚待跟进。

:money_bag: 价格

模式 输入 /M token 输出 /M token 备注
标准(short context) $10 $50 与 Fable 5.1 标价相同
Fast 模式 $5 $25 低 effort 档
Daybreak 模式 $20 $100 高 effort 档
Long context $20 $75 长上下文

:pushpin: 数据来自 OpenAI 官方定价页(developers.openai.com)。Astra 标价与 Fable 5.1 完全一致($10/$50),但 OpenAI 提供更多分层档位。ChatGPT 套餐内可用(Plus/Pro/Business/Enterprise),API 和 AWS 已开放。

:balance_scale: 辩证评估

机会:Astra 在编码(Terminal-Bench 与 Fable 5.1 差距仅 0.3pt(误差区间重叠))、科学推理、数学和推理基准上全面领先,对 Fable 5.1 仅微弱领先(0.3pt,误差区间重叠)——真正的领先在科学推理和数学基准。Computer Use 和 Browsing 能力首次成为发布核心,Agent 范式进一步确立。

反向视角:Astra 与 Fable 5.1 标价相同($10/$50),但独立 benchmark 显示编码仅微弱领先(0.3pt,误差重叠)。两项基准已饱和,意味着 Astra 在这些维度的真正能力上限已无法测量。分阶段推出意味着普通用户短期内无法直接体验和评测。

:microscope: 已知 vs 待验证

已知:

  • 官方 benchmark 数据(OpenAI 博客,一手)
  • Critical 级网安能力(OpenAI 安全评估,9/1)
  • 分阶段推出路径(Daybreak → Plus/Pro/API)

待验证:

  • 第三方独立评测(尚无)
  • 实际 API 定价与上下文窗口
  • 默认产品版本(非 Daybreak)的实际性能
  • 与 Fable 5.1 同任务横向对比

:bullseye: 选型建议

  • :white_check_mark: 编码/科学推理/数学任务:Astra 全面领先,值得优先尝试
  • :warning: 成本敏感场景:标价相同,选型取决于实际 workload 的 token 消耗和 cache 命中率
  • :cross_mark: 急需上手的个人用户:分阶段推出,目前 Daybreak 仅限有限组织

来源

官方来源:

独立来源: