AI 快讯 | OpenAI 发布 GPT-6.1 Sol:输入 $2/缓存 $0.10/输出 $10,以五分之一价格接近 Astra

:fire: 一句话核心: OpenAI 在 2026-09-29 发布 GPT-6.1 Sol,官方定位是「以 Astra 标准输入输出价格五分之一,换来接近 Astra 的智能」;API 三档价(每百万 token)为 输入 $2/缓存输入 $0.10/输出 $10,模型 ID 是 gpt-6.1-sol。官方着重强调的是缓存输入这一档:比标准输入便宜 95%,且比上一代 GPT-6 Sol 的缓存输入价再低 50%。

背景脉络

这条是 DevDay 2026 的发布之一(官方同日 recap 载 20+ 项,本刊另有总览一篇)。读之前要把三件事分开,否则很容易写混:

事项 时间与状态
GPT-6 Sol 与 Luna 2026-09-22 发布(本刊 topic 169)
GPT-6.1 Astra 2026-09-28 被决定不发布(本刊 topic 195)
GPT-6.1 Sol 2026-09-29 发布,即本条

这里有一条必须守住的界线:本条的 Sol 是 6.1 系列里发出来的那一版;9/28 决定不发布的是 GPT-6.1 Astra。官方从未把 Sol 说成 Astra 的替代品,也没有把两件事建立因果,所以不要写成「Astra 不发了、改发 Sol」。另外要注意:文中出现的「GPT-6 Astra」指的是 2026-09-03 已发布的那一版,与 9/28 那件被扣下的 6.1 不是一回事。

关键细节

1)价格是这条最硬的部分。 官方给出的三模型对照卡可以直接引:GPT-6 Astra 输入 $10/输出 $50/缓存 $1;GPT-6.1 Sol $2/$10/$0.10;GPT-6 Luna $0.10/$0.50/$0.01。官方对缓存输入的表述是「比标准输入价低 95%」,这是它主打「让 agent 复用上下文」的卖点。

2)官方把「接近」这个词用得很克制。 模型页写的定位是 near-Astra intelligence,并在科研那一节明确:GPT-6 Astra 仍是所测模型里的最高分(68.1%),最难的科研任务应当使用它。所以不要写成「等于」或「超过」Astra。

3)可用范围有三处限定。 面向 Plus、Pro、Business、Enterprise、Edu 全部用户,在 ChatGPT Work 与 Codex 提供;「not yet available in Chat」——尚未进入普通 Chat 界面;开发者可经 API 调用。它的 Ultrafast 版本官方写「未来数日」推出(官方称 Codex 中最高 8 倍)。

图 1

图 1:GPT-6.1 Sol 官方模型页首屏(可见模型名与「Near-Astra intelligence」主张),我们于 2026-09-29 自取。

官方所载的数据与基准

下表逐项照官方页所载,全部为厂商自测:

项目 官方所载
定位 agentic coding、computer use 与专业工作上接近 GPT-6 Astra
API 价(美元/百万 token) 输入 $2/缓存输入 $0.10/输出 $10
模型 ID gpt-6.1-sol
DeepSWE v1.1 与 GPT-6 Astra 持平、成本约为其五分之一;比 GPT-6 Sol 的最好成绩高 6.4 个百分点,且用更低的推理强度与成本
GDP.pdf 高于带 fallback 的 Opus 5.5,每任务成本不到其一半;接近 Astra
AutomationBench 1.0.6 中等推理强度下比 Opus 5.5 高 2.2 个百分点、成本约三分之一;同设置下比 GPT-6 Sol 高 4.8 个百分点
OSWorld 2.0(离线集) 最高推理强度下比 GPT-6 Sol 高 7 个百分点;距 Astra 差 2.1 个百分点,每任务成本约为其七分之一
Terminal-Bench Science 0.1 最高强度下得分是 GPT-6 Sol 的两倍以上;每任务平均 $5.47(对照 Opus 5.5 $23.21、GPT-6 Astra $23.80);最高分仍是 Astra 的 68.1%
事实性 低推理强度下含事实错误的回答占比 11.4% → 7.7%(约降 32%)
安全(官方自述) 相对 GPT-6 Sol 在对齐评测上有实质改进;未观察到试图绕过自动安全审查;未披露搜索工具故障的失败率 2.1%(GPT-6 Sol 4.9%/GPT-6 Astra 1.5%/Luna 28.7%)

读这组数字必须连带的三句

  1. 官方自己写明了对照分数的来源。模型页脚注原文:「Evaluations of competitor models were taken from publicly available reports.」——也就是说,Opus 5.5、Fable 5.1 等对照模型的分数不是同条件复测,而是取自公开报告。
  2. 官方还有一条环境免责:GPT 的评测在其研究环境或经 API 进行,可能因系统提示、可用工具、推理强度等差异,与生产版 ChatGPT 的输出略有不同。
  3. 官方还自曝了一处对照口径问题:AutomationBench 上 Claude Fable 5.1 的成本数据被低估,因为未计入 fallback 成本,而该模型约 40% 的任务需要 fallback。

价格与使用成本

三档单价照官方抄即可,但有两处别弄错:

  • 缓存输入是独立的一档,不是「打过折的输入价」。做长上下文 agent、上下文复用率高的团队,这一档($0.10)通常决定总成本量级,建议在自己的成本表里单独列一行。
  • Ultrafast 是另一套定价,官方没有公布它的价格倍数(我们未取到)。所以本文不写「Ultrafast 贵几倍」,也不做「迁移后能省多少」的估算——官方只给了成本-性能图与每任务成本点值,没有给可复算的公式。

辩证评估

正面:它把前沿档的能力价格锚往下压了一档;缓存输入 $0.10 对复用上下文的 agent 任务是最实用的一项;发布页把评测口径、环境差异与一处对照数据问题都写出来了,透明度高于同类发布页的平均水平。

反向至少三条:

  1. 全部为厂商自测,且对照分数取自公开报告——横向比较的可靠性因此有限。
  2. 「接近」不是「等于」:官方自己保留了大模型在科研任务上的推荐位(Terminal-Bench Science 最高分仍是 Astra)。
  3. 这不是这一代的上限:同代更强的 GPT-6.1 Astra 在 9/28 被决定不发布(见 topic 195),读者拿到的不是最高那一档。

已知 vs 待验证

已知(我们已直取官方模型页与 recap 全文):三档 API 价与模型 ID;官方对照卡三个模型的六个数;DeepSWE/GDP.pdf/AutomationBench/OSWorld 2.0/Terminal-Bench Science/事实性/安全各段的官方描述;可用范围(含「尚未进入普通 Chat」);Ultrafast 为「未来数日」推出;两条免责与一处自曝口径问题。

未取到:系统卡附录正文(deploymentsafety.openai.com/gpt-6-1-sol,我们未读);Ultrafast 的官方定价;第三方独立复测(本场仍无)。

第三方口径、官方 recap 未提:$200 Pro 档位用量从 20× Plus 降到 10× 仅见于 BGR 报道与 OpenAI 员工社媒说明——本文不采用。

我们未复现:本文所有分数均来自官方自测,我们没有跑过其中任何一项。

给读者的建议

  • 做编码或 computer use agent、上下文复用多:把缓存输入 $0.10 单独建模,这比看输入价 $2 更能反映真实花费。
  • 不要把最难的任务也迁过去:官方自己写明最难的科研任务应用 GPT-6 Astra,这一条比任何对比表都直接。
  • 做横向对比时:记住对照分数取自公开报告,不同评测环境的分数不要拼成一张榜。

来源链接

官方来源

本刊相关