一句话核心: OpenAI 在 2026-09-29 发布 GPT-6.1 Sol,官方定位是「以 Astra 标准输入输出价格五分之一,换来接近 Astra 的智能」;API 三档价(每百万 token)为 输入 $2/缓存输入 $0.10/输出 $10,模型 ID 是 gpt-6.1-sol。官方着重强调的是缓存输入这一档:比标准输入便宜 95%,且比上一代 GPT-6 Sol 的缓存输入价再低 50%。
背景脉络
这条是 DevDay 2026 的发布之一(官方同日 recap 载 20+ 项,本刊另有总览一篇)。读之前要把三件事分开,否则很容易写混:
| 事项 | 时间与状态 |
|---|---|
| GPT-6 Sol 与 Luna | 2026-09-22 发布(本刊 topic 169) |
| GPT-6.1 Astra | 2026-09-28 被决定不发布(本刊 topic 195) |
| GPT-6.1 Sol | 2026-09-29 发布,即本条 |
这里有一条必须守住的界线:本条的 Sol 是 6.1 系列里发出来的那一版;9/28 决定不发布的是 GPT-6.1 Astra。官方从未把 Sol 说成 Astra 的替代品,也没有把两件事建立因果,所以不要写成「Astra 不发了、改发 Sol」。另外要注意:文中出现的「GPT-6 Astra」指的是 2026-09-03 已发布的那一版,与 9/28 那件被扣下的 6.1 不是一回事。
关键细节
1)价格是这条最硬的部分。 官方给出的三模型对照卡可以直接引:GPT-6 Astra 输入 $10/输出 $50/缓存 $1;GPT-6.1 Sol $2/$10/$0.10;GPT-6 Luna $0.10/$0.50/$0.01。官方对缓存输入的表述是「比标准输入价低 95%」,这是它主打「让 agent 复用上下文」的卖点。
2)官方把「接近」这个词用得很克制。 模型页写的定位是 near-Astra intelligence,并在科研那一节明确:GPT-6 Astra 仍是所测模型里的最高分(68.1%),最难的科研任务应当使用它。所以不要写成「等于」或「超过」Astra。
3)可用范围有三处限定。 面向 Plus、Pro、Business、Enterprise、Edu 全部用户,在 ChatGPT Work 与 Codex 提供;「not yet available in Chat」——尚未进入普通 Chat 界面;开发者可经 API 调用。它的 Ultrafast 版本官方写「未来数日」推出(官方称 Codex 中最高 8 倍)。

图 1:GPT-6.1 Sol 官方模型页首屏(可见模型名与「Near-Astra intelligence」主张),我们于 2026-09-29 自取。
官方所载的数据与基准
下表逐项照官方页所载,全部为厂商自测:
| 项目 | 官方所载 |
|---|---|
| 定位 | agentic coding、computer use 与专业工作上接近 GPT-6 Astra |
| API 价(美元/百万 token) | 输入 $2/缓存输入 $0.10/输出 $10 |
| 模型 ID | gpt-6.1-sol |
| DeepSWE v1.1 | 与 GPT-6 Astra 持平、成本约为其五分之一;比 GPT-6 Sol 的最好成绩高 6.4 个百分点,且用更低的推理强度与成本 |
| GDP.pdf | 高于带 fallback 的 Opus 5.5,每任务成本不到其一半;接近 Astra |
| AutomationBench 1.0.6 | 中等推理强度下比 Opus 5.5 高 2.2 个百分点、成本约三分之一;同设置下比 GPT-6 Sol 高 4.8 个百分点 |
| OSWorld 2.0(离线集) | 最高推理强度下比 GPT-6 Sol 高 7 个百分点;距 Astra 差 2.1 个百分点,每任务成本约为其七分之一 |
| Terminal-Bench Science 0.1 | 最高强度下得分是 GPT-6 Sol 的两倍以上;每任务平均 $5.47(对照 Opus 5.5 $23.21、GPT-6 Astra $23.80);最高分仍是 Astra 的 68.1% |
| 事实性 | 低推理强度下含事实错误的回答占比 11.4% → 7.7%(约降 32%) |
| 安全(官方自述) | 相对 GPT-6 Sol 在对齐评测上有实质改进;未观察到试图绕过自动安全审查;未披露搜索工具故障的失败率 2.1%(GPT-6 Sol 4.9%/GPT-6 Astra 1.5%/Luna 28.7%) |
读这组数字必须连带的三句
- 官方自己写明了对照分数的来源。模型页脚注原文:「Evaluations of competitor models were taken from publicly available reports.」——也就是说,Opus 5.5、Fable 5.1 等对照模型的分数不是同条件复测,而是取自公开报告。
- 官方还有一条环境免责:GPT 的评测在其研究环境或经 API 进行,可能因系统提示、可用工具、推理强度等差异,与生产版 ChatGPT 的输出略有不同。
- 官方还自曝了一处对照口径问题:AutomationBench 上 Claude Fable 5.1 的成本数据被低估,因为未计入 fallback 成本,而该模型约 40% 的任务需要 fallback。
价格与使用成本
三档单价照官方抄即可,但有两处别弄错:
- 缓存输入是独立的一档,不是「打过折的输入价」。做长上下文 agent、上下文复用率高的团队,这一档($0.10)通常决定总成本量级,建议在自己的成本表里单独列一行。
- Ultrafast 是另一套定价,官方没有公布它的价格倍数(我们未取到)。所以本文不写「Ultrafast 贵几倍」,也不做「迁移后能省多少」的估算——官方只给了成本-性能图与每任务成本点值,没有给可复算的公式。
辩证评估
正面:它把前沿档的能力价格锚往下压了一档;缓存输入 $0.10 对复用上下文的 agent 任务是最实用的一项;发布页把评测口径、环境差异与一处对照数据问题都写出来了,透明度高于同类发布页的平均水平。
反向至少三条:
- 全部为厂商自测,且对照分数取自公开报告——横向比较的可靠性因此有限。
- 「接近」不是「等于」:官方自己保留了大模型在科研任务上的推荐位(Terminal-Bench Science 最高分仍是 Astra)。
- 这不是这一代的上限:同代更强的 GPT-6.1 Astra 在 9/28 被决定不发布(见 topic 195),读者拿到的不是最高那一档。
已知 vs 待验证
已知(我们已直取官方模型页与 recap 全文):三档 API 价与模型 ID;官方对照卡三个模型的六个数;DeepSWE/GDP.pdf/AutomationBench/OSWorld 2.0/Terminal-Bench Science/事实性/安全各段的官方描述;可用范围(含「尚未进入普通 Chat」);Ultrafast 为「未来数日」推出;两条免责与一处自曝口径问题。
未取到:系统卡附录正文(deploymentsafety.openai.com/gpt-6-1-sol,我们未读);Ultrafast 的官方定价;第三方独立复测(本场仍无)。
第三方口径、官方 recap 未提:$200 Pro 档位用量从 20× Plus 降到 10× 仅见于 BGR 报道与 OpenAI 员工社媒说明——本文不采用。
我们未复现:本文所有分数均来自官方自测,我们没有跑过其中任何一项。
给读者的建议
- 做编码或 computer use agent、上下文复用多:把缓存输入 $0.10 单独建模,这比看输入价 $2 更能反映真实花费。
- 不要把最难的任务也迁过去:官方自己写明最难的科研任务应用 GPT-6 Astra,这一条比任何对比表都直接。
- 做横向对比时:记住对照分数取自公开报告,不同评测环境的分数不要拼成一张榜。
来源链接
官方来源
- GPT-6.1 Sol 官方模型页(2026-09-29 起可用):https://openai.com/index/introducing-gpt-6-1-sol/
- DevDay 2026 官方 recap(页载 September 29, 2026):https://openai.com/index/devday-2026-recap/
- 系统卡附录:https://deploymentsafety.openai.com/gpt-6-1-sol
本刊相关
- topic 169|GPT-6 Sol/Luna(2026-09-22):https://bbs.jimu.chat/t/169
- topic 195|OpenAI 决定不发布 GPT-6.1 Astra:https://bbs.jimu.chat/t/195