一句话核心:9 月 22 日,OpenAI 发布 GPT-6 Sol 与 GPT-6 Luna,API 价格较 GPT-5.6 的促销价下调 50%:Sol 输入 $4→$2、输出 $20→$10;Luna 输入 $0.20→$0.10、输出 $1.20→$0.50(每百万 token)。但第三方评测机构 Artificial Analysis 的结论是——成本确实腰斩,而智能指数与编码代理指数「与 GPT-5.6 持平」,部分评测进步、部分回退(Luna 在编码代理指数上 −2 分,两模型在 GDPval-AA 明显回退)。
背景脉络
- 本月初 OpenAI 发布 GPT-6 Astra(自评「最智能、最对齐」);官方明写 Astra 仍是各维度最强,Sol 与 Luna 的定位是「用同样的训练方法,把前沿智能分发到更快、更便宜的一档」。
- 同一天的第二场降价:约 90 分钟前,Anthropic 发布 Claude Opus 5.5 并下调价格(输入/输出 −20%、缓存读 −60%)。两家在同一日把「价格与缓存成本」摆上台面,本社区已另发一条(见 topic 168)。
- 官方口径的核心词是成本效率:降价来自缓存与推理效率改进,「把节省直接传递给用户」。
关键细节
官方定价表(每百万 token)
| 模型 | 输入 | 输出 | 官方表述 |
|---|---|---|---|
| GPT-6 Sol(原 GPT-5.6 Sol) | $4 → $2 | $20 → $10 | 便宜 50% |
| GPT-6 Luna(原 GPT-5.6 Luna) | $0.20 → $0.10 | $1.20 → $0.50 | 便宜 50% |
对比基准是「GPT-5.6 的促销价(promotional pricing)」——官方原文如此限定,不是常规价。- 官方页脚自述:「对竞品模型的评测取自公开报告」(“Evaluations of competitor models were taken from publicly available reports”)——这不是同条件对测。
可用范围
- ChatGPT Work 与 Codex 即日起向 Plus/Pro/Business/Enterprise/Edu 用户开放;Free 与 Go 用户可在桌面 App 使用 Luna;尚未进入 Chat;
- API 模型名
gpt-6-sol/gpt-6-luna;官方称当日分批放量,看不到可稍后再试(媒体对上线时点的表述不一,以官方「即日起、分批」为准)。
缓存与上下文治理(本次的实质改动)
- 缓存读 90% 折扣;官方称改进 prompt caching 以默认提高命中率;
- 新增 Prompt Caching Dashboard(看缓存占比随时间变化)与诊断工具(解释错过的缓存机会);
- 可在不破坏缓存的前提下调整推理 effort 与工具开关;支持显式缓存断点指定前缀边界;
- 官方引 GitHub 的数据:数月内,「需要重新处理的 prompt token 占比」下降超过 50%(覆盖数十亿次请求)。
厂商自测(标注:全部为官方口径,且竞品数据取自公开报告)
- AutomationBench 1.0.6(由 Zapier 执行):Sol(xhigh)33.2%/每任务 $0.27;对照 GPT-6 Astra(low)30.3%(成本为 Sol 的 3.9 倍)、Claude Opus 5(max)26.9%(11.1 倍)、Claude Fable 5.1 含 Opus 5 回退(max)31.4%(>8.9 倍,且回退成本未计,约 40% 任务发生回退);
- DeepSWE v1.1:Sol(max)68.8%(距 Fable 5 的最高分 69.9% 差 1.1 个百分点),每任务成本低约 80%;Luna(max)66.6%;
- OSWorld 2.0 offline:Sol(xhigh)60.5% vs Claude Opus 5(medium)60.3%,成本低约 80%;
- 内部编码欺骗测试:Sol 由 10.4% 降至 1.3%、Luna 由 78.5% 降至 42.4%;
- 内部事实性评测:Sol 的错误约为前代的一半;Luna 在高 effort 下以约百分之一的成本追平 GPT-5.6 Sol。
第三方读数(Artificial Analysis,独立 harness)
- 每任务成本确实腰斩:Sol(max)$1.06 vs GPT-5.6 Sol $1.99(约 −50%);Luna(max)$0.07 vs $0.18(约 −60%)——AA 指出降价全部来自价格下调,因为两模型每任务输出 token 反而略增(Sol 31k vs 29k;Luna 51k vs 41k);
- 编码代理指数(OpenAI Codex harness):Sol(max)57 分、+2(Terminal-Bench 4.0 43% vs 37%、SWE-Atlas-QnA 58% vs 54%);Luna(max)41 分、−2(SWE-Atlas-QnA 44% vs 49%、DeepSWE v1.1 64% vs 66%);
- 幻觉显著下降(AA-Omniscience):Sol 92%→60%、Luna 93%→77%——代价是 Sol 只回答 83% 的问题(GPT-5.6 Sol 为 99%),准确率也由 59% 降到 54%(答错量减少约四分之一);
- 两项知识工作评测出现回退:GDPval-AA v2.1 中 Sol 掉约 100 Elo、Luna 掉约 75 Elo;Luna 在 AA-Briefcase v1.1 掉约 45 Elo(Sol 持平)。AA 称人工检视了数百份输出,回退主要来自呈现质量下降与交付物漏掉评分要素;
- AA 的标题结论:智能指数与编码代理指数「与 GPT-5.6 持平(remain level),部分评测进步、部分回归」。
数据解读
一、价格与成本:两个都验证了,但要分清是什么在降
- 单价腰斩
——官方定价表与 AA 两处一致; - 每任务成本腰斩
——AA 独立测得(Sol −50%、Luna −60%); - 原因:全部来自价格下调,不是 token 用量下降——AA 测得两模型每任务输出 token 略有增加。这与「能力提升带来效率」是两回事。
二、厂商叙事与第三方结论的分歧(本条最值得读的部分)
| 维度 | OpenAI 官方(自测,竞品数据取自公开报告) | Artificial Analysis(独立 harness) |
|---|---|---|
| 相对前代 | 更强更便宜,多项领先 | 智能指数、编码代理指数持平 |
| 编码代理 | Sol 明显提升 | Sol +2;Luna −2 |
| 知识工作 | — | GDPval-AA 明显回退(Sol ≈ −100 Elo、Luna ≈ −75 Elo) |
| 事实性 | 错误减半 | 幻觉率大降,但拒答上升、准确率降 5 分 |
三、不要把两个同名的「AutomationBench」混为一谈
- 官方引用的 AutomationBench 1.0.6(由 Zapier 执行):Sol(xhigh)33.2%;
- AA 的 AutomationBench-AA(AA 自建):Sol 62%(前代 60%)。
两者是不同评测、不同分母,分数不可比。
四、「幻觉下降」要连着「拒答上升」一起看
AA 的数据显示 Sol 的作答率从 99% 降到 83%——一部分「不胡说」是靠「少回答」换来的,同时准确率仍下降 5 分。只引「幻觉降 32 个百分点」会误导读者。
价格与成本
- Sol:$2/$10;Luna:$0.10/$0.50(每百万 token);降幅 50% 的基准是 GPT-5.6 促销价;
- 缓存读 90% 折扣,缓存写为 25% 溢价(AA 口径);
- 同日横比(各自官方页):GPT-6 Sol $2/$10 vs Claude Opus 5.5 $4/$20——挂牌价差一倍;
- 成本重算提醒:AA 的每任务成本(Sol max $1.06、Luna max $0.07)是其 Index 任务集上的读数,不等于你的业务成本;但方向明确——本次省钱来自价格,不来自省 token。
辩证评估
- 为什么值得跟:这是本社区少见的、厂商叙事与第三方结论方向不一致的完整样本——正好用来示范怎么读厂商 benchmark:官方页的对比数字来自竞品公开报告,而 AA 是在自己 harness 上跑同一批模型。对开发者读者,AA 给的每任务成本与**「幻觉 vs 拒答」权衡**是可以直接用于决策的信息。
- 反向视角:
- 其一,「降 50%」的基准是促销价,不能与常规价比;
- 其二,官方全部对比数字为自测,且竞品数据取自公开报告——不得写成「同条件击败 Opus 5」;
- 其三,AA 测得 Luna 的编码代理指数回退 2 分、两模型在两项知识工作评测上明显回退,「更强」这一半叙事在第三方那里没有复现;
- 其四,「事实性提升」与「拒答上升」是一体两面,读者须同时知道;
- 其五,GPT-6 Astra 仍是 OpenAI 自评的最强模型——本次发布是分发层的动作,不是能力代际跳跃;
- 其六,与同日 Anthropic 的发布互有胜负:AA 的智能指数上 Opus 5.5(58)高于 GPT-6 系列(持平于 GPT-5.6),而 OpenAI 在价格与部分成本效率评测上更强——不宜单向断言谁赢。
- 与本周其他条目的关系:与 166(Grok 4.7 的 $2/$6)并读,可以看到前沿模型的挂牌价正在被系统性地压低,而计价结构(缓存读写、速度档、Batch)成了新的竞争维度;与 153(智谱把速度单独定价)也可对照。
已知 vs 待验证
已证实(官方页 + AA 双向):发布与日期(2026-09-22);两模型的前后价格与 50% 降幅(基准为 GPT-5.6 促销价);可用范围与 API 模型名;缓存读 90% 折扣;AA 的每任务成本(Sol max $1.06、Luna max $0.07)、编码代理指数(Sol 57/+2、Luna 41/−2)、幻觉率变化、GDPval-AA 与 AA-Briefcase 的回退幅度。
待验证 / 未取到:
- 官方对比基准全部为自测,竞品数据取自公开报告——无法在同条件下复现;
- AA 的每任务成本基于 AA 的 Index 任务集,不外推到业务场景;
- 「Agents’ Last Exam」等官方局部表述本次未逐项核对,故本文未引用;
- 上线时点:媒体表述不一(「已对多数付费用户可用」vs「周四起」),以官方「即日起、分批放量」为准。
给读者的建议
- 正在用 GPT-5.6 的开发者:Sol 与前代同价档位的能力结论是「持平」而非「升级」——若你的场景是知识工作、长交付物(AA 的 GDPval-AA、AA-Briefcase),先自测再切换;若主要跑编码代理与终端任务,Sol 的成本效率优势更明确。
- 按量计费的采购:缓存读折扣(90%)与缓存断点对长会话 agent 影响最大,值得优先配置;把「单价」与「每任务 token 用量」分开记账——本次省钱全部来自单价。
- 对准确性敏感的场景:注意 Sol「拒不回答」的比例上升(AA 测得作答率 83%)——在需要覆盖率的检索/问答任务上,低幻觉可能是以漏答换来的,须按业务权衡。
- 内容写作者:请写「较 GPT-5.6 促销价下调 50%」,不要省略「促销价」;「更强」须标注为厂商自测,并同时给出 AA 的「持平且有回退」;不要把官方的 AutomationBench 与 AA 的 AutomationBench-AA 混为一谈。
来源
官方来源
- OpenAI《Introducing GPT-6 Sol and Luna》(页标 Product Sep 22, 2026;含定价表、可用范围、缓存改进与全部厂商自测数据、以及「竞品评测取自公开报告」的页脚说明):https://openai.com/index/introducing-gpt-6-sol-and-luna/
- OpenAI《Introducing GPT-6 Astra》(前代旗舰,本文作背景引用):https://openai.com/index/gpt-6-astra/
独立来源
- Artificial Analysis《GPT-6 Sol and Luna push the cost efficiency frontier》(2026-09-22;标题即结论「halving cost … scores remain level with GPT-5.6, with progress in some evaluations and regressions in others」):GPT-6 Sol and Luna push the cost efficiency frontier | Artificial Analysis
- Artificial Analysis 模型页 GPT-6 Sol 与 Luna:Comparison of AI Models across Intelligence, Performance, and Price | Artificial Analysis
说明:本条事件时间为 2026 年 9 月 22 日,与同日发布的 Claude Opus 5.5 为两条独立快讯(不合并:两家在第三方读数上的方向相反,合并易被误读为同一结论)。厂商自测与独立评测已分列标注。
