xAI 发布 Grok 4.6:专注长程 Agent 与视觉交互,AA 智能指数 61 追平 GPT-5.6 Sol,价格仅对手零头!
2026 年 8 月 12 日,SpaceXAI 正式发布 Grok 4.6——距离 Grok 4.5(7 月发布)仅一个月,这一次不再是"纯智能跃升"的叙事,而是专为长程 Agent 任务、跨代码库工作、以及更具野心的视觉与交互项目打造。官方定位明确:这不是一个参数更大的模型,而是一个训练配方更强的模型。
一句话核心
Grok 4.6 是 SpaceXAI 的旗舰推理模型——在 Artificial Analysis Intelligence Index 上拿到 61 分(与 GPT-5.6 Sol 打平、仅次于 Claude Fable 5 的 62 分),专注长程 Agent、复杂编码与视觉交互项目,API 定价 $2/$6 每百万 token,并有 2 倍速的 Fast 变体。
训练与参数
官方口径:训练配方而非模型规模
Grok 4.6 官方公告没有披露参数规模。社区报告存在分歧:一说沿用 Grok 4.5 的 1.5T V9 基础模型(大幅后训练),另一说为更大的 2T 模型。xAI 的叙事核心是"这次发布在训练配方,不在模型大小"。
训练三阶段
| 阶段 | 内容 |
|---|---|
| 补充训练 | 比 4.5 更长的补充训练,含精选的模型生成数据(推理 + 高级技术概念)、高质量工程数据、改进的优化器与训练配方 |
| SFT 阶段 | 用 Grok 4.5 自身重新生成 SFT 轨迹,覆盖不同推理强度、Agent harness、STEM/软件工程/知识工作等领域;用基于模型的检查过滤问题轨迹 |
| RL 阶段 | 覆盖广泛的 Agentic 任务:通用编码、知识工作,以及内核优化、Web 开发、计算机辅助设计(CAD)等领域专属环境 |
能力支持
| 规格项 | 参数 |
|---|---|
| 上下文窗口 | 500K tokens(API);256K(Cursor 内) |
| 输入/输出 | 文本 + 图像输入;文本输出 |
| 推理强度 | Low / Medium / High(默认)/ XHigh |
| 知识截止 | 2026-02-01 |
| 工具 | 函数调用、网页搜索、X 搜索、代码执行、集合搜索(RAG)、远程 MCP |
| 标准定价 | $2 / 百万输入,$6 / 百万输出 |
| Fast 变体 | 价格 2 倍($4 / $12) |
Benchmark 表现(来源:SpaceXAI 官方博客)
核心对比表
| 评测集 | Grok 4.6 (High) | Grok 4.5 (High) | GPT-5.6 Sol (Max) | Claude Fable 5 (Max) |
|---|---|---|---|---|
| AA Intelligence Index | 61 | 56 | 61 | 62 |
| GDPVal-AA v2 | 1753 | 1526 | 1728 | 1741 |
| CursorBench v3.2 | 69.9% | 66.7% | 67.2% | 70.5% |
| DeepSWE v1.1 | 65.9% | 54% | 73% | 70% |
| FrontierCode v1.1 (Extended) | 61.3% | 56.6% | 60.6% | 63.6% |
| APEX-Agents | 57.5% | 47.1% | 56.7% | 59.2% |
| Terminal-Bench v3.0 | 26% | 15.7% | 34.6% | 34.1% |
| APEX-SWE | 56.4% | 53.6% | — | 58.8% |
| AA-Briefcase | 1577 | 1313 | 1502 | 1574 |
| Harvey LAB (Vals) | 15.8% | 12.9% | 2.5% | 11.3% |
官方数据要点
AA Intelligence Index = 61,与 GPT-5.6 Sol 打平(官方柱状图:Fable 5 Max 62 / Grok 4.6 61 / GPT-5.6 Sol Max 61 / Grok 4.5 High 56)。
AA-Briefcase 1577(仅次 Opus 5 的 1574→实为领先),GDPVal-AA 1753(超过 GPT-5.6 Sol 1728 与 Fable 5 1741)——知识工作与代理执行是 Grok 4.6 的最强项。
Harvey LAB 15.8%(法律专业评测)大幅领先 GPT-5.6 Sol 的 2.5%,是 Grok 4.6 的惊喜表现。
独立验证(Artificial Analysis 数据)
| 模型 | AA Intelligence Index | 每个任务成本 |
|---|---|---|
| Grok 4.6 (High) | 61 | $0.84 |
| Grok 4.6 (XHigh) | 60 | $1.04 |
| Grok 4.6 (Medium) | 59 | $0.67 |
| Grok 4.6 (Low) | 52 | — |
| Grok 4.5 (High) | 56 | $0.36 |
独立数据交叉验证:Grok 4.6 每完成一个指数任务成本约 $0.84,对比 GPT-5.6 Sol 的 $1.23、Claude Opus 5 的 $2.34——接近同级智能下最便宜的选择之一。
硬核实测亮点(来源:官方 + 社区)
1. 长程 Agent 能力:从想法到可运行应用
xAI 官方强调 Grok 4.6 在"把宽泛产品想法变成可用初版"上尤其强:能研究陌生领域、搭建应用结构、实现核心交互、通过多轮反馈持续打磨。更长的轨迹上开始出现自我测试与验证——在继续前检查自己的工作。
2. 视觉与交互项目:一次成形
Grok 4.6 在视觉和交互项目上的初版质量显著优于 Grok 4.5。给定一个具体产品想法,它能一次建立应用的结构和视觉语言。
3. 安全与能力校准
官方表示 Grok 4.6 的安全保障已按模型能力提升而校准,部署前测试套件是史上最广的一批(含能力 + 安全校准 + 广泛部署后与第三方测试)。在漏洞修补、加速工程设计周期、增强 AI 研究等合法场景中保持有用与安全。
价格详情
API 定价
| 项目 | 价格 |
|---|---|
| 标准输入 | $2 / 百万 token |
| 标准输出 | $6 / 百万 token |
| Fast 变体 | 2 倍价格($4 / $12) |
| Grok Build / Cursor 首周 | 2 倍赠送用量 |
成本竞争力(AA 独立数据)
| 模型 | 智能指数 | 每任务成本 |
|---|---|---|
| Grok 4.6 | 61 | $0.84 |
| GPT-5.6 Sol | 61 | $1.23 |
| Claude Opus 5 | 62 | $2.34 |
与 GLM-5.3-Flash(折扣后 $0.045/任务)相比,Grok 4.6 单任务成本约高 18 倍,但智能指数高 4 分——两者定位不同:Grok 4.6 面向高上限长程任务,GLM-Flash 面向极致性价比。
与竞品对比
同级旗舰横向对比
| 维度 | Grok 4.6 | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| AA Intelligence Index | 61 | 61 | 62 |
| 上下文 | 500K | — | — |
| 输入价格 | $2/M | 更高 | 更高 |
| 输出价格 | $6/M | 更高 | 更高 |
| 主打 | 长程 Agent + 视觉交互 | 通用前沿 | 通用前沿 |
| 发布方 | SpaceXAI | OpenAI | Anthropic |
与 Grok 4.5 的代际提升
| 评测集 | Grok 4.5 | Grok 4.6 | 变化 |
|---|---|---|---|
| AA Intelligence Index | 56 | 61 | +5 |
| GDPVal-AA v2 | 1526 | 1753 | +227 |
| DeepSWE v1.1 | 54% | 65.9% | +11.9pp |
| CursorBench v3.2 | 66.7% | 69.9% | +3.2pp |
| APEX-Agents | 47.1% | 57.5% | +10.4pp |
| AA-Briefcase | 1313 | 1577 | +264 |
一个月内的代际提升集中在长程 Agent 与知识工作:GDPVal +227、AA-Briefcase +264、DeepSWE +11.9pp——正是 Grok 4.6 主打的赛道。
注意事项
- 发布页 vs 独立数据有微妙差异:官方称 AA Intelligence Index 61,独立数据交叉验证为 61(High);但 DeepSWE 官方 65.9% vs 独立 66.1%(Grok 4.5 口径)需注意设置差异
- 高推理强度下成本上升:XHigh 每任务成本 $1.04,比 High 高约 24%;低推理(Low)智能降至 52
- 首字延迟略高于 4.5:换更高分数的代价
- 上下文上限因渠道而异:API 500K,但 Cursor 内仅 256K
- 知识截止 2026-02-01:超过该日期的新信息需依赖联网工具
- 参数规模未披露:官方未公布总参/激活参数
总结
Grok 4.6 不是一次"更大模型"的发布,而是一次"更会干活"的发布——把 Grok 4.5 的 SFT 与 RL 配方全面重做,聚焦长程 Agent、跨代码库工作与视觉交互。结果是在 AA Intelligence Index 上与 GPT-5.6 Sol 打平(61),在 AA-Briefcase、GDPVal 等知识工作基准上甚至领先,而价格只有竞品零头,还带 2 倍速 Fast 变体。
适合场景:
- 长程研究 / 跨代码库 Agent 任务
- 从产品想法到可运行应用的快速原型
- 视觉与交互项目(网站、应用 UI)
- 预算敏感但需要前沿智能的 Agent 构建者
官方资料
- 官方博客:x.ai/news/grok-4-6
- API 文档:docs.x.ai
- 独立评测:Artificial Analysis - SpaceXAI
- 免费体验:x.ai/build
