AI 快讯 | xAI 发布 Grok 4.6:AA 智能指数 61 追平 GPT-5.6 Sol,专注长程 Agent 与视觉交互

:fire: xAI 发布 Grok 4.6:专注长程 Agent 与视觉交互,AA 智能指数 61 追平 GPT-5.6 Sol,价格仅对手零头!

2026 年 8 月 12 日,SpaceXAI 正式发布 Grok 4.6——距离 Grok 4.5(7 月发布)仅一个月,这一次不再是"纯智能跃升"的叙事,而是专为长程 Agent 任务、跨代码库工作、以及更具野心的视觉与交互项目打造。官方定位明确:这不是一个参数更大的模型,而是一个训练配方更强的模型。


:key: 一句话核心

Grok 4.6 是 SpaceXAI 的旗舰推理模型——在 Artificial Analysis Intelligence Index 上拿到 61 分(与 GPT-5.6 Sol 打平、仅次于 Claude Fable 5 的 62 分),专注长程 Agent、复杂编码与视觉交互项目,API 定价 $2/$6 每百万 token,并有 2 倍速的 Fast 变体。


:building_construction: 训练与参数

官方口径:训练配方而非模型规模

Grok 4.6 官方公告没有披露参数规模。社区报告存在分歧:一说沿用 Grok 4.5 的 1.5T V9 基础模型(大幅后训练),另一说为更大的 2T 模型。xAI 的叙事核心是"这次发布在训练配方,不在模型大小"。

训练三阶段

阶段 内容
补充训练 比 4.5 更长的补充训练,含精选的模型生成数据(推理 + 高级技术概念)、高质量工程数据、改进的优化器与训练配方
SFT 阶段 Grok 4.5 自身重新生成 SFT 轨迹,覆盖不同推理强度、Agent harness、STEM/软件工程/知识工作等领域;用基于模型的检查过滤问题轨迹
RL 阶段 覆盖广泛的 Agentic 任务:通用编码、知识工作,以及内核优化、Web 开发、计算机辅助设计(CAD)等领域专属环境

能力支持

规格项 参数
上下文窗口 500K tokens(API);256K(Cursor 内)
输入/输出 文本 + 图像输入;文本输出
推理强度 Low / Medium / High(默认)/ XHigh
知识截止 2026-02-01
工具 函数调用、网页搜索、X 搜索、代码执行、集合搜索(RAG)、远程 MCP
标准定价 $2 / 百万输入,$6 / 百万输出
Fast 变体 价格 2 倍($4 / $12)

:bar_chart: Benchmark 表现(来源:SpaceXAI 官方博客)

核心对比表

评测集 Grok 4.6 (High) Grok 4.5 (High) GPT-5.6 Sol (Max) Claude Fable 5 (Max)
AA Intelligence Index 61 56 61 62
GDPVal-AA v2 1753 1526 1728 1741
CursorBench v3.2 69.9% 66.7% 67.2% 70.5%
DeepSWE v1.1 65.9% 54% 73% 70%
FrontierCode v1.1 (Extended) 61.3% 56.6% 60.6% 63.6%
APEX-Agents 57.5% 47.1% 56.7% 59.2%
Terminal-Bench v3.0 26% 15.7% 34.6% 34.1%
APEX-SWE 56.4% 53.6% 58.8%
AA-Briefcase 1577 1313 1502 1574
Harvey LAB (Vals) 15.8% 12.9% 2.5% 11.3%

官方数据要点

:pushpin: AA Intelligence Index = 61,与 GPT-5.6 Sol 打平(官方柱状图:Fable 5 Max 62 / Grok 4.6 61 / GPT-5.6 Sol Max 61 / Grok 4.5 High 56)。

:pushpin: AA-Briefcase 1577(仅次 Opus 5 的 1574→实为领先),GDPVal-AA 1753(超过 GPT-5.6 Sol 1728 与 Fable 5 1741)——知识工作与代理执行是 Grok 4.6 的最强项。

:pushpin: Harvey LAB 15.8%(法律专业评测)大幅领先 GPT-5.6 Sol 的 2.5%,是 Grok 4.6 的惊喜表现。

独立验证(Artificial Analysis 数据)

模型 AA Intelligence Index 每个任务成本
Grok 4.6 (High) 61 $0.84
Grok 4.6 (XHigh) 60 $1.04
Grok 4.6 (Medium) 59 $0.67
Grok 4.6 (Low) 52
Grok 4.5 (High) 56 $0.36

:pushpin: 独立数据交叉验证:Grok 4.6 每完成一个指数任务成本约 $0.84,对比 GPT-5.6 Sol 的 $1.23、Claude Opus 5 的 $2.34——接近同级智能下最便宜的选择之一


:test_tube: 硬核实测亮点(来源:官方 + 社区)

1. 长程 Agent 能力:从想法到可运行应用

xAI 官方强调 Grok 4.6 在"把宽泛产品想法变成可用初版"上尤其强:能研究陌生领域、搭建应用结构、实现核心交互、通过多轮反馈持续打磨。更长的轨迹上开始出现自我测试与验证——在继续前检查自己的工作。

2. 视觉与交互项目:一次成形

Grok 4.6 在视觉和交互项目上的初版质量显著优于 Grok 4.5。给定一个具体产品想法,它能一次建立应用的结构和视觉语言。

3. 安全与能力校准

官方表示 Grok 4.6 的安全保障已按模型能力提升而校准,部署前测试套件是史上最广的一批(含能力 + 安全校准 + 广泛部署后与第三方测试)。在漏洞修补、加速工程设计周期、增强 AI 研究等合法场景中保持有用与安全。


:money_bag: 价格详情

API 定价

项目 价格
标准输入 $2 / 百万 token
标准输出 $6 / 百万 token
Fast 变体 2 倍价格($4 / $12)
Grok Build / Cursor 首周 2 倍赠送用量

成本竞争力(AA 独立数据)

模型 智能指数 每任务成本
Grok 4.6 61 $0.84
GPT-5.6 Sol 61 $1.23
Claude Opus 5 62 $2.34

:light_bulb: 与 GLM-5.3-Flash(折扣后 $0.045/任务)相比,Grok 4.6 单任务成本约高 18 倍,但智能指数高 4 分——两者定位不同:Grok 4.6 面向高上限长程任务,GLM-Flash 面向极致性价比。


:vs_button: 与竞品对比

同级旗舰横向对比

维度 Grok 4.6 GPT-5.6 Sol Claude Fable 5
AA Intelligence Index 61 61 62
上下文 500K
输入价格 $2/M 更高 更高
输出价格 $6/M 更高 更高
主打 长程 Agent + 视觉交互 通用前沿 通用前沿
发布方 SpaceXAI OpenAI Anthropic

与 Grok 4.5 的代际提升

评测集 Grok 4.5 Grok 4.6 变化
AA Intelligence Index 56 61 +5
GDPVal-AA v2 1526 1753 +227
DeepSWE v1.1 54% 65.9% +11.9pp
CursorBench v3.2 66.7% 69.9% +3.2pp
APEX-Agents 47.1% 57.5% +10.4pp
AA-Briefcase 1313 1577 +264

:pushpin: 一个月内的代际提升集中在长程 Agent 与知识工作:GDPVal +227、AA-Briefcase +264、DeepSWE +11.9pp——正是 Grok 4.6 主打的赛道。


:warning: 注意事项

  • 发布页 vs 独立数据有微妙差异:官方称 AA Intelligence Index 61,独立数据交叉验证为 61(High);但 DeepSWE 官方 65.9% vs 独立 66.1%(Grok 4.5 口径)需注意设置差异
  • 高推理强度下成本上升:XHigh 每任务成本 $1.04,比 High 高约 24%;低推理(Low)智能降至 52
  • 首字延迟略高于 4.5:换更高分数的代价
  • 上下文上限因渠道而异:API 500K,但 Cursor 内仅 256K
  • 知识截止 2026-02-01:超过该日期的新信息需依赖联网工具
  • 参数规模未披露:官方未公布总参/激活参数

:bullseye: 总结

Grok 4.6 不是一次"更大模型"的发布,而是一次"更会干活"的发布——把 Grok 4.5 的 SFT 与 RL 配方全面重做,聚焦长程 Agent、跨代码库工作与视觉交互。结果是在 AA Intelligence Index 上与 GPT-5.6 Sol 打平(61),在 AA-Briefcase、GDPVal 等知识工作基准上甚至领先,而价格只有竞品零头,还带 2 倍速 Fast 变体。

适合场景

  • 长程研究 / 跨代码库 Agent 任务
  • 从产品想法到可运行应用的快速原型
  • 视觉与交互项目(网站、应用 UI)
  • 预算敏感但需要前沿智能的 Agent 构建者

官方资料