智谱深夜放狠招!GLM-5.3-Flash 发布:320B 总参 / 18B 激活,首个原生多模态开源前沿模型,性能比肩 Claude Opus 4.8,价格却只要它的 1/40!
2026 年 8 月 26 日晚,智谱(Z.ai)正式发布并开源 GLM-5.3-Flash(320B-A18B)。这是此前以"牛来 / ox-alpha"代号匿名测试的神秘模型,一经官宣便引爆社区——不仅因为它是 GLM-5 系列首个原生多模态模型,更因为它用极致低成本架构,实现了"前沿智能、闪存级价格"。
一句话核心
GLM-5.3-Flash 是智谱 GLM-5 系列首个原生多模态开源模型——3200 亿总参数、仅激活 180 亿,采用稀疏注意力 + 线性注意力混合架构,AA 综合智能指数 57 分比肩 Claude Opus 4.8,价格却只有后者的约 1/40。
架构与参数介绍
基础规格
| 规格项 | 参数 |
|---|---|
| 发布方 | 智谱 Z.ai |
| 发布时间 | 2026-08-26 |
| 模型类型 | 原生多模态(文本 / 图片 / 视频 / 文件) |
| 总参数量 | 320B |
| 激活参数量 | 18B |
| 层数 | 45 层 |
| MoE 结构 | 288 个 routed experts,每 token 选 8 个,前三层 Dense |
| 注意力架构 | 3 层 Linear Attention + 1 层 DeepSeek Sparse Attention 周期性交错(45 层中 11 层 DSA) |
| 上下文窗口 | 1M tokens |
| 最大输出 | 128K tokens |
| Model Code | glm-5.3-flash |
| 许可证 | MIT(开源权重,发布当日即开放) |
| 支持框架 | SGLang / vLLM / TokenSpeed |
| 推荐参数 | temperature=1, top_p=0.95, reasoning_effort=max |
架构亮点:混合注意力
GLM-5.3-Flash 是首个采用稀疏注意力与线性注意力混合架构的开源前沿模型:
- 线性注意力:通过状态建模捕获局部依赖
- 稀疏注意力:通过轻量级索引器召回全局上下文
- IndexPool:将索引器的 4 个缓存向量通过加权池化压缩为 1 个,进一步降低 1M 上下文下索引器的时延与内存开销
相比 GLM-5.3,GLM-5.3-Flash 的注意力计算量降低 3.01 倍、KV 缓存大小降低 4.44 倍。在所有基线模型中(含 DeepSeek-V4-Flash、Kimi K3),GLM-5.3-Flash 的注意力计算量最低。
与前代对比
| 指标 | GLM-4.5 | GLM-5.3-Flash | 变化 |
|---|---|---|---|
| 总参数量 | 355B | 320B | 相近 |
| 激活参数 | 32B | 18B | 几乎减半 |
| 层数 | 92 | 45 | 几乎减半 |
注意:GLM-5.3(旗舰)与 GLM-5.3-Flash(轻量)是两个不同的模型。GLM-5.3 是 744B 总参 / 40B 激活、基于 5.2 基础模型后训练;GLM-5.3-Flash 是全新训练的 320B 基础模型 + 原生多模态。
Benchmark 表现
AA 综合智能指数:57 分
GLM-5.3-Flash 在 Artificial Analysis Intelligence Index v4.1.1 上拿到 57 分(与 Claude Opus 4.8 持平、约等于 GPT-5.6 Terra 水平),而折扣后单任务成本仅 $0.045——这个"智能-成本"组合把 Pareto 前沿直接推到了 10 倍价格的旗舰区。
六项编码 / Agent 基准(智谱官方技术报告)
| 评测集 | GLM-5.3-Flash | GLM-5.2 | Claude Opus 4.8 |
|---|---|---|---|
| Terminal Bench 2.1 | 84.3 | 81.0 | 85.0 |
| DeepSWE v1.1 | 63.4 | 46.2 | 58.0 |
| NL2Repo | 56.3 | 48.9 | 69.7 |
| AutomationBench v1.0.6 | 48.8 | 26.2 | 41.0 |
| Toolathlon Verified | 78.4 | 59.9 | 76.2 |
| Agents’ Last Exam | 26.3 | 20.4 | 27.0 |
代际提升巨大:相比 GLM-5.2,AutomationBench 从 26.2 → 48.8(接近翻倍)、DeepSWE 从 46.2 → 63.4、Terminal Bench 从 81.0 → 84.3,整体逼近甚至部分超过 Claude Opus 4.8。
视觉 / 多模态能力(智谱官方技术报告)
| 评测集 | GLM-5.3-Flash | Claude Opus 4.8 | GPT-5.6 Terra | Gemini 3.7 Flash |
|---|---|---|---|---|
| OfficeQA Pro | 62.4 | 48.9 | - | - |
| CharXiv Reasoning w/ Tools | 89.4 | 89.9 | 88.0 | 88.7 |
| Chartography w/ Tools | 78.0 | 75.0 | 68.0 | 65.0 |
| MVBench | 77.8 | 67.1 | 75.0 | 82.2 |
| MMVU | 80.5 | 67.4 | 75.8 | 82.3 |
| BabyVision | 53.4 | 46.8 | 61.6 | 70.9 |
视觉能力方面,GLM-5.3-Flash 在 OfficeQA Pro(62.4 vs 48.9)、Chartography(78.0 vs 75.0)、MVBench(77.8 vs 67.1)、MMVU(80.5 vs 67.4)等多项超越 Claude Opus 4.8,仅在 BabyVision 等通用视觉推理上弱于 Gemini 3.7 Flash。
第三方独立测试(来源:知乎社区 @恋猫)
- KernelBench-Mega:GLM-5.3-Flash 强于 GLM-5.2,弱于 GLM-5.3;GLM-5.3 在该榜排名第二(闭源模型第一)
- TerminalBench 3.0:GLM-5.3-Flash 介于 GLM-5.3 与 Grok 4.6 之间
- 代码库 bug 修复(105 个真实植入 bug):GLM-5.3-Flash 修复 16 个,与 DeepSeek V4 Flash 接近
- 网络安全基准:明显弱于 GLM-5.3,仅略好于 GPT-5.6-Luna
- UI 复刻能力:部分测试表现不错(视觉 Coding 主战场)
- MazeBench(3D 空间智能):得 0%(刚获得视觉输入能力的模型通病)
硬核实测亮点(来源:智谱官方 + 独立测试)
1. 视觉 Coding:16 小时自主搭建 400 平主厨自宅
在无任何外部素材的情况下,GLM-5.3-Flash 在 Blender 中自主运行 16 小时,搭建了一套约 400 平方米的专业主厨自宅与测试厨房。它把几何、材质、光照、空间关系转化为在不同视角下保持一致的 3D 结构。
2. 视觉自校验:从"布局有问题的初版"到"可交付成品"
智谱展示了模型在"初始版本(布局有问题)"→"视觉自校验后"的改进过程——模型通过渲染检查主动发现布局、溢出、对齐等问题并修正。
3. 隐私匿名测试:上线即成"本周最火模型"
发布前,智谱将 GLM-5.3-Flash 以 ox-alpha 代号匿名部署在 OpenCode 和 OpenRouter 上收集反馈,迅速成为当周最受欢迎模型,且全部流量由国产 AI 芯片集群承载。
价格详情
API 定价
| 项目 | 价格 |
|---|---|
| 正常价 | 仅为 GLM-5.3 的 1/10 |
| 限时折扣 | 为 GLM-5.3 的 1/20 |
| 相对 Opus 4.8 | 约为其 1/40 |
| AA 单任务成本(折扣后) | $0.045 / 任务 |
智谱给出的参考:GLM-5.3-Flash 在 DeepSWE 上得 63.4%,单任务成本仅 $0.24,而同分的 DeepSeek-V4-Pro 单任务成本是 $1.67——性价比差距达 7 倍。
成本竞争力(AA 数据交叉验证)
| 模型 | AA Intelligence Index | 单任务成本 |
|---|---|---|
| GLM-5.3-Flash | 57 | $0.045(折扣价) |
| Claude Opus 4.8 | ~57 | 约 Flash 的 40 倍 |
| DeepSeek-V4-Pro | - | $1.67(同 DeepSWE 得分) |
与竞品对比
同量级模型对比
| 模型 | 总参 / 激活 | 多模态 | 上下文 | 开源 |
|---|---|---|---|---|
| GLM-5.3-Flash | 320B / 18B | 1M | ||
| DeepSeek-V4-Flash | 284B / 13B | 1M | ||
| DeepSeek-V4-Flash-Vision-Exp | 284B / 13B | 1M | ||
| Kimi K3 | 2.8T / 104B | 1M | ||
| Qwen3.8-27B | 27B(稠密) | 262K |
关键差异
GLM-5.3-Flash 的杀手锏是"性能/价格比":以 18B 激活参数达到 57 分智能指数,将"开源前沿模型"的价格锚点直接打到了旗舰的 1/40,同时首次在开源模型中实现原生多模态 + 1M 上下文。
注意局限:网络安全能力明显弱于 GLM-5.3;3D 空间智能(MazeBench)为 0%(新视觉模型通病);BabyVision 等通用视觉推理弱于 Gemini。
国产芯片 + 开源生态
GLM-5.3-Flash 发布前一周,全部流量都由国产 AI 芯片集群承载(自研高带宽互联 + 基于 SGLang 的专用推理引擎):
- 端到端服务性能相比初始基线提升 3 倍
- 硬件效率和单 token 成本已接近主流英伟达 GPU
- 采用 Encode-Prefill-Decode(EPD)分离式架构
- 智能体(GLM-5.3 驱动的 infra agent)参与优化算子与部署栈,形成"模型优化系统、系统承载模型"的正向循环
模型权重已开源:HuggingFace - zai-org/GLM-5.3-Flash,支持 SGLang / vLLM / TokenSpeed 本地部署。
注意事项
- GLM-5.3 与 GLM-5.3-Flash 是两个模型:前者 744B 总参/40B 激活、暂未开源;后者 320B 总参/18B 激活、MIT 开源
- 网络安全 / 3D 空间智能偏弱:适合 Coding / Agent / 多模态办公,不适合安全攻防场景
- 思考不可关闭:
thinking.type仅支持enabled,建议设置reasoning_effort: max - 已上线 GLM Coding Plan:额度为 GLM-5.3 的 3 倍,支持 Cursor / Claude Code / ZCode 等工具
总结
GLM-5.3-Flash 把"前沿智能"和"Flash 级成本"第一次同时做到了开源模型里——320B 总参 / 18B 激活、原生多模态、1M 上下文、MIT 开源,性能比肩 Claude Opus 4.8 而价格只要 1/40,还跑在国产芯片上。对开发者来说,这可能是 2026 下半年性价比最高的"默认模型"。
官方资料
- 技术报告:z.ai/blog/glm-5.3-flash
- 官方文档:docs.bigmodel.cn - GLM-5.3-Flash
- 开源权重:HuggingFace




