AI 快讯 | 智谱 GLM-5.3-Flash 开源发布:320B/18B 原生多模态,性能比肩 Opus 4.8 价格仅 1/40

:fire: 智谱深夜放狠招!GLM-5.3-Flash 发布:320B 总参 / 18B 激活,首个原生多模态开源前沿模型,性能比肩 Claude Opus 4.8,价格却只要它的 1/40!

2026 年 8 月 26 日晚,智谱(Z.ai)正式发布并开源 GLM-5.3-Flash(320B-A18B)。这是此前以"牛来 / ox-alpha"代号匿名测试的神秘模型,一经官宣便引爆社区——不仅因为它是 GLM-5 系列首个原生多模态模型,更因为它用极致低成本架构,实现了"前沿智能、闪存级价格"。


:key: 一句话核心

GLM-5.3-Flash 是智谱 GLM-5 系列首个原生多模态开源模型——3200 亿总参数、仅激活 180 亿,采用稀疏注意力 + 线性注意力混合架构,AA 综合智能指数 57 分比肩 Claude Opus 4.8,价格却只有后者的约 1/40。


:building_construction: 架构与参数介绍

基础规格

规格项 参数
发布方 智谱 Z.ai
发布时间 2026-08-26
模型类型 原生多模态(文本 / 图片 / 视频 / 文件)
总参数量 320B
激活参数量 18B
层数 45 层
MoE 结构 288 个 routed experts,每 token 选 8 个,前三层 Dense
注意力架构 3 层 Linear Attention + 1 层 DeepSeek Sparse Attention 周期性交错(45 层中 11 层 DSA)
上下文窗口 1M tokens
最大输出 128K tokens
Model Code glm-5.3-flash
许可证 MIT(开源权重,发布当日即开放)
支持框架 SGLang / vLLM / TokenSpeed
推荐参数 temperature=1, top_p=0.95, reasoning_effort=max

架构亮点:混合注意力

GLM-5.3-Flash 是首个采用稀疏注意力与线性注意力混合架构的开源前沿模型

  • 线性注意力:通过状态建模捕获局部依赖
  • 稀疏注意力:通过轻量级索引器召回全局上下文
  • IndexPool:将索引器的 4 个缓存向量通过加权池化压缩为 1 个,进一步降低 1M 上下文下索引器的时延与内存开销

:pushpin: 相比 GLM-5.3,GLM-5.3-Flash 的注意力计算量降低 3.01 倍、KV 缓存大小降低 4.44 倍。在所有基线模型中(含 DeepSeek-V4-Flash、Kimi K3),GLM-5.3-Flash 的注意力计算量最低。

与前代对比

指标 GLM-4.5 GLM-5.3-Flash 变化
总参数量 355B 320B 相近
激活参数 32B 18B 几乎减半
层数 92 45 几乎减半

:warning: 注意:GLM-5.3(旗舰)与 GLM-5.3-Flash(轻量)是两个不同的模型。GLM-5.3 是 744B 总参 / 40B 激活、基于 5.2 基础模型后训练;GLM-5.3-Flash 是全新训练的 320B 基础模型 + 原生多模态。


:bar_chart: Benchmark 表现

AA 综合智能指数:57 分

GLM-5.3-Flash 在 Artificial Analysis Intelligence Index v4.1.1 上拿到 57 分(与 Claude Opus 4.8 持平、约等于 GPT-5.6 Terra 水平),而折扣后单任务成本仅 $0.045——这个"智能-成本"组合把 Pareto 前沿直接推到了 10 倍价格的旗舰区。

六项编码 / Agent 基准(智谱官方技术报告)

评测集 GLM-5.3-Flash GLM-5.2 Claude Opus 4.8
Terminal Bench 2.1 84.3 81.0 85.0
DeepSWE v1.1 63.4 46.2 58.0
NL2Repo 56.3 48.9 69.7
AutomationBench v1.0.6 48.8 26.2 41.0
Toolathlon Verified 78.4 59.9 76.2
Agents’ Last Exam 26.3 20.4 27.0

:pushpin: 代际提升巨大:相比 GLM-5.2,AutomationBench 从 26.2 → 48.8(接近翻倍)、DeepSWE 从 46.2 → 63.4、Terminal Bench 从 81.0 → 84.3,整体逼近甚至部分超过 Claude Opus 4.8。

视觉 / 多模态能力(智谱官方技术报告)

评测集 GLM-5.3-Flash Claude Opus 4.8 GPT-5.6 Terra Gemini 3.7 Flash
OfficeQA Pro 62.4 48.9 - -
CharXiv Reasoning w/ Tools 89.4 89.9 88.0 88.7
Chartography w/ Tools 78.0 75.0 68.0 65.0
MVBench 77.8 67.1 75.0 82.2
MMVU 80.5 67.4 75.8 82.3
BabyVision 53.4 46.8 61.6 70.9

:pushpin: 视觉能力方面,GLM-5.3-Flash 在 OfficeQA Pro(62.4 vs 48.9)、Chartography(78.0 vs 75.0)、MVBench(77.8 vs 67.1)、MMVU(80.5 vs 67.4)等多项超越 Claude Opus 4.8,仅在 BabyVision 等通用视觉推理上弱于 Gemini 3.7 Flash。

第三方独立测试(来源:知乎社区 @恋猫)

  • KernelBench-Mega:GLM-5.3-Flash 强于 GLM-5.2,弱于 GLM-5.3;GLM-5.3 在该榜排名第二(闭源模型第一)
  • TerminalBench 3.0:GLM-5.3-Flash 介于 GLM-5.3 与 Grok 4.6 之间
  • 代码库 bug 修复(105 个真实植入 bug):GLM-5.3-Flash 修复 16 个,与 DeepSeek V4 Flash 接近
  • 网络安全基准:明显弱于 GLM-5.3,仅略好于 GPT-5.6-Luna
  • UI 复刻能力:部分测试表现不错(视觉 Coding 主战场)
  • MazeBench(3D 空间智能):得 0%(刚获得视觉输入能力的模型通病)

:test_tube: 硬核实测亮点(来源:智谱官方 + 独立测试)

1. 视觉 Coding:16 小时自主搭建 400 平主厨自宅

在无任何外部素材的情况下,GLM-5.3-Flash 在 Blender 中自主运行 16 小时,搭建了一套约 400 平方米的专业主厨自宅与测试厨房。它把几何、材质、光照、空间关系转化为在不同视角下保持一致的 3D 结构。

2. 视觉自校验:从"布局有问题的初版"到"可交付成品"

智谱展示了模型在"初始版本(布局有问题)"→"视觉自校验后"的改进过程——模型通过渲染检查主动发现布局、溢出、对齐等问题并修正。

3. 隐私匿名测试:上线即成"本周最火模型"

发布前,智谱将 GLM-5.3-Flash 以 ox-alpha 代号匿名部署在 OpenCode 和 OpenRouter 上收集反馈,迅速成为当周最受欢迎模型,且全部流量由国产 AI 芯片集群承载。


:money_bag: 价格详情

API 定价

项目 价格
正常价 仅为 GLM-5.3 的 1/10
限时折扣 为 GLM-5.3 的 1/20
相对 Opus 4.8 约为其 1/40
AA 单任务成本(折扣后) $0.045 / 任务

:light_bulb: 智谱给出的参考:GLM-5.3-Flash 在 DeepSWE 上得 63.4%,单任务成本仅 $0.24,而同分的 DeepSeek-V4-Pro 单任务成本是 $1.67——性价比差距达 7 倍。

成本竞争力(AA 数据交叉验证)

模型 AA Intelligence Index 单任务成本
GLM-5.3-Flash 57 $0.045(折扣价)
Claude Opus 4.8 ~57 约 Flash 的 40 倍
DeepSeek-V4-Pro - $1.67(同 DeepSWE 得分)

:vs_button: 与竞品对比

同量级模型对比

模型 总参 / 激活 多模态 上下文 开源
GLM-5.3-Flash 320B / 18B :white_check_mark: 原生 1M :white_check_mark: MIT
DeepSeek-V4-Flash 284B / 13B :cross_mark: 文本 1M :white_check_mark: MIT
DeepSeek-V4-Flash-Vision-Exp 284B / 13B :white_check_mark: 实验 1M :cross_mark: API
Kimi K3 2.8T / 104B :white_check_mark: 1M :white_check_mark:(自定义许可)
Qwen3.8-27B 27B(稠密) :white_check_mark: 262K :white_check_mark: Apache 2.0

关键差异

:pushpin: GLM-5.3-Flash 的杀手锏是"性能/价格比":以 18B 激活参数达到 57 分智能指数,将"开源前沿模型"的价格锚点直接打到了旗舰的 1/40,同时首次在开源模型中实现原生多模态 + 1M 上下文。

:warning: 注意局限:网络安全能力明显弱于 GLM-5.3;3D 空间智能(MazeBench)为 0%(新视觉模型通病);BabyVision 等通用视觉推理弱于 Gemini。


:desktop_computer: 国产芯片 + 开源生态

GLM-5.3-Flash 发布前一周,全部流量都由国产 AI 芯片集群承载(自研高带宽互联 + 基于 SGLang 的专用推理引擎):

  • 端到端服务性能相比初始基线提升 3 倍
  • 硬件效率和单 token 成本已接近主流英伟达 GPU
  • 采用 Encode-Prefill-Decode(EPD)分离式架构
  • 智能体(GLM-5.3 驱动的 infra agent)参与优化算子与部署栈,形成"模型优化系统、系统承载模型"的正向循环

模型权重已开源HuggingFace - zai-org/GLM-5.3-Flash,支持 SGLang / vLLM / TokenSpeed 本地部署。


:warning: 注意事项

  • GLM-5.3 与 GLM-5.3-Flash 是两个模型:前者 744B 总参/40B 激活、暂未开源;后者 320B 总参/18B 激活、MIT 开源
  • 网络安全 / 3D 空间智能偏弱:适合 Coding / Agent / 多模态办公,不适合安全攻防场景
  • 思考不可关闭thinking.type 仅支持 enabled,建议设置 reasoning_effort: max
  • 已上线 GLM Coding Plan:额度为 GLM-5.3 的 3 倍,支持 Cursor / Claude Code / ZCode 等工具

:bullseye: 总结

GLM-5.3-Flash 把"前沿智能"和"Flash 级成本"第一次同时做到了开源模型里——320B 总参 / 18B 激活、原生多模态、1M 上下文、MIT 开源,性能比肩 Claude Opus 4.8 而价格只要 1/40,还跑在国产芯片上。对开发者来说,这可能是 2026 下半年性价比最高的"默认模型"。

官方资料