AI 快讯 | 阿里开源 Qwen3.8-Flash-Next:6B 激活即可对打闭源旗舰,Qwen4 架构提前预览

:fire: 阿里 Qwen 团队 8 月 26 日开源 Qwen3.8-Flash-Next:125B 总参数、每个 Token 仅激活 6B,以约 1/9 的 Qwen3.7-Plus 训练成本跑赢上一代多项基准,是下一代 Qwen4 架构的公开预览。

这是千问首次把「下一代的架构」提前拿出来给社区玩——不是发布一个新旗舰,而是把 Qwen4 的技术路线做了一次可落地的预演。

关键细节

  1. 架构换新,省到极致:Gated DeltaNet + Qwen 稀疏注意力(QSA,微块级选择替代逐 token 选择,大幅降低长上下文延迟)、Gated Residual 残差门控、N-gram Embedding(新增 51B 参数仅用于索引,低成本扩展参数量)、Muon 优化器 + 精简训练配方(省去 batch-size warmup)。一句话:用更少的钱,跑出更高的分。

  2. 训练成本约为 Qwen3.7-Plus 的 1/9,能力反而全面反超:编码、办公 agent 任务均反超上一代,生产版 Qwen3.8-Flash 即将上线 QwenCloud API。

  3. 超长上下文:原生 262K 上下文,经 YaRN 可扩展到 1M;这是首个采用该架构的开源权重发布。

参数 / 性能对比

项 Qwen3.8-Flash-Next Qwen3.8-27B Qwen3.7-Plus DeepSeek-V4-Flash-0731 Claude-Opus-4.6(Max)
总参数 125B(+51B n-gram+4B MTP) 27B 397B 284B 未公开
激活参数/Token 6B 27B 17B 13B —
DeepSWE 1.1(编码) 58.7 42.2 16.5 54.4 —
SWE-bench Pro 62.5 61.7 55.8 56.0 53.4
SWE-bench 多语言 81.0 73.8 75.8 — 77.5
CoWorkBench(办公 agent) 73.9 70.7 65.1 45.1 68.2
JobBench 55.7 33.4 27.6 41.3 36.6
AndroidWorld(多模态) 84.5 81.9 81.0 — 62.0
MathVision (with CI) 95.7 94.6 88.7 — 65.5
RealWorldQA 88.5 85.9 86.9 — 73.9
HLE(推理) 35.9 30.8 34.7 33.8 40.0

(加粗为该行最佳;数据来自官方 model card,Claude 用官方公布值)

价格对比

模型 输入 /M token 输出 /M token
Qwen3.8-Flash(生产版,即将上线) $0.16 $0.47
Qwen3.8-Max(旗舰,已上线) $2.00 $6.00

Qwen3.8-Flash 价格约为旗舰 Qwen3.8-Max 的 1/12(输入)/ 1/13(输出),主打极致成本效率。横向看,它与同月智谱 GLM-5.3-Flash($0.15/$0.50,9/9 前半价 $0.075/$0.25)构成国产 Flash 级模型的正面对垒——两家都在把「1M 上下文 + 多模态 + 低价开源」往下沉。

影响评估

国内开源模型在「成本效率」维度再下一城:6B 激活即可对打海外闭源旗舰,1M 上下文 + 多模态 + 极低价格的组合,将显著降低自主部署与 API 调用成本,加速开源生态在 agent、办公、长文档场景的落地。Qwen4 架构提前定调,QSA 稀疏注意力有望成为下一代长上下文模型的标配。

来源