AI 快讯 | 千问 Qwen3.8-Max 发布:2.4 万亿参数旗舰首次开源,多项评测全场第一
一句话总览:8 月 12 日,Qwen3.8-Max(Qwen3.8-2.4T-A95B)在 Hugging Face 和魔搭开源,8 月 14 日又放出 27B 版本——这是千问首次把 Max 级旗舰模型开放出来。官方评测里它在论文复现、指令遵循、医疗、法律、金融等多个基准上拿到全场第一,可自主编程数十天交付完整项目。
这次发布,业务上意味着什么
- 旗舰首次开源:2.4 万亿参数 MoE(激活 950 亿),Apache-2.0 协议,想私有化部署的企业可以直接拿权重
- 长程任务整包交付:可自主编程数十天交付完整项目,规划、实现、验证闭环,不用人工逐步拆解监督
- 原生视觉理解:视觉能力贯穿规划、执行、验证全流程,能看图、看长视频做深度语义解析
- 1M 上下文:原生 26 万 Token,可扩展至百万级,超大文档、完整代码库一次装下
- 数百种专业任务:法律、金融、设计等场景直接胜任,一次对话端到端交付生产级成果
评测表现:多个基准拿到第一
在公开评测数据中(对比 Claude Opus 4.8、Claude Fable 5、GPT-5.6 Sol、前代 Qwen3.7-Max),Qwen3.8-Max 的表现:
- PaperBench 93.0 分,全场第一:论文复现能力超过 GPT-5.6 Sol(90.5)和 Fable 5(88.8)
- IFBench 82.8 分,全场第一:指令遵循能力领先所有对比模型
- HealthBench 60.2 分,全场第一:医疗领域专业任务表现最佳
- PLawBench 73.2 分,全场第一:法律领域超过 GPT-5.6 Sol 和 Fable 5
- PRBench-Finance 58.3 分,全场第一:金融专业任务领先
- Terminal Bench 2.1 为 86.6:超过 Opus 4.8 和 Fable 5,接近 GPT-5.6 Sol(88.8)
- WideSearch 81.9 分,全场第一:搜索与信息整合能力领先
- MRCR v2 256K 长上下文 92.9:超长文档处理接近 GPT-5.6 Sol
能力的几个关键点
- Agent 执行更强:自主规划能力提升,对环境反馈的处理更可靠,复杂多步任务能坚持跑到完成
- 灵活思考控制:
reasoning_effort调节推理深度,preserve_thinking跨轮保留推理上下文,迭代开发不用重复思考 - 下游兼容性好:主流 harness 和开发工具广泛支持,接入现有技术栈更省事
- 双版本覆盖:2.4T 旗舰给重度任务,27B 稠密版给轻量部署,丰俭由人
价格和使用渠道
- API 定价(阿里云百炼):输入 12 元/百万 Token,输出 36 元/百万 Token,缓存命中输入仅 1.5 元;目前限时 8 折
- Token Plan 个人版:首发体验 Qwen3.8-Max,基础额度充裕,夜间调用更省钱
- 体验渠道:Qwen Studio(免费)、Qoder 编程平台、QwenWork 办公平台、Qwen Code 终端 Agent,API 兼容 OpenAI 和 Anthropic 规范,迁移成本低
对业务落地意味着什么
- 国产旗舰可私有化:过去想用 Max 级模型只能走 API,现在权重开源,数据敏感场景可以本地部署
- 复杂项目可以「交给它跑」:数十天量级的工程任务整包交付,适合需要 AI 长时间自主推进的场景
- 成本结构清晰:缓存命中输入价只要 1.5 元/百万 Token,长任务配合缓存能省下大头;夜间调用还有折扣
如果你不写代码:这个模型是给「让 AI 干活」用的——写代码、做分析、处理文档都能用,通过 Qwen 官网或阿里云平台就能体验,免费版就能试。
