阿里放大招!Qwen3.8-27B 开源发布:270 亿参数原生多模态,本地可跑,单 GPU 部署,强到让同级闭源模型汗颜!
阿里 Qwen 团队于 2026 年 8 月 14 日(UTC 15:00)正式开源了 Qwen3.8-27B——这是与 Qwen3.8-Max 同期发布的紧凑稠密模型,定位为「本地可跑的多模态旗舰」,已经在 Hugging Face、ModelScope 上以 Apache 2.0 协议开源。
一句话核心
Qwen3.8-27B 是阿里 Qwen 团队新推出的 270 亿参数稠密多模态模型——原生支持图像和视频理解,具备灵活思考控制,Apache 2.0 开源权重,定位为「本地可跑的多模态旗舰」。
架构与参数介绍
基础规格
| 规格项 | 参数 |
|---|---|
| 发布方 | 阿里 Qwen 团队 |
| 发布时间 | 2026-08-14 (15:00 UTC) |
| 模型类型 | 稠密 (Dense) 视觉语言模型 |
| 精确参数量 | 27,781,427,952 (≈ 27.78B) |
| 总层数 | 64 层 (48 Gated DeltaNet + 16 全注意力) |
| 隐藏维度 | 5,120 |
| FFN 维度 | 17,408 |
| 全注意力头 | 24 Q 头 / 4 KV 头 / head dim 256 |
| 线性注意力头 | 48 V 头 / 16 QK 头 / head dim 128 |
| 词表大小 | 248,320 |
| 原生上下文 | 262,144 tokens (256K) |
| 扩展上下文 | 1,000,000 tokens (YaRN) |
| 视觉编码器 | 27 层,width 1,152,16 头 |
| 思考模式 | 默认开启 |
| 思考档位 | xhigh (默认) / medium / low |
| MTP | 支持多 token 预测 |
| 官方权重 | BF16 / 块式 FP8 |
| 官方推理框架 | Transformers / vLLM / SGLang / TokenSpeed |
| 许可证 | Apache 2.0 |
架构亮点:混合解码器
Qwen3.8-27B 采用混合解码器(不是传统全注意力 Transformer),其 64 层语言层每 16 层重复一个模式:
- 3 层 Gated DeltaNet 线性注意力 + FFN
- 1 层 GQA 全注意力 + FFN
这种设计让序列处理保持高效,同时定期使用全注意力恢复更丰富的 token 交互。只有 16 层构建传统 KV 缓存,显著降低显存占用。
与前代 Qwen3.6-27B 的关系
Qwen3.8-27B 与 Qwen3.6-27B 的解码器规格几乎完全相同——层数、隐藏维度、FFN 宽度、头布局、原生上下文都没变。性能飞跃主要来自不同的训练数据、训练策略、后训练方法,以及推理和 Agent 行为的变化。
官方 Benchmark 数据
文本、编程与 Agent 能力
| 评测集 | Qwen3.8-27B | Qwen3.6-27B | Qwen3.7-Plus | Muse Glimmer-30B | Opus 4.6 Max |
|---|---|---|---|---|---|
| Terminal-Bench 2.1 | 73.0 | 63.4 | 64.0 | 51.7 | 78.2 |
| SWE-bench Pro | 61.7 | 53.5 | 57.6 | 51.2 | 53.4† |
| NL2Repo-Bench | 42.3 | 36.2 | 41.1 | – | 47.6 |
| DeepSWE 1.1 | 42.2 | 13.3 | 14.2 | – | – |
| QwenSWEBench | 79.0 | 49.3 | 59.2 | – | 63.8 |
| CoWorkBench | 70.7 | 61.0 | 65.1 | – | 68.2 |
| JobBench | 33.4 | 21.8 | 27.6 | – | – |
| Agents’ Last Exam (Pass@1 / Score) | 20.4 / 42.9 | 10.6 / 27.3 | 13.2 / 33.6 | – | – |
| IFBench | 79.5 | 69.1 | 79.1 | 77.0 | 62.5 |
| GPQA Diamond | 89.2 | 87.8 | 90.3 | 83.5 | 91.3 |
| Humanity’s Last Exam | 30.8 | 24.0 | 34.7 | 22.0 | 40.0 |
| LiveCodeBench v6 | 90.3 | 83.9 | 89.6 | – | 88.8 |
代际提升非常明显:相比 Qwen3.6-27B,DeepSWE 提升 28.9 分、QwenSWEBench 提升 29.7 分、Terminal-Bench 2.1 提升 9.6 分。
多模态与计算机使用能力
| 评测集 | Qwen3.8-27B | Qwen3.6-27B | Qwen3.7-Plus | Muse Glimmer-30B | Opus 4.6 Max |
|---|---|---|---|---|---|
| OSWorld-Verified | 84.3 | 63.9 | 73.3 | 65.9 | 72.7 |
| WebArena-Verified | 64.8 | 48.8 | 55.3 | – | – |
| AndroidWorld | 81.9 | 70.3 | 81.0 | – | 62.0 |
| RecreationBench | 47.1 | 29.8 | 30.2 | – | – |
| ClawEval-MM (Pass@3 / Avg) | 57.4 / 56.9 | 42.6 / 50.4 | 57.4 / 60.1 | – | 52.5 / 54.7 |
| SWE-MM | 38.6 | 25.7 | 30.0 | – | 27.1 |
| Vision2Web | 62.9 | 45.0 | 42.1 | – | – |
| MathVision (无 / 有 CI) | 90.0 / 94.6 | 85.1 / – | 90.3 / – | – | 65.5 / – |
| BabyVision (无 / 有 CI) | 65.7 / 85.6 | 28.9 / – | 64.7 / 70.4 | – | 12.6 / – |
| CharXiv RQ (无 / 有 CI) | 83.7 / 90.2 | 78.4 / – | 85.8 / 85.9 | 78.8 | 66.0 / – |
| OmniDocBench 1.5 | 91.1 | 89.4 | 91.4 | 75.8 | 86.6 |
| RealWorldQA | 85.9 | 84.1 | 86.9 | – | 73.9 |
| ERQA | 65.5 | 62.5 | 69.8 | – | 40.8 |
多模态 Agent 优势显著:OSWorld 提升 20.4 分、WebArena 提升 16.0 分、Vision2Web 提升 17.9 分——在「操作界面」「视觉上下文构建软件」等混合 Agent 任务上达到或超越 Opus 4.6 Max。
第三方独立评分
数据来源:Artificial Analysis Intelligence Index(第三方独立基准)
Artificial Analysis 把 Qwen3.8-27B 评为 Intelligence Index = 52,与 GPT-5.6 Luna(max)持平,仅落后 GLM-5.2(max)和 DeepSeek V4 Pro(max)各 1 分——而这两者都是数千亿参数的 MoE 模型。
独立测评
1. MS Paint macOS 重建(来源:YouTube @Pavlo Khmel HPC)
测试:用单条 prompt 让 Qwen3.8-27B-FP8 创建 macOS 原生版本 MS Paint。
结果:
完全可用
- 画笔、颜色、大小、形状全部正常
- 撤销/重做、填充、保存/另存为都工作
- 整体水平与 GLM 5.2 不相上下
- 即使是 27B FP8 量化版本也能完成这种复杂桌面应用开发
2. RTX 5090 本地跑分(来源:Alex Finn @ X)
测试:在 RTX 5090(32GB)上跑 Qwen3.8-27B,与 Opus 4.8 / Opus 4.6 对比。
结果:
- 本地超过 Opus 4.8(Alex Finn 自己的基准)
- 略输 Opus 4.6
- 速度最高 200 tokens/秒
- 单卡即可提供 Opus 4.8 级别智能
来源:@AlexFinn on X — 2,254 赞,146 转发
Alibaba_Qwen 官方回复:「看到 27B 稠密模型在单卡 5090 上提供前沿智能,令人惊叹。」
3. M5 Max MacBook Pro 实测(来源:@TeksEdge @ X)
测试:在 Apple M5 Max(统一内存)上通过 oMLX + DFlash 2 跑 Qwen3.8-27B-4bit。
结果:
- ~70 tokens/秒 输出速度
- 使用 DFlash 2 投机解码,在保持目标模型输出的同时显著加速
- 苹果生态用户已可通过 oMLX 直接运行
4. 显存占用实测(来源:@CMay @ Hacker News)
测试:在 RTX 4090(24GB)上用 Q4_K_M 量化跑 Qwen3.8-27B。
结果:
- 32K 上下文约占用 2.5GB VRAM
- 比 Gemma 4 31B 显存效率略低,但智能密度更高
- 单卡 24GB 可用,但不能跑满 256K 原生上下文
5. Kingy AI 全面评测(来源:kingy.ai)
结论:Qwen3.8-27B 在 24GB 显卡上以量化版运行时表现稳定,但单卡跑满 256K 上下文需要权衡;建议多卡或高端卡用于大上下文场景。Northflank 实测在 SGLang 上的部署配置供参考。
6. 跨模型对比(综合数据)
| 评测集 | Qwen3.8-27B | DeepSeek V4 Flash | GPT-5.6 Sol | Claude Opus 4.8 |
|---|---|---|---|---|
| Terminal-Bench 2.1 | 73.0 | 82.7 | 88.8 | 78.9 |
| DeepSWE 1.1 | 42.2 | 54.4 | 72.7 | 59.0 |
| SWE-bench Pro | 61.7 | - | 64.6 | Opus 5: 79.2 |
| GPQA Diamond | 89.2 | - | 94.6 | 92.0 |
Qwen3.8-27B 对 27B 尺寸而言已经非常接近前沿,但在最难的长程任务上仍被顶级闭源模型压制。考虑到 27B 本地可跑、Apache 2.0 开源,这个成绩相当惊艳。
价格详情
OpenRouter API 定价
| 项目 | 价格(每百万 token) |
|---|---|
| 输入 | $0.35 |
| 输出 | $2.75 |
| 上下文窗口 | 1M |
| 上线时间 | 2026-08-14 |
数据来源:OpenRouter Qwen3.8-27B 页面 — 累计已处理 134B tokens
与同类对比
| 模型 | 部署方式 | 输入价格 | 输出价格 |
|---|---|---|---|
| Qwen3.8-27B | 本地或 OpenRouter | $0.35 | $2.75 |
| Qwen3.8-Max | Qwen Cloud API | $2.00 | $6.00 |
性价比炸裂:Qwen3.8-27B 在 OpenRouter 上的价格仅为 Qwen3.8-Max 的 17%,但能覆盖大部分 Agent 任务。
与竞品对比
同尺寸开源模型对比
| 模型 | 架构 | 模态 | 上下文 | 许可证 | 实用定位 |
|---|---|---|---|---|---|
| Qwen3.8-27B | 27.78B 稠密混合 | 文/图/视频 | 262K 原生 / 1M YaRN | Apache 2.0 | 同尺寸新王者,官方 BF16/FP8 |
| Qwen3.6-27B | ~27.8B 稠密 | 文/图/视频 | 262K 原生 | Apache 2.0 | 直接前代,量化生态成熟 |
| Muse Glimmer-30B | ~29.6B 稠密 | 文/图 | 131K+ | Apache 2.0 | 最接近的尺寸对标 |
| Gemma 4 31B | ~31B 稠密 | 文/图 | 256K | Apache 2.0 | Google 阵营对标 |
| Mistral Small 4 | 119B 总参 / 6.5B 激活 MoE | 文/图 | 256K | Apache 2.0 | 活跃参数少但存储大(~71GB) |
| DeepSeek V4 Flash | 284B 总参 / 13B 激活 MoE | 文 | 1M | MIT | 编程强但 ~149GB 显存 |
关键差异
Qwen3.8-27B 定位:在不依赖数据中心级硬件的前提下,提供接近前沿的多模态能力,特别适合本地编码 Agent、文档分析、私人研究、多模态自动化等场景。
关键提醒:「开源权重」≠「完全开源」。Qwen3.8-27B 仅发布权重,训练数据和完整训练 recipe 仍未公开。
适用场景
- 本地编码 Agent:在 RTX 4090/5090 上 4-bit 量化即可运行,适合私有代码助手
- 多模态文档分析:支持长文档、图表、视频理解,可用于财报审阅、学术论文解析
- GUI 操作自动化:OSWorld/WebArena 表现强,可做浏览器/桌面自动化
- 研究工作流:长上下文 + 思考控制 + Agent 能力,适合研究助理
- 企业内部部署:Apache 2.0 允许商用,可私有化部署
- 离线/隐私场景:本地运行,数据不出本地
- Mac 用户:通过 MLX + DFlash 2 在 Apple Silicon 上也能跑
本地部署硬件需求
| 精度 | 权重占用 | 实际推荐配置 |
|---|---|---|
| BF16 官方 | 51.76 GiB | 80GB 级别 (H100 / H200 / RTX Pro 6000) |
| FP8 官方 | 28.76 GiB | 48GB 级别 (RTX 4090 双卡 / A6000) |
| Q4_K_M GGUF (第三方) | 15.93 GiB | 24GB 级别 (RTX 4090) |
| Q6_K GGUF (第三方) | 21.31 GiB | 32GB+ |
| IQ4_XS 量化 (Unsloth) | 14.6 GB | 8GB VRAM + 64K 上下文 (RTX 4060) |
重要提示:「17GB 可跑」≠「17GB 可跑满 256K 上下文」。权重占用只是开始,KV 缓存、激活值、视觉处理、CUDA 缓冲区等都会占显存。原生 262K 上下文的全注意力 KV 缓存就达约 16 GiB。
部署与调用
官方推荐路径
| 框架 | 用途 |
|---|---|
| Transformers | 推理、实验 |
| vLLM | 高性能生产部署 |
| SGLang | 复杂 Agent 工作流 |
| TokenSpeed | 优化推理 |
| llama.cpp | Mac / Linux 本地运行 |
| Ollama | 一键启动 |
| LM Studio | 桌面端运行 |
| oMLX (MLX) | Apple Silicon |
思考档位选择
| 档位 | 适用场景 | 权衡 |
|---|---|---|
low |
快速、有限任务 | 分析少可能增加失败和重试 |
medium |
平衡默认 | 需具体评估 |
xhigh |
复杂编码、研究、长程任务 | 默认档位,延迟和 token 消耗最高 |
关键警告:Qwen3.8-27B 默认开启思考档位 xhigh,会消耗大量 token 处理简单请求。首次使用强烈建议手动调整为 medium 或 low,否则会快速烧光 token 预算。
温度参数
- 思考模式:temperature=1.0,top_p=0.95
- 非思考模式:temperature=0.7,top_p=0.8,presence_penalty=1.5
注意事项
- 官方 BF16/FP8 权重不含 GGUF:工作站友好的 GGUF 是第三方转换(Unsloth 等)
- 24GB GPU 不能跑满 256K 上下文:必须权衡权重量化精度和上下文长度
- Qwen Cloud 托管版尚未上线:官方 API 即将推出
- 「1M 上下文」是 YaRN 扩展,不是原生支持;启用扩展可能在短上下文上降低性能
- 训练数据、知识截止日期、后训练 recipe 暂未公开
- 不是所有场景都适合:HN 社区反馈显示 Qwen 3.8 27B 倾向"过思考"(overthinking),低推理档位下偶有质量问题,建议根据任务选档
总结
Qwen3.8-27B 是当前最强本地可跑的多模态模型之一——270 亿参数稠密架构,原生视觉语言支持,Apache 2.0 完全商用授权,单 GPU 可部署。在编码 Agent、GUI 自动化、长程任务上达到或超过 Opus 4.6 Max。
适合以下场景:
- 想要本地跑、又要多模态能力
- 需要 Apache 2.0 商用
- 单 GPU(24GB+)可部署
- 编码 / Agent / 文档分析工作流
下载链接:Qwen/Qwen3.8-27B on Hugging Face
模型博客:Qwen3.8-Max: A New Bar for Coding and Cowork(注:博客讲的是 Max 模型,27B 数据在 HF 模型卡上)
第三方独立评测:Artificial Analysis | Kingy AI 评测 | Yotta Labs 评测 | Northflank 评测
社区讨论:HF Discussions | HN 讨论 | @AlexFinn on X


