AI 快讯 | 阿里 Qwen3.8-27B 开源发布:270 亿参数原生多模态,单 GPU 可跑,逼近前沿

:fire: 阿里放大招!Qwen3.8-27B 开源发布:270 亿参数原生多模态,本地可跑,单 GPU 部署,强到让同级闭源模型汗颜!

阿里 Qwen 团队于 2026 年 8 月 14 日(UTC 15:00)正式开源了 Qwen3.8-27B——这是与 Qwen3.8-Max 同期发布的紧凑稠密模型,定位为「本地可跑的多模态旗舰」,已经在 Hugging Face、ModelScope 上以 Apache 2.0 协议开源。


:key: 一句话核心

Qwen3.8-27B 是阿里 Qwen 团队新推出的 270 亿参数稠密多模态模型——原生支持图像和视频理解,具备灵活思考控制,Apache 2.0 开源权重,定位为「本地可跑的多模态旗舰」。


:building_construction: 架构与参数介绍

基础规格

规格项 参数
发布方 阿里 Qwen 团队
发布时间 2026-08-14 (15:00 UTC)
模型类型 稠密 (Dense) 视觉语言模型
精确参数量 27,781,427,952 (≈ 27.78B)
总层数 64 层 (48 Gated DeltaNet + 16 全注意力)
隐藏维度 5,120
FFN 维度 17,408
全注意力头 24 Q 头 / 4 KV 头 / head dim 256
线性注意力头 48 V 头 / 16 QK 头 / head dim 128
词表大小 248,320
原生上下文 262,144 tokens (256K)
扩展上下文 1,000,000 tokens (YaRN)
视觉编码器 27 层,width 1,152,16 头
思考模式 默认开启
思考档位 xhigh (默认) / medium / low
MTP 支持多 token 预测
官方权重 BF16 / 块式 FP8
官方推理框架 Transformers / vLLM / SGLang / TokenSpeed
许可证 Apache 2.0

架构亮点:混合解码器

Qwen3.8-27B 采用混合解码器(不是传统全注意力 Transformer),其 64 层语言层每 16 层重复一个模式:

  • 3 层 Gated DeltaNet 线性注意力 + FFN
  • 1 层 GQA 全注意力 + FFN

:pushpin: 这种设计让序列处理保持高效,同时定期使用全注意力恢复更丰富的 token 交互。只有 16 层构建传统 KV 缓存,显著降低显存占用。

与前代 Qwen3.6-27B 的关系

Qwen3.8-27B 与 Qwen3.6-27B 的解码器规格几乎完全相同——层数、隐藏维度、FFN 宽度、头布局、原生上下文都没变。性能飞跃主要来自不同的训练数据、训练策略、后训练方法,以及推理和 Agent 行为的变化。


:bar_chart: 官方 Benchmark 数据

数据来源:Qwen/Qwen3.8-27B 官方 HF 模型卡

文本、编程与 Agent 能力

评测集 Qwen3.8-27B Qwen3.6-27B Qwen3.7-Plus Muse Glimmer-30B Opus 4.6 Max
Terminal-Bench 2.1 73.0 63.4 64.0 51.7 78.2
SWE-bench Pro 61.7 53.5 57.6 51.2 53.4†
NL2Repo-Bench 42.3 36.2 41.1 47.6
DeepSWE 1.1 42.2 13.3 14.2
QwenSWEBench 79.0 49.3 59.2 63.8
CoWorkBench 70.7 61.0 65.1 68.2
JobBench 33.4 21.8 27.6
Agents’ Last Exam (Pass@1 / Score) 20.4 / 42.9 10.6 / 27.3 13.2 / 33.6
IFBench 79.5 69.1 79.1 77.0 62.5
GPQA Diamond 89.2 87.8 90.3 83.5 91.3
Humanity’s Last Exam 30.8 24.0 34.7 22.0 40.0
LiveCodeBench v6 90.3 83.9 89.6 88.8

:pushpin: 代际提升非常明显:相比 Qwen3.6-27B,DeepSWE 提升 28.9 分、QwenSWEBench 提升 29.7 分、Terminal-Bench 2.1 提升 9.6 分。

多模态与计算机使用能力

评测集 Qwen3.8-27B Qwen3.6-27B Qwen3.7-Plus Muse Glimmer-30B Opus 4.6 Max
OSWorld-Verified 84.3 63.9 73.3 65.9 72.7
WebArena-Verified 64.8 48.8 55.3
AndroidWorld 81.9 70.3 81.0 62.0
RecreationBench 47.1 29.8 30.2
ClawEval-MM (Pass@3 / Avg) 57.4 / 56.9 42.6 / 50.4 57.4 / 60.1 52.5 / 54.7
SWE-MM 38.6 25.7 30.0 27.1
Vision2Web 62.9 45.0 42.1
MathVision (无 / 有 CI) 90.0 / 94.6 85.1 / – 90.3 / – 65.5 / –
BabyVision (无 / 有 CI) 65.7 / 85.6 28.9 / – 64.7 / 70.4 12.6 / –
CharXiv RQ (无 / 有 CI) 83.7 / 90.2 78.4 / – 85.8 / 85.9 78.8 66.0 / –
OmniDocBench 1.5 91.1 89.4 91.4 75.8 86.6
RealWorldQA 85.9 84.1 86.9 73.9
ERQA 65.5 62.5 69.8 40.8

:pushpin: 多模态 Agent 优势显著:OSWorld 提升 20.4 分、WebArena 提升 16.0 分、Vision2Web 提升 17.9 分——在「操作界面」「视觉上下文构建软件」等混合 Agent 任务上达到或超越 Opus 4.6 Max。

第三方独立评分

数据来源:Artificial Analysis Intelligence Index(第三方独立基准)

Artificial Analysis 把 Qwen3.8-27B 评为 Intelligence Index = 52,与 GPT-5.6 Luna(max)持平,仅落后 GLM-5.2(max)和 DeepSeek V4 Pro(max)各 1 分——而这两者都是数千亿参数的 MoE 模型。


:test_tube: 独立测评

1. MS Paint macOS 重建(来源:YouTube @Pavlo Khmel HPC)

测试:用单条 prompt 让 Qwen3.8-27B-FP8 创建 macOS 原生版本 MS Paint。

结果:white_check_mark: 完全可用

  • 画笔、颜色、大小、形状全部正常
  • 撤销/重做、填充、保存/另存为都工作
  • 整体水平与 GLM 5.2 不相上下
  • 即使是 27B FP8 量化版本也能完成这种复杂桌面应用开发

2. RTX 5090 本地跑分(来源:Alex Finn @ X)

测试:在 RTX 5090(32GB)上跑 Qwen3.8-27B,与 Opus 4.8 / Opus 4.6 对比。

结果

  • 本地超过 Opus 4.8(Alex Finn 自己的基准)
  • 略输 Opus 4.6
  • 速度最高 200 tokens/秒
  • 单卡即可提供 Opus 4.8 级别智能

来源:@AlexFinn on X — 2,254 赞,146 转发

Alibaba_Qwen 官方回复:「看到 27B 稠密模型在单卡 5090 上提供前沿智能,令人惊叹。」

3. M5 Max MacBook Pro 实测(来源:@TeksEdge @ X)

测试:在 Apple M5 Max(统一内存)上通过 oMLX + DFlash 2 跑 Qwen3.8-27B-4bit。

结果

  • ~70 tokens/秒 输出速度
  • 使用 DFlash 2 投机解码,在保持目标模型输出的同时显著加速
  • 苹果生态用户已可通过 oMLX 直接运行

4. 显存占用实测(来源:@CMay @ Hacker News)

测试:在 RTX 4090(24GB)上用 Q4_K_M 量化跑 Qwen3.8-27B。

结果

  • 32K 上下文约占用 2.5GB VRAM
  • 比 Gemma 4 31B 显存效率略低,但智能密度更高
  • 单卡 24GB 可用,但不能跑满 256K 原生上下文

5. Kingy AI 全面评测(来源:kingy.ai)

结论:Qwen3.8-27B 在 24GB 显卡上以量化版运行时表现稳定,但单卡跑满 256K 上下文需要权衡;建议多卡或高端卡用于大上下文场景。Northflank 实测在 SGLang 上的部署配置供参考。

6. 跨模型对比(综合数据)

评测集 Qwen3.8-27B DeepSeek V4 Flash GPT-5.6 Sol Claude Opus 4.8
Terminal-Bench 2.1 73.0 82.7 88.8 78.9
DeepSWE 1.1 42.2 54.4 72.7 59.0
SWE-bench Pro 61.7 - 64.6 Opus 5: 79.2
GPQA Diamond 89.2 - 94.6 92.0

:pushpin: Qwen3.8-27B 对 27B 尺寸而言已经非常接近前沿,但在最难的长程任务上仍被顶级闭源模型压制。考虑到 27B 本地可跑、Apache 2.0 开源,这个成绩相当惊艳。


:money_bag: 价格详情

OpenRouter API 定价

项目 价格(每百万 token)
输入 $0.35
输出 $2.75
上下文窗口 1M
上线时间 2026-08-14

数据来源:OpenRouter Qwen3.8-27B 页面 — 累计已处理 134B tokens

与同类对比

模型 部署方式 输入价格 输出价格
Qwen3.8-27B 本地或 OpenRouter $0.35 $2.75
Qwen3.8-Max Qwen Cloud API $2.00 $6.00

:light_bulb: 性价比炸裂:Qwen3.8-27B 在 OpenRouter 上的价格仅为 Qwen3.8-Max 的 17%,但能覆盖大部分 Agent 任务。


:vs_button: 与竞品对比

同尺寸开源模型对比

模型 架构 模态 上下文 许可证 实用定位
Qwen3.8-27B 27.78B 稠密混合 文/图/视频 262K 原生 / 1M YaRN Apache 2.0 同尺寸新王者,官方 BF16/FP8
Qwen3.6-27B ~27.8B 稠密 文/图/视频 262K 原生 Apache 2.0 直接前代,量化生态成熟
Muse Glimmer-30B ~29.6B 稠密 文/图 131K+ Apache 2.0 最接近的尺寸对标
Gemma 4 31B ~31B 稠密 文/图 256K Apache 2.0 Google 阵营对标
Mistral Small 4 119B 总参 / 6.5B 激活 MoE 文/图 256K Apache 2.0 活跃参数少但存储大(~71GB)
DeepSeek V4 Flash 284B 总参 / 13B 激活 MoE 1M MIT 编程强但 ~149GB 显存

关键差异

:pushpin: Qwen3.8-27B 定位:在不依赖数据中心级硬件的前提下,提供接近前沿的多模态能力,特别适合本地编码 Agent、文档分析、私人研究、多模态自动化等场景。

:warning: 关键提醒:「开源权重」≠「完全开源」。Qwen3.8-27B 仅发布权重,训练数据和完整训练 recipe 仍未公开


:light_bulb: 适用场景

  1. 本地编码 Agent:在 RTX 4090/5090 上 4-bit 量化即可运行,适合私有代码助手
  2. 多模态文档分析:支持长文档、图表、视频理解,可用于财报审阅、学术论文解析
  3. GUI 操作自动化:OSWorld/WebArena 表现强,可做浏览器/桌面自动化
  4. 研究工作流:长上下文 + 思考控制 + Agent 能力,适合研究助理
  5. 企业内部部署:Apache 2.0 允许商用,可私有化部署
  6. 离线/隐私场景:本地运行,数据不出本地
  7. Mac 用户:通过 MLX + DFlash 2 在 Apple Silicon 上也能跑

:desktop_computer: 本地部署硬件需求

精度 权重占用 实际推荐配置
BF16 官方 51.76 GiB 80GB 级别 (H100 / H200 / RTX Pro 6000)
FP8 官方 28.76 GiB 48GB 级别 (RTX 4090 双卡 / A6000)
Q4_K_M GGUF (第三方) 15.93 GiB 24GB 级别 (RTX 4090)
Q6_K GGUF (第三方) 21.31 GiB 32GB+
IQ4_XS 量化 (Unsloth) 14.6 GB 8GB VRAM + 64K 上下文 (RTX 4060)

:warning: 重要提示:「17GB 可跑」≠「17GB 可跑满 256K 上下文」。权重占用只是开始,KV 缓存、激活值、视觉处理、CUDA 缓冲区等都会占显存。原生 262K 上下文的全注意力 KV 缓存就达约 16 GiB。


:package: 部署与调用

官方推荐路径

框架 用途
Transformers 推理、实验
vLLM 高性能生产部署
SGLang 复杂 Agent 工作流
TokenSpeed 优化推理
llama.cpp Mac / Linux 本地运行
Ollama 一键启动
LM Studio 桌面端运行
oMLX (MLX) Apple Silicon

思考档位选择

档位 适用场景 权衡
low 快速、有限任务 分析少可能增加失败和重试
medium 平衡默认 需具体评估
xhigh 复杂编码、研究、长程任务 默认档位,延迟和 token 消耗最高

:warning: 关键警告:Qwen3.8-27B 默认开启思考档位 xhigh,会消耗大量 token 处理简单请求。首次使用强烈建议手动调整为 medium 或 low,否则会快速烧光 token 预算。

温度参数

  • 思考模式:temperature=1.0,top_p=0.95
  • 非思考模式:temperature=0.7,top_p=0.8,presence_penalty=1.5

:warning: 注意事项

  • 官方 BF16/FP8 权重不含 GGUF:工作站友好的 GGUF 是第三方转换(Unsloth 等)
  • 24GB GPU 不能跑满 256K 上下文:必须权衡权重量化精度和上下文长度
  • Qwen Cloud 托管版尚未上线:官方 API 即将推出
  • 「1M 上下文」是 YaRN 扩展,不是原生支持;启用扩展可能在短上下文上降低性能
  • 训练数据、知识截止日期、后训练 recipe 暂未公开
  • 不是所有场景都适合:HN 社区反馈显示 Qwen 3.8 27B 倾向"过思考"(overthinking),低推理档位下偶有质量问题,建议根据任务选档

:bullseye: 总结

Qwen3.8-27B 是当前最强本地可跑的多模态模型之一——270 亿参数稠密架构,原生视觉语言支持,Apache 2.0 完全商用授权,单 GPU 可部署。在编码 Agent、GUI 自动化、长程任务上达到或超过 Opus 4.6 Max。

适合以下场景:

  • 想要本地跑、又要多模态能力
  • 需要 Apache 2.0 商用
  • 单 GPU(24GB+)可部署
  • 编码 / Agent / 文档分析工作流

下载链接Qwen/Qwen3.8-27B on Hugging Face

模型博客Qwen3.8-Max: A New Bar for Coding and Cowork(注:博客讲的是 Max 模型,27B 数据在 HF 模型卡上)

第三方独立评测Artificial Analysis | Kingy AI 评测 | Yotta Labs 评测 | Northflank 评测

社区讨论HF Discussions | HN 讨论 | @AlexFinn on X