一句话核心:9 月 18 日,阿里千问上线新一代原生全模态模型 Qwen3.8-Omni-Flash——文本、图像、音频、视频四类输入统一处理、支持 1M 上下文。真正值得算的是价格:在阿里云百炼的官方定价页上,它的输入单价是 0.8 元/百万 Token,且四种模态统一;而上一代 qwen3.5-omni-flash 的音频输入是 18 元/百万 Token——同一类内容,降幅超过 95%。
背景脉络
「全模态」在今年的国产模型里不算新词,但此前的普遍做法是按模态分别计价:文本便宜,音频、视频因为 token 转化率与算力开销不同而明显更贵。这在产品设计上直接推高了一类应用的边际成本——语音/视频交互类 Agent,因为它们的输入天生集中在最贵的那一档。
Qwen3.8-Omni-Flash 的变化正落在这个点上:不是「又支持了一个模态」,而是把四类输入的单价拉平。对做多模态应用的团队,这比基准分更直接地改变成本结构。
关键细节
- 输入侧:文本、图像、音频、视频四类输入统一按 0.8 元/百万 Token 计价(阿里云百炼官方定价页,qwen3.8-omni-flash,中国内地部署)。
- 输出与缓存:输出 2.7 元/百万 Token;缓存命中输入 0.1 元/百万 Token——缓存价是普通输入的 1/8,明显是为长上下文与重复前缀场景设计的。
- 能力口径:原生全模态,支持 1M 上下文,已在千问 AI 平台提供(据 IT之家 9 月 18 日报道)。
价格对比:这次到底降了多少
| 项目(元/百万 Token) | Qwen3.5-Omni-Flash(上一代) | Qwen3.8-Omni-Flash(本次) | 变化 |
|---|---|---|---|
| 文本 / 图片 / 视频输入 | 2.2 | 0.8(各模态统一) | 降约 64% |
| 音频输入 | 18 | 0.8 | 降约 96% |
| 文本输出 | 13.3 | 2.7 | 降约 80% |
| 文本 + 音频输出 | 72 | —(本次定价页未列该组合项) | — |
| 缓存命中输入 | —(上一代定价页未列) | 0.1 | — |
(以上均为阿里云百炼官方定价页的口径,单位人民币,按实际用量计费。)
怎么读这三行数字:
- 最值钱的是音频那一行。输入侧从 18 元拉到 0.8 元,等于把此前最贵的输入模态变成了与文本同价。对语音助手、会议转写、实时对话这类「输入以音频为主」的应用,输入成本直接降到原来的 1/20 量级——这是本轮最实质的变化。
- 输出仍然不便宜:2.7 元/百万 Token 是输入的 3.4 倍。全模态模型的输出仍是文本,长回答、长报告类负载的成本主要由这一项决定。
- 缓存价 0.1 元是关键设计:它比输入便宜 8 倍,意味着「同一份长上下文反复调用」的场景(长文档问答、长视频理解)实际单价会远低于标称输入价。
价格与使用成本
- 计价方式是按实际 Token 用量,输入与输出分别计价,另有缓存命中价;官方定价页同时列出「缓存命中输入单价」列为 0.1 元。
- 本次未见到促销价或限期折扣的说明;官方定价页也注明「本文仅展示模型调用原价,请前往百炼控制台查看活动优惠」——实际结算价可能低于原价,需以控制台为准。
- 免费额度遵循百炼通用规则(自开通或模型发布之日起 90 天内有效),具体额度未在本次核对范围内。
辩证评估
- 对做语音与多模态 Agent 的团队:输入侧拉平是明确的利好,尤其是此前被音频单价挡住的场景——实时语音交互、录音批量理解、带语音的视频内容处理。这类应用的输入成本判断需要重做。
- 对做长上下文应用:0.1 元的缓存命中价意味着「大文档/长视频 + 多轮追问」的单价结构变了,评估时应把缓存命中率作为一等变量。
- 反向视角:其一,「全模态」是能力口径,本轮没有第三方测评,四类输入的实际理解质量(尤其是音频与视频)尚无独立验证;其二,输出 2.7 元并不便宜,如果应用以长输出为主,整体成本可能不降反升;其三,输入统一价的token 计算规则仍需按官方《计费与限流》文档核对——音频与视频如何折算成 token,直接决定最终账单;其四,本次未见官方对模型规模、训练细节与开源计划的披露,能力边界需要自测。
已知 vs 待验证
官方已证实(阿里云百炼定价页):qwen3.8-omni-flash 在中国内地部署;输入 0.8 元/百万 Token、缓存命中输入 0.1 元/百万 Token、输出 2.7 元/百万 Token;上一代 qwen3.5-omni-flash 的对应价格为文本/图片/视频输入 2.2 元、音频输入 18 元、文本输出 13.3 元、文本+音频输出 72 元。
待核实:能力与效果数据(本轮采集到的「提升」类数字均为厂商口径,无第三方复现);音频/视频折算为 token 的具体规则;活动优惠后的实际结算价;模型规模与是否开源。
给读者的建议
- 做语音或多模态交互的产品:先按新价重算一次单位成本,再决定是否把之前因音频价格而搁置的功能放回路线图;注意把「输出占比」纳入模型,别只看输入单价。
- 做长文档/长视频理解的团队:优先验证缓存命中率——缓存命中 0.1 元与未命中 0.8 元之间是 8 倍差,缓存策略的收益比换模型更大。
- 正在做模型选型的团队:这次更重要的是计价方式的变化(统一输入价 + 明确缓存价),把它作为对比其他厂商全模态模型的统一口径再算一遍。
- 暂不建议的场景:对音频理解质量要求极高、且无法接受厂商自测口径的业务,建议等第三方测评或自行跑一套评测集再上。
来源
官方来源
- 阿里云百炼模型调用价格(含 qwen3.8-omni-flash 与 qwen3.5-omni-flash 定价表):阿里云百炼模型价格-大模型服务平台百炼(Model Studio)-阿里云帮助中心
独立来源
- IT之家《阿里发布 Qwen3.8-Omni-Flash 全模态模型:音视频能力提升,百万 Token 图文音视频输入 0.8 元》(2026-09-18):阿里发布 Qwen3.8-Omni-Flash 全模态模型:音视频能力提升,百万 Token 图文音视频输入 0.8 元 - IT之家
