一句话核心:9 月 25 日,两个新的开源「决策模型」同日出现——云知声的 U2-Decision(Qwen3.5-4B 上的 LoRA 决策适配器,Apache-2.0)与社区的 Jev-Omni(12B 多模态决策分类器,Apache-2.0)。加上此前一周的 Jev(专有)、Kev、CLM-8B,「System One/决策模型」这个一周前还属于一家公司的专有品类,已经长成了一个开源生态。而它成形的方式最值得注意:靠的是「协议对齐」,不是「权重复用」——U2-Decision 的 README 写明「协议对齐 Kev:POST /v1/systemone」,它对齐的是社区复刻项目的接口,而不是原厂官方 SDK。

背景脉络
这条线在一周内走完了从「专有」到「生态」的全过程:
TypeSafe 的 Jev(9/15 发布,专有、early access,POST /v1/systemone,模型名 jev-latest)→ 已发 topic 175 → Kev(社区项目,2026-09-17 建仓,Apache-2.0)→ CLM-8B(9/23–24,Apache 2.0 权重)→ 已发 topic 178 → 9/25 的 U2-Decision 与 Jev-Omni。
- 枢纽是 Kev:它的 README 原文写着「The API matches TypeSafe’s System One, so you can point their Python SDK at your local server.」,并称「Drop-in for Jev:TypeSafe 的 Python SDK 可以不改代码直接打到 Kev 服务上」。
- 于是出现了这样一个链条:Kev 镜像 TypeSafe 的接口 → 云知声的 U2-Decision 又对齐 Kev 的接口 ⇒ 官方 SDK 可以直连社区实现。
关键细节
一、云知声 U2-Decision(官方仓库,仓库创建 2026-09-25,Apache-2.0)
- 官方 README 原文:「Qwen3.5-4B 上的 LoRA 决策适配器(candidate-logit)」,对外模型名
u2_decision_preview。 - 三项能力:安全审核(文本三分类 safe/unsafe/controversial)、能力路由(任务 → 能力维度权重 Choice/Noul/Score)、通用决策(choice/noul/score 三类题)。
- 只发布 adapter,不含基座权重(基座需自备 Qwen3.5-4B Instruct);随仓库附三套评测集(安全 holdout500、通用决策 holdout212、能力路由 12)。
- 最关键的一句(README 原文):「协议对齐 Kev:
POST /v1/systemone」。
官方仓库未列出任何性能数字(只有评测脚本与数据集)。
二、社区 Jev-Omni(制品页,Apache-2.0)
- 12B 多模态决策分类器,基座 Gemma 4 12B IT,3 万条问答微调;支持文本/图像/音频/视频输入,输出每个选项的概率(noul/choice/score),不生成解释。
- 自测成绩:DecisionBench Medium(80 场景/293 问)87.57%、JevBench(195 组/231 决策)86.15%、MMAU 63.10%、MVBench 53.10%。
- 速度(H200 热启中位数):文本约 83 ms、图像 26 ms、13 秒音频 31 ms、16 帧视频 504 ms。
- 一条明确限制:最佳支持 ≤20 个选项(头可接受 256,但 20 以上质量未确立)。
- 制品页的免责声明(原文):「It is not affiliated with, endorsed by, sponsored by, or derived from TypeSafe AI or its Jev model, and nothing in it was trained on Jev output.」
数据解读与口径
一、「协议对齐」是这条线最值得记的一点
Kev 镜像 TypeSafe 的接口 → U2-Decision 又对齐 Kev——厂商的开源制品对齐的是社区复刻项目的接口,而不是原厂官方 SDK。这是「接口兼容=事实标准」的一个现成案例:当官方 SDK 能直连社区实现时,切换成本主要落在接口,而不在权重。(我在 topic 178 里只把这一点当作线索,本场它已经长成完整链条。)
二、必须先排掉的两个「同名不同物」
- Jev-Omni 与 TypeSafe 的 Jev 不是一家——制品页有明确免责声明(见上)⇒ 标题与正文都不得写成「TypeSafe 发布 Jev-Omni」;
- U2-Decision 对齐的是 Kev,不是 TypeSafe 官方 ⇒ 别写成「云知声复刻 Jev」。
三、三份性能证据都很弱,不能拼成一张榜
| 制品 | 性能数字 | 性质 |
|---|---|---|
| U2-Decision | 无(仓库未列成绩) | —— |
| Jev-Omni | DecisionBench 87.57%/JevBench 86.15%/MMAU 63.10%/MVBench 53.10% | 作者自测;其对照表中参照分数为各家自报、评测协议可能不同(制品页原文已声明) |
| Kev | Kev-27B 0.848 vs Jev 0.857 | 作者自称非受控:「We don’t know what Jev was trained on, so this isn’t a controlled comparison」 |
⇒ 三者口径不同、参照不同,且 U2-Decision 根本没有数字——不得横向拼接。
四、Jev-Omni 的定位只能是「12B 量级做到多模态决策」
它自己的对照表里,MMAU/MVBench 低于参照模型(Inkling 975B/41B 激活 77.20%、Qwen3.5-397B-A17B 77.60%)⇒ 不得写「领先」;且那两行的分数是各家自报。
五、日期
- U2-Decision:仓库创建时间 2026-09-25T10:25:49Z(GitHub API 一手读数);
- Jev-Omni:制品页未标创建日期,发布日期只有二次来源 ⇒ 写「据二次来源为 9/25」。
价格与成本
三个制品都是开源权重(Apache-2.0),没有 API 定价——成本=自建推理。
对照 TypeSafe 的 Jev(专有 API:输入 $0.042/百万 token、输出免费、early access)。⇒ 一周之内,同一个品类出现了「专有 API」与「多尺寸开源权重」两条路线,成本结构完全不同:一条按量付费、零运维,一条自备硬件、零边际调用费。哪条更便宜取决于调用量。
辩证评估
为什么值得跟:
- 一周之内,一个专有品类长出了有协议、有多尺寸、有多模态、有中文厂商跟进的开源生态;
- 它提供了一个结构性的观察:这个生态靠协议对齐而非权重复用成形——这比「又开源了一个模型」更值得记。
反向视角:
- 三个新制品的性能证据都弱:U2-Decision 无数字;Jev-Omni 为自测且在其对照表里不占优;Kev 的对比作者自称非受控;
- 生态规模仍很小:U2-Decision 仓库刚建(1 星、7 次提交),Jev-Omni 是个人账号下的制品;
- 「协议对齐」目前是自述——本文未逐字段核对 Kev 与 TypeSafe 官方接口的一致性;
- 开源的是权重/适配器,不是训练数据:U2-Decision 只给评测集;Jev-Omni 的数据集权利另计;
- 基座依赖各不相同(Qwen3.5-4B/Gemma 4 12B/Qwen3.5 与 Qwen3.8),许可与能力上界都跟着基座走。
已知 vs 待验证
已证实(一手):
- U2-Decision:仓库创建日 2026-09-25、Apache-2.0、README 全部表述(含「协议对齐 Kev」)、只发 adapter、三套评测集、无性能数字;
- Kev:Apache-2.0、四个尺寸(0.8B/4B/9B/27B)、README 关于「API matches TypeSafe’s System One」与「TypeSafe Python SDK 不改代码可用」的表述、作者对非受控对比的自述;
- Jev-Omni:基座 Gemma 4 12B IT、Apache-2.0、免责声明、自测成绩与速度、≤20 选项限制、校准 ECE 0.0400。
待验证 / 未取到:
- U2-Decision 的性能——仓库未列,不能给任何准确率;
- Jev-Omni 的发布日期——只有二次来源,制品页未标;
- Kev 与 TypeSafe 官方接口的逐字段一致性——未核;
- 三者的第三方独立复测——未见。
给读者的建议
- 想自己跑决策模型的团队:门槛已经很低——Kev 有 0.8B(笔记本可跑)到 27B;U2-Decision 是 4B 基座上的 LoRA 适配器;Jev-Omni 需要约 50 GB FP32 权重与 CUDA GPU。建议先按「尺寸/显存/是否多模态」选型,再谈准确率。
- 做选型与采购的:不要拿这三个制品的自测数字横向拼榜——口径不同、参照不同,而且 U2-Decision 没有数字。
- 关注开源生态的:「协议对齐」比「权重开源」更值得跟踪——如果官方 SDK 能直连社区实现,那么换实现的主要成本在接口,不在权重;反过来,一旦接口变了,生态会一起受影响。
- 内容写作者:不要把 Jev-Omni 写成 TypeSafe 的产品;不要写 U2-Decision「复刻 Jev」(它对齐的是 Kev);不要给 U2-Decision 编任何准确率;不要把三个自测数字拼成一张榜。
来源
官方 / 一手
- 云知声 U2-Decision 官方仓库(README 与 GitHub API 读数,仓库创建 2026-09-25,Apache-2.0):https://github.com/Unisound-LLM/u2_decision_4b
- Jev-Omni 制品页(Hugging Face,含成绩、速度、限制与免责声明):https://huggingface.co/akhilaaa3/Jev-Omni
- Kev 官方仓库(README,含「API matches TypeSafe’s System One」与非受控对比自述):https://github.com/jaredpalmer/kev
独立来源
- 搜狐(云知声,9/25):https://m.sohu.com/a/1080905226_100106801
- 知乎《把类型化决策做到多模态:Jev-Omni》:https://zhuanlan.zhihu.com/p/2086842672816435983
本站相关(背景)
- topic 175(TypeSafe Jev:同品类的专有路线)、topic 178(CLM-8B 开源)、topic 171(COBRA-Skills)、topic 154(平台原生 Skills)
说明:本条主体是 9/25 的两个新制品(U2-Decision、Jev-Omni)与**「协议对齐」这一结构现象**,是 topic 175/178 的续章而非重复。三个制品的性能数字口径不同、不得拼接;U2-Decision 无任何性能数字。配图为其官方仓库页面截图,图注已标来源。