AI 快讯 | H Company 开源 Holo4:27B/35B-A3B 的跨界面 computer-use agent,并公开全部轨迹

:fire: 一句话核心: H Company 在 2026-09-28 开源 Holo4——27B dense 与 35B-A3B MoE 两个尺寸的「跨界面」计算机使用 agent,同一个模型同时会用 GUI 点击输入、写并运行代码、调用 MCP 或 API;权重已上 Hugging Face(BF16/FP8/NVFP4/4-bit GGUF),并且把公开基准上的全部轨迹也一并开源。官方自报 OSWorld 2.0 得 61.7%(27B)/30.9%(35B-A3B),对照 Opus 5.5 为 81.8%,全部为厂商自测。

背景脉络

「计算机使用(computer use)」这条线上,此前站得住的开源大件不多:要么是单界面的——只看屏幕的模型没有屏幕就瞎,偏好工具调用的模型碰到没有 API 的软件就卡住;要么参数大到普通团队跑不动。

Holo4 值得单独写,原因有两个,都不是「又开源了一个模型」:一是它把「跨界面」做成了同一个模型的能力;二是它把支撑分数的轨迹全部放了出来。

关键细节

1)两个尺寸,一套调用方式。 Holo4-27B(dense)与 Holo4-35B-A3B(MoE),两者都在 H Models API 上提供。官方自述它跑在桌面、网页、Android、代码沙箱与业务 API 上,是同一个模型、同样的调用方式,不需要按平台选模型。

2)权重与轨迹都放出来了。 权重在 Hugging Face 上提供 BF16、FP8、NVFP4 与 4-bit GGUF 四种格式;同时官方把公开基准上分数背后的每一条轨迹全部开源,可在 trajectories.hcompany.ai 逐步回放,或从 HF 数据集下载。对我们这条线来说这是最值得记的一点——我们此前报过的多数厂商只给分数,给轨迹意味着「分数是不是真的」第一次变成可以逐步复核的问题。

3)训练与 harness 都重做了。 数据侧由内部 Agentic Task Factory 仅凭文档(真实网站截图或开源软件)生成约 10,000 个任务,覆盖 web 应用、MCP server 与桌面环境,含同时暴露 GUI 与 MCP 的混合环境;训练侧 SFT 用了 127B tokens,随后两轮 RL。harness(执行模型动作、管理上下文的循环)最大的两处改动是给 agent 一个能记住数百步的可靠记忆,以及在桌面机器上给它一个 shell。

图 1

图 1:Hugging Face 官方博客页(页载 Published September 28, 2026),我们于 2026-09-28 自取。

图 2

图 2:Holo4-27B 模型页,我们于 2026-09-28 自取;标签区显示许可证为 cc-by-nc-4.0,模型摘要给出基座、上下文与目标环境。

参数与基准解读

项目 官方所载
尺寸与基座 Holo4-27B(dense,基座 Qwen3.8-27B)/Holo4-35B-A3B(MoE,基座 Qwen3.6 MoE)
形态 Visual Language Model(VLM);接口含图形界面、代码与工具调用
上下文(模型页 config) 262,144 tokens
权重格式 BF16、FP8、NVFP4、4-bit GGUF
OSWorld 2.0 Holo4 27B 61.7%;Holo4 35B-A3B 30.9%;对照 Opus 5.5 81.8%(均为厂商自测)
同页对照(官方脚注) Opus 5 70.2%、GPT-5.6 Sol 66.2%(取自 OpenAI 发布图中的 max-effort partial rewards,v2026.08.08 离线集)
衍生模型 Holotron4 Nano,把同一套后训练栈套用到 NVIDIA Nemotron 3 Nano Omni
许可证(模型页标签) cc-by-nc-4.0

关于这张表要说清三件事:

  • 这些都是厂商自测,本场没有第三方复现。官方自己在脚注里写明「Task releases, subsets and harnesses vary.」(各任务集的发布版本、子集与 harness 并不一致)——这句话必须跟着表格一起读,否则数字会被当成同一把尺子量出来的。
  • 61.7% 与 81.8% 相差 20.1 个百分点,这是官方自己承认的位置:「只在最强闭源模型之后,但参数量与成本低好几个数量级」。「低好几个数量级」是官方对成本的描述,而官方博客里成本-性能的横轴是图,我们未能从文本读出具体的每任务成本,所以本文不给成本数字。
  • 第三方转述的「OSWorld 85.2%、每任务 $0.08」我们未在官方博客正文核到(官方正文给的是 OSWorld 2.0 的 61.7%),疑为另一套 OSWorld 口径或出自模型卡。这两个数不要和 61.7% 放进同一张表。

价格与使用成本

官方博客未公布任何 API 单价,两个尺寸可在 H Models API 直接调用。成本上真正要先看的是许可证:Holo4-27B 模型页标注的许可证是 cc-by-nc-4.0(署名—非商业性使用),即非商用——这与「开源」二字给人的直觉不同,企业评估前必须先把许可条款看清。

辩证评估

正面:27B/35B-A3B 这个量级能让单机团队拿去做二次开发;跨界面是真实的产品差异(同一个模型跑桌面、网页、Android、代码沙箱与业务 API);轨迹全开源是这批开源 agent 模型里少见的做法。

反向至少三条:

  1. 它与前沿闭源模型差距不小(OSWorld 2.0 上 61.7% 对 81.8%),官方自己把位置写在「最强闭源之后」。
  2. 榜单是厂商自测,且官方自注各点来自不同 harness 与任务子集。
  3. 许可证是非商用的 cc-by-nc-4.0,商业落地需要另找出路。

另外不要把它读成「Qwen 官方出品」:Holo4 是 H Company 的产品,只是基座用的是 Qwen 系(27B 用 Qwen3.8-27B、MoE 用 Qwen3.6 MoE)。

已知 vs 待验证

已知(官方博客,我们已直取全文;页载 Published September 28, 2026):两个尺寸与各自基座、跨界面定位、权重四种格式、轨迹开源、约 10,000 个任务、SFT 127B tokens 加两轮 RL、harness 两处主要改动、OSWorld 2.0 三个数字、Holotron4 Nano。

我们自行取数:Holo4-27B 模型页标注 License: cc-by-nc-4.0、Model type 为 VLM、Maximum context length in config 262,144 tokens、Target environments 为 Web/desktop/mobile;页面另显示「上月下载 15」——下载量是变动值,只代表该时刻。

未取到/未验证:H Models API 的单价;每任务成本(官方只给图);hai_agents harness 的公开说明;官方称「将在接下来几天发布」的 DSpark drafter checkpoint(截至本篇成稿未见)。

我们未复现:本文所有分数与案例均为厂商自报,我们没有跑过其中任何一项。

给读者的建议

  • 想评估开源 computer-use agent 能不能进你的流程:先按许可证筛——cc-by-nc-4.0 意味着不能直接商用;如果你要商用,真正可比的是闭源 API,或者许可证更宽松的其他模型。
  • 想验证分数:这大概是这类选题里最合适的一条——它的轨迹公开且可回放,你可以挑一两个任务自己逐步看,而不是只信一个百分数。
  • 想拿来做桌面自动化的轻量方案:27B 的规模值得试,但要预期它在长工作流上明显弱于前沿闭源模型。

来源链接

官方来源

独立来源

  • Unite.AI 的相关报道——其「OSWorld 85.2%/每任务 $0.08」等数字我们未在官方博客核到,本文未采用