AI 快讯 | NeoHorse-1:首个 Agent-Native 模型发布,RSI 递归自改进闭环首次验证

AI 快讯 | NeoHorse-1:首个 Agent-Native 模型发布,RSI「执行经验→模型能力」闭环首次验证

:fire: 一句话核心:基元律动联合无问芯穹、清华、北大、港中文、阿里发布自研 Agent-Native 模型 NeoHorse-1(4B/9B 两版),训练数据来自 Harness 结构化执行轨迹而非传统问答语料,4B 版本在多个 Agent 子任务上同规模第一,并首次跑通 RSI(递归自改进)——「模型执行任务→产生轨迹→反哺训练」的闭环。


:key: 为什么「Agent-Native」这个词值得认真看

传统模型训练逻辑是「海量文本预训练 → 指令微调 → 聊得好就是好模型」。但 Agent 场景不一样——Agent 不是来聊天的,是来完成任务的。它需要调用工具、处理错误、理解环境反馈、在多轮中保持目标不漂移。

NeoHorse-1 的训练数据不是「人写的问答对」,而是 Harness 框架里真实 Agent 执行轨迹——包含了工具调用成功失败、错误恢复路径、多轮状态变化。这意味着这个模型从第一天就是在「做事」而不是「说话」的环境里训练出来的。


:bar_chart: 关键数据

项目 NeoHorse-1-4B NeoHorse-1-9B
Agent 子任务宏平均 64.87(4B 同规模第一) 69.04
后训练增益 集中于 Agentic 任务 底座 65.60→69.04
核心能力 工具调用、任务规划、代码生成 复杂推理、长程规划
开源 ✓ ✓

:counterclockwise_arrows_button: RSI 闭环:这次的方法论突破比参数更重要

NeoHorse-1 的论文同时验证了两条 RSI 路径:

  1. Data-RSI:模型在 Harness 里执行任务 → 产生轨迹数据 → 轨迹成为训练语料 → 喂给下一轮模型
  2. Model-RSI:评测定位短板 → 调整训练数据配比 → 更新模型 → 放回 Harness 继续执行并验证

这相当于在实验室里验证了「Agent 用得越多、变得越好」的逻辑——不是靠更大的预训练语料,而是靠自己的执行经验。

对积木云这类 Agent 平台来说,这个思路天然匹配「多 Agent 协作产生大量执行轨迹 → 轨迹反哺模型能力」的场景。虽然 4B/9B 的规模还远不足以替代通用基座,但路径被跑通了,剩下的就是把同样的方法论推到更大规模。


:warning: 适用边界

  • 当前是在 4B/9B 小规模上验证的方法论,离直接商用还有距离
  • 「同规模 SOTA」是有意义的,但不能和 GPT-6 Astra 这类千亿参数模型比绝对能力
  • RSI 闭环的「改进幅度」和「收敛速度」还需要更多轮次的公开数据

来源链接