AI 快讯 | Ai2 开源 AstaBrief 8B:把科学报告生成的配方连着数据一起放出来

AI 快讯 | Ai2 开源 AstaBrief 8B:把科学报告生成的配方连着数据一起放出来

:fire: 一个 8B 的小模型,把「研究问题 + 检索到的文献片段」变成带引用的报告,整条流水线平均 51.1 秒出一份。更值得看的不是速度,是 Ai2 把训练配方和训练数据一起放了出来。

它开放的不只是权重

AstaBrief 的权重放在 Hugging Face(allenai/AstaBrief_8B),训练数据同批开放,另外附一份示例工作流,让研究者可以用自己的 PDF 生成报告。

它的基座是 Qwen3-8B,产品侧已经在 Ai2 的 Asta 里以 Fast 模式上线。

速度来自「一次成文」

官方口径是:整条 Asta 流水线上,Fast 模式平均 51.1 秒出一份报告,Claude 驱动的 Thinking 模式要 178.5 秒,约快 3.5 倍。

做法是直接一次成文,跳过摘要与聚类那一套多步流程。

AstaBrief 的流水线耗时与训练配方

图 1:AstaBrief 的流水线耗时、训练配方与评测口径。自制图。来源:Ai2 官方博客(2026-10-02),速度与评测均为官方口径。

配方长什么样

训练数据来自真实科研查询:过滤后约 9 万条,据此生成 4.7 万条 SFT 样本。

偏好对齐用 DPO,约 6000 组偏好对,两组裁判(GPT-4.1 与 DeepSeek-R1)意见一致才保留,与人类偏好的一致率 95%。

评测用了 SQABench-CS2(200 个用户自拟的计算机问题)与 DeepScholarBench(63 条),另加一个 14 题、3 位科研人员参与的小样本人类偏好研究。

采信前要打两处折

第一处是时点:训练与评测大部分在 2025 年完成,用来做对比的专有模型反映的是当时的前沿,官方明确说没有对今天的前沿模型重跑完整评测。

第二处是人类研究的结论:整体偏好上 DR Tulu 胜出,只有在引用准确性这一项上,3 位研究者中有 2 位更偏好 AstaBrief。

全部结果都是官方自测,没有第三方复现。

谁适合试

如果你的团队在做科研检索或自动出报告,想把这套放进自己的环境(可自建、可放防火墙内),它是一个可以直接上手的基线:权重、数据、工作流都在。

但它不是「当前最强」那一类。评测时点落后约一年,采信时按官方自陈打折。

来源链接

官方来源

独立来源

  • 目前没有第三方评测或复现