据 Hugging Face 博客 2026 年 10 月 2 日消息,Ai2 开源了 AstaBrief 8B,这是一个把研究问题和检索到的文献摘录转化为带引用报告的科学报告生成模型。该模型已在 Ai2 的科研智能体平台 Asta 的“生成报告”功能中以 Fast 模式上线,与 Claude 驱动的 Thinking 模式并列提供;开源旨在让研究人员下载并自行运行模型,加快带引用科学报告生成。

AstaBrief 的模型权重和训练数据将一并开源。Ai2 同时发布一个示例工作流,研究人员可据此改编,从自己的 PDF 生成报告,作为本地报告生成的起点。博文称,开源权重可让机构在自有基础设施上运行 AstaBrief,这对于研究问题涉及敏感或未发表工作时是必要的。

据博文介绍,Ai2 希望帮助科学家更快生成带引用报告,并提供可下载、可自行运行的模型。为此,他们测试一个小型、专门为科学报告生成训练的开源模型能否在报告质量上匹配此前使用的专有模型,同时减少生成时间和服务成本。AstaBrief 8B 从 Qwen3-8B 起步,项目重点放在后训练数据、评估和报告生成外围框架上。

训练方面,AstaBrief 使用数万条真实研究查询、以引用为中心的过滤和偏好数据,并采用重新设计的报告生成流程,一次性写出完整报告,而不是逐节生成。Ai2 没有选择基于强化学习的训练路径,尽管其 DR Tulu 等近期工作显示,强化学习方法可以改善开放权重模型的长文报告生成,尤其当评委模型参与训练循环时。Ai2 最终采用监督微调(SFT)和直接偏好优化(DPO),原因是强化学习训练可能不稳定且昂贵,他们希望用更便宜、操作上更可管理、也更容易调试和迭代的方案,看看报告生成质量能推进到什么程度。

这一选择使训练数据质量变得尤为重要。博文称,项目大部分时间用于弄清如何生成、选择和过滤能够真正展示目标报告写作行为的示例,而不是依靠更复杂的优化方法来补偿噪声样本。

性能数据方面,博文称,相较其所追踪的专有模型,AstaBrief 带来报告生成时间近一个数量级的减少。在完整 Asta 流程中,Fast 模式平均每份报告耗时 51.1 秒,Thinking 模式为 178.5 秒,前者约快 3.5 倍。

博文还说明,所述训练和评估大部分在 2025 年完成,用于生成训练数据和作为比较点的专有模型反映当时的前沿水平。他们没有针对当今前沿模型重跑完整评估,因此相关结果最好被理解为对所测试的特定训练和系统设计选择的证据。Ai2 表示,正通过 NSF OMAI 等项目,广泛探索把通用模型适配到科学工作以及从零训练新的科学模型,并与科学社区合作了解未来开放模型需要满足哪些要求、当今通用模型在哪些方面存在不足。