ToolNavs 发现实用AI工具
提交工具 登录
返回AI资讯
AstaBrief 开源:Ai2 用 8B 小模型写带引用的科研报告,速度快 3.5 倍

AstaBrief 开源:Ai2 用 8B 小模型写带引用的科研报告,速度快 3.5 倍

AI资讯 • Admin • • 6 次浏览

AstaBrief 8B 是 Ai2(Allen Institute for AI)于 2026 年 10 月 2 日开源的科学报告生成模型:给它一个研究问题和检索到的文献片段,它直接输出一篇带引用的报告。模型已在 Ai2 的科研平台 Asta 的"生成报告"功能中上线为 Fast mode,权重和训练数据同步开放,模型托管在 Hugging Face 平台 allenai 组织的 AstaBrief_8B 仓库。

科研报告为什么需要一个专门训练的小模型

科研写作对模型的苛刻之处不在文笔:答案要贴着证据走,不能把某项研究的结论悄悄放大,研究者还要能逐条核查引用是否真的支撑了说法。Ai2 想验证的是,一个基于 Qwen3-8B、只针对报告生成做后训练的 8B 开源模型,能否接近他们此前使用的闭源模型流水线质量,同时把生成时间和服务成本压下来。设计上它一次写完整篇报告,跳过旧流水线里的片段摘要和聚类环节。

训练的关键不在算法,在数据怎么筛

AstaBrief 用的是监督微调加直接偏好优化(SFT + DPO)的常规组合,功夫花在数据上。SFT 样本来自真实科研用户的查询:约 9 万条候选查询经过质量、相关性和隐私过滤后,用 ScholarQA 流水线生成完整报告作为目标输出,留下约 4.7 万条可用样本,生成模型混合了 Claude 3.5 Sonnet、Claude 3.7 Sonnet、o3、o4-mini 和 GPT-4.1。DPO 阶段约 6 千对偏好样本,要求 GPT-4.1 和 DeepSeek-R1 两个评审模型意见一致才保留,两者与人类偏好的一致率达 95%。四个统计过滤器逐一试下来,效果最好的反而是最简单的"引用密度"——合成报告是否持续为论断标注引用;更复杂的过滤组合没有带来额外收益。最终在完整的 Asta 流水线里,Fast mode 平均每篇报告 51.1 秒,Thinking mode 为 178.5 秒,快了约 3.5 倍;在 SQABench-CS2、DeepScholarBench 等评测和一项小规模人类研究中,其答案与引用质量与 Claude 驱动的流水线处于同一水平。

能用在哪里,边界在哪里

开放权重意味着机构可以把 AstaBrief 跑在自己的基础设施上——涉及未发表成果的敏感研究问题不必离开内网。Ai2 还提供了一个可改造的示例工作流,研究者可以拿自己的 PDF 文献生成报告。边界也写得很直白:训练数据和对比基线反映的是 2025 年的前沿模型水平,Ai2 明确表示没有拿当下的前沿模型重跑完整评测;另外,引用"对得上号"不等于结论"没被夸大",把特定样本的发现说成普遍规律这类细微放大,现有指标仍不容易抓到。这篇发布对做科研工具的人还有一层启发:让模型变专业,未必靠往预训练里堆领域文本,后训练数据的构成、以及数据有没有示范"引用要落到实处",同样能实质改变产出质量。

推荐工具

更多