AstaBench:用科学研究套件严格评测 AI 智能体(ICLR 2026)

原题:AstaBench: Rigorous Benchmarking of AI Agents with a Scientific Research Suite

一句话总结:AstaBench 把 11 个基准、2,400 多道题和统一的文献/计算工具放进同一成本可追踪环境,控制「模型能力还是工具/预算优势」这一核心混杂因素;57 个智能体、22 类架构的结果显示 Asta v0 总分 53.0、比 ReAct+GPT-5 高 9.0 个百分点,但端到端科研即使逐步完成率最高约 70%,完整任务成功率仍最高仅 5%(§3–5,表 4、10、20)。

问题与动机

科学智能体的评测长期混合了三种变量:底层模型、智能体脚手架,以及可访问的搜索语料和计算工具。不同系统在各自环境中报告分数,既无法确定收益来自规划还是更强的信息源,也无法在 API 价格变化后比较成本;许多基准又只覆盖科研流水线中的单点能力。作者因此将问题定义为:如何在统一、可复现且考虑成本的条件下,横跨文献理解、代码执行、数据分析和端到端发现来比较科学智能体(§1)。

AstaBench 汇集 11 个基准、2,400 多个问题,既复用 LitQA2、CORE-Bench、DS-1000、DiscoveryBench 等任务,也新增 PaperFindingBench、ScholarQA-CS2 和 E2E-Bench 系列。它不是一个自动科研系统,而是一套基准 + 环境 + 评测工具包 + 基线智能体;因此它与 AI-Scientist-arXiv24AutoScientists-arXiv26 的关系是测量者与被测系统,而非同类发现流水线(§3–4)。

关键观察 / 隐含假设

  • 观察 1:不控制工具和推理成本,智能体排名无法归因于核心智能体核心能力。 Asta Environment 为同一任务提供日期冻结的 Asta Scientific Corpus 或统一 Computational Notebook,智能体评测再用冻结的 LiteLLM 价格快照换算成本(§4.1–4.2)。
    • 依赖假设:相同工具接口和 corpus cutoff 足以消除主要的信息访问差异;模型提供商未报告或价格表未覆盖的服务差异不会显著改变排名。
    • 可能失效场景:真实科研中 corpus、新软件和硬件持续变化;冻结环境提高可复现性,却可能低估善用最新知识和异构实验设施的系统。
  • 观察 2:科研链条存在强烈的 compounding 失败。 E2E-Bench 每项约 10–15 个评分细则步骤,单步完成率最高约 70%,但完整任务成功率最高仅 5%(§5、附录 E.9,表 10、20)。
    • 依赖假设:评分细则步骤的完备性和 LLM 评审器对报告、代码、产物三类证据的判定足以代表真正完成科研任务。
    • 可能失效场景:评分细则遗漏关键科学错误时会高估成功;过细或高度相关的步骤又会放大乘法式失败。
  • 观察 3:专用科学工具带来显著收益,但工程与推理成本同时上升。 Asta v0 总分 53.0,高于 ReAct+GPT-5 的 44.0;前者每题平均成本 $3.40,后者为 $0.31(§5,表 4)。
    • 证据强度:中。统一基准支持直接比较,但 Asta v0 是针对任务类别路由的专用模块 mixture,收益无法分解为工具、路由和各专用模块的独立贡献。
  • 假设 1:把异质基准的规范化得分作宏平均,可以形成有意义的「整体科研能力」。
    • 证据强度:弱到中。它便于排行榜排序,但文献 QA、代码复现和开放发现的分数 semantics 不同;一个总分不能说明系统是否能完成任一真实科研项目。

核心方法

AstaBench 将科研能力拆成四类:Literature Understanding、Code & Execution、数据分析、端到端发现。任务既包含 MLE-Bench-ICLR25 所代表的 ML 工程邻近能力,也覆盖论文检索、长答案引用、数据驱动假设与完整研究报告。各任务通过统一 Inspect 接口暴露,允许 ReAct 等通用智能体直接接入(§3,表 2)。

Asta Environment 提供两类标准工具。Asta Scientific Corpus 通过 MCP 暴露文献搜索、snippet、论文/作者/引用查询,并能按基准创建日期截断返回结果以减轻未来论文污染;Computational Notebook 提供有状态 Python、壳层和隔离沙箱。这个设计直接回应观察 1:智能体可以不同,但信息源和执行边界保持一致(§4.1)。

智能体评测在 Inspect 日志上增加基准套件、排行榜和时间不变的成本核算。排行榜还显式标记智能体开放性与工具配置:开源/闭源,以及标准工具、等价自定义接口或完全自定义工具。它没有把不可控系统伪装成严格同组,而是将可比性作为结果维度公开(§4.2,附录 B)。

智能体基线提供 16 类标准接口智能体;论文实验进一步覆盖 57 个智能体实例和 22 类架构。Asta v0 先根据输入字符级重叠识别任务类别,再路由到论文 Finder、Scholar QA、DataVoyager、Panda、ReAct 等专用模块;验证集合上路由准确率为 100%,但这也使其成为任务感知 mixture,而非未知科研任务上的通用规划器(附录 F.7)。

端到端任务的评分器用任务专属评分细则,分别检查生成报告、代码和产物。只有三类证据一致且至少一类明确满足时才记为完成;开发集抽查 50 个评分细则 item,LLM 评审器与人工判断一致率为 92%。这种多证据检查比只读论文文本更能压低编造误报,但仍不是完整的科学正确性验证(附录 F.9,图 10、表 21)。

设计取舍

  • 可复现环境 vs 真实开放世界:冻结 corpus cutoff、工具和价格让时间点之间可比,但牺牲对最新论文、非标准实验设施和真实团队协作的覆盖。
  • 覆盖广度 vs 总分可解释性:11 个基准覆盖科研链条,却把不同指标的标准化分数聚合为一个宏平均;总分适合导航,不适合当作「完成科研」概率。
  • LLM 评审器的可扩展性 vs 评价偏差:开放答案和端到端任务必须依赖评分细则评审器;ScholarQA-CS2 的系统级 Kendall τ 为 0.467,排除 Elicit 后才升至 0.800,说明评审器排名对输出风格/系统具有可见偏差(附录 E.3)。
  • 专用模块路由 vs 通用性:Asta v0 获得最高总体分,但需要较高工程成本和任务类别先验;分布外科研任务的路由与专用模块覆盖率未被测试。

实验与结果

  • 在能覆盖全套任务或至少完整类别的智能体中,Asta v0 总分 53.0、每题平均成本 $3.40;ReAct+GPT-5 为 44.0/$0.31,ReAct+o3 为 39.4/$0.16,开源权重最佳 Smolagents+Llama-4-Scout 仅 11.1/$0.11(§5,表 4)。
  • ReAct+GPT-5-mini 以 $0.04/题得到 31.6,总分比 Asta v0 低 21.4 个百分点但成本低约两个数量级,是低成本 Pareto 点;较弱模型可能因更多步骤或循环而比昂贵模型总成本更高(§5,图 2、表 4)。
  • Code & Execution 仍是瓶颈:SUPER-Expert 上除 ReAct+GPT-5(41%)和 GPT-5-mini(37%)外,其余智能体均低于 25%;数据分析的 DiscoveryBench 最高仅 34%(§5,表 8–9)。
  • Literature Understanding 相对成熟:ScholarQA-CS2 的 Asta Scholar QA、Elicit、SciSpace Deep 评审均约 85% 或更高;但 ArxivDIGESTables-Clean 最佳 recall 仍约 43%(§5,表 6–7)。
  • E2E-Bench 的平均评分细则-步骤完成率最高约 70%,完整任务成功率最高仅 5%;三类产物联合评分还纠正了 16%「报告声称完成但代码/产物不支持」的潜在误报(§5,附录 F.9,表 10、20–21)。
  • GPT-5 相对 o3 在多数基准只提升 0–5 个百分点,但在 ScholarQA-CS2、SUPER-Expert、LitQA2-FullText-搜索、E2E-Bench-Hard 分别提升 13.4、24.8、25.3、21.1 个百分点;同一模型升级对专用模块智能体反而常降分(§5,表 5–10)。

论断—证据表

论断证据评测边界置信度
统一工具与成本核算能更严格地比较科学智能体§4.1–4.2,表 2,附录 B日期冻结的文献语料、统一 notebook、冻结 API 价格;不覆盖真实开放实验设施
专用科学工具与路由能显著提高总体得分§5,表 411 个基准的宏平均;Asta v0 为 53.0,ReAct+GPT-5 为 44.0
当前智能体距离完整端到端科研仍很远§5,附录 E.9,表 10、2050 个 AI/NLP E2E 任务;逐步最高约 70%,完整成功最高 5%
开放权重智能体与闭源模型智能体仍有巨大差距§5,表 4最佳开放权重配置为 11.1,Asta v0 为 53.0;架构与模型同时变化
LLM 评审器结合多种产物评分能减少虚假完成附录 F.9,图 10、表 21人工抽查 50 个开发集评分项,准确率 92%;仍有过度乐观和概念细节错误

批判性分析

论证链条

论文从「现有评测混入工具、成本和接口差异」出发,给出标准环境、成本账本和多架构基线,逻辑链条完整;尤其把分数-成本 Pareto 前沿和开放性/工具配置状态同时公开,比只报最高分更有解释力。较大的跳步是将跨任务宏平均命名为 holistic 科学研究 ability:AstaBench 确实覆盖更多阶段,但覆盖多个代理任务不等于验证一个智能体能形成新颖且正确的科学结论。

E2E-Bench 的完整成功率是最有力的反证性结果:高单步分数不会自动组合成可靠科研闭环。另一方面,其 50 个任务由 2021 年后高引 ACL 论文两两组合、LLM 生成并经人工修订而来,测到的是软件型 AI/NLP mini-project;不能外推到湿实验、理论证明或需要多年数据采集的科学。

假设压力测试

统一工具假设在排行榜中成立,但生产环境科学家通常依赖持续更新的数据库、组织内数据和特殊仪器。智能体若通过发现并整合新工具创造价值,在 AstaBench 中反而可能因「fully custom」失去严格可比性。相反,熟悉 Asta API 或任务分布的专用模块会获得结构性优势。

成本报告冻结 token 单价,但不包含开发专用模块的工程成本、服务延迟折扣、人工监督和基础设施摊销。Asta v0 的 $3.40/题不能与 ReAct 的 $0.31/题解释成总拥有成本的 11 倍;它只表示论文定义下的推理开销。

实验可信度

57 个智能体、22 类架构、95% CI 和完整成本 logs 提供了罕见的覆盖度。任务评分却混合 programmatic 评估器和 LLM 评审器;ScholarQA-CS2 的人工一致性只有中等,留出评分细则还使部分系统平均下降 2.5 分,表明 pooled-answer 评分细则存在 held-in bias(附录 E.3)。端到端评分器的 92% 是 50 个评分细则 item 的 dev 抽查,不足以证明对所有科学错误稳健。

基线比较对标准接口智能体较公平,但闭源 UI/API 系统不能执行全类任务,于是「整体榜」主要比较作者可运行的通用智能体。模型升级与脚手架交互显著,论文正确提醒不能把底模 SOTA 当作智能体 SOTA;不过没有 factorial 设计分离模型、工具、路由器和专用模块提示词的贡献。

系统性缺陷

Asta Scientific Corpus 是可复现性的关键依赖,也形成集中式基础设施风险:语料覆盖、索引版本、API 可用性和长期维护会决定基准能否真正复跑。论文未讨论 corpus outage、沙箱隔离故障、恶意论文内容对智能体的提示词注入,以及长任务的检查点与恢复 SLO。

排行榜允许 custom 工具配置并做显式标记,而不是完全禁止;这提高生态兼容性,却意味着不同开放性/工具配置桶之间不可直接解释成同一受控实验。Asta v0 的字符重叠路由在验证上 100% 正确,也可能利用固定任务措辞,面对自然研究请求的鲁棒性没有证据。

局限与后续工作

  • 局限 1:2,400 多题不等于 2,400 个开放科研项目;大量任务仍是检索、QA、代码和结构化数据代理目标,科学新颖性与长期复现覆盖不足。
  • 局限 2:E2E-Bench/E2E-Bench-Hard 来自 AI/NLP 论文种子并依赖 LLM 评审器,领域与评估器外部有效性有限。
  • 局限 3:宏平均总分掩盖能力形状;53.0 分的智能体仍可能在某个真实任务所需的关键步骤上接近零。
  • 后续工作 1:在同一组隐藏任务上做模型 × 脚手架 × 工具的 factorial 消融实验,报告各因素对分数、成本和方差的独立贡献。
  • 后续工作 2:用独立专家盲审至少 500 个端到端评分项,并分领域报告误报率和漏报率,而不是只给出 92% 的总一致率。
  • 后续工作 3:加入污染抵抗的滚动新题、人类协作任务和 biomedicine 等领域,同时保留可版本化的语料快照。
  • 后续工作 4:为长任务增加 checkpoint、失败恢复、资源冲突和提示词注入 测试,使环境从功能基准扩展到研究-智能体可靠性基准。

相关