自动科研(Auto-Research)综述
自动科研(Auto-Research)研究如何自动生成、实现、复现或验证研究产物,并让实验或证据反馈改变后续研究动作。智能体只是实现形态之一;程序搜索、研究基准、验证器和证据基础设施同样服务于这个目标。
定义与边界
一篇论文进入核心集合,至少满足以下一项:连接两个以上研究阶段,且反馈会改变后续假设、实现或选择;自动产生算法、模型、证明或系统制品,并有明确的评估器(evaluator);专门评测或保障上述研究循环的执行、证据、选择或恢复。输出可以是科学论断,也可以是经验证、可复用的算法或系统制品(artifact),但不能只是一次模型调用生成的文本。
以下工作只放邻接区:仅负责检索、总结、写作或评审的研究助手;没有科研专用闭环或评测的通用智能体平台;只因运行时间长便自称自动科研的系统;以及只在某个领域使用人工智能、却没有自动化研究过程的应用论文。
“科研智能体(research agent)”不是平级主题,而是本主题中的一种系统形态。AI Scientist、科学家参与闭环和量化研发智能体都可属于这一类;FunSearch、AlphaEvolve、研究基准和验证基础设施则说明,自动科研并不等于“由一个智能体模仿科学家”。
阅读提示:先在六条轴上定位
本页把“闭环”理解为实验或证据会改变下一轮研究动作,而不是简单串联工具。“验证器”是对候选执行明确检查的程序或流程;它可能只检查一个代理分数,也可能检查形式证明或现实实验,强度不可混同。“筛选分母”是生成、执行和丢弃的候选总数,用来避免只看最佳结果。最佳若来自多次独立尝试,还需同时报告在若干次尝试中至少成功一次的概率(pass@k)或取最佳值的方式(best-of-k)。脚手架(scaffold)是包裹模型的任务路由、工具、状态与执行框架,也是影响结果的实验变量。
EviGraph 使用论断支持率(Claim Support Rate,CSR)衡量抽取论断中有证据支持的比例,用实验数据一致性(Experimental Data Consistency,EDC)衡量论文数值与执行记录的匹配程度。BFGS 是用于连续参数拟合的数值优化算法;ReAct 是交替进行推理与工具行动的基础智能体脚手架。
| 轴 | 应问什么 | 容易误读的代理 |
|---|---|---|
| 目标自主性 | 人类给的是完整复现目标、优化指标、宽泛研究问题,还是只有数据与观察对象?智能体能否自行决定什么值得研究? | 把“方法开放”误写成“自主选题” |
| 闭环完整性 | 系统覆盖哪些研究阶段?执行或证据反馈是否真正改变下一轮假设、实现或候选选择? | 把工具链很长或智能体数量很多当成闭环 |
| 输出产物 | 结果是代码、模型、算法、证明、实验发现,还是可公开主张的论断? | 把更高的基准分数自动写成新知识 |
| 验证强度 | 验证的是代理分数、程序确实执行、精确约束、形式命题,还是现实世界科学结论? | 凡是有评估器就称为“可验证发现” |
| 筛选分母 | 总共生成、执行和丢弃了多少候选?最好结果能否被独立重复? | 只报告多次尝试中的最佳值或最终最先进结果(state of the art,SOTA) |
| 人工介入 | 人类在哪些关口提供问题、数据、搜索空间、候选选择、实验操作、结果解释与最终验真? | 只统计智能体内部循环,忽略整轮研究活动之外的再次筛选 |
这些轴不是互斥等级。GEPA、FunSearch-Nature24 和 Co-Scientist-Nature26 都有反馈循环,但分别证明提示词优化、合法数学构造和科学家参与的生物医学发现;三者的验证器、候选分母与知识主张不能放在同一证据格中。任务持续性与恢复问题另见 长程智能体可靠性。
核心论文
研究闭环系统与科学家协作(10 篇)
- AI Scientist — 串联机器学习想法、代码、实验、写作与自动评审;能自动成稿,但主要依赖大语言模型评价大语言模型。
- AI Scientist v2 — 用智能体树搜索扩大实验循环;约 40 个想法经人工跨运行筛到 3 篇投稿、1 篇研讨会论文过线。
- Auto-Research Vision — 给出八阶段研究自动化路线图与局部原型,证明组件可行性而非完整闭环。
- Kosmos — 用结构化世界模型支撑文献与数据的联合分析;抽样论断的支持率高于解释与综合类论断。
- AutoScientists — 用共享最佳方案、论坛、失败登记和动态组队维持多智能体实验状态。
- DeepScientist — 从 4,879 个想法筛到 21 个进展发现;约 60% 抽样失败仍来自实现错误。
- Co-Scientist — 生成并排序生物医学假设,强证据来自专家选择和体外实验,而非无人实验室。
- Robin — 自动化文献、假设和数据分析,湿实验协议、执行与关键决策仍由科学家完成。
- OmniScientist — 让多模态原始证据贯穿选题、实验与写作,并用执行账本约束数字和来源。
- R&D-Agent(Q) — 在量化投研中闭合规格、假设、因子或模型代码、回测、分析与下一轮选择。
可验证算法、模型与机制发现(8 篇)
- FunSearch — 用精确程序评估器搜索数学构造,最终合法性强,但最好结果只在少数独立运行中出现。
- AlphaEvolve — 在数学、算法和生产系统中演化整份代码,以精确检查、性能测试和专家复核分层验证。
- AlphaProof Nexus — 用 Lean 给出形式正确性,题意、新颖性和意义仍由专家判断。
- ASI-ARCH — 从大规模架构实验筛出候选,混合验证器证明的是窄域性能,而非通用发现规律。
- BES — 用反向子目标提供稠密反馈,局部验证器仍可能只是嵌入表示或大语言模型代理分数。
- SR-Scientist — 用数值拟合引导方程搜索,主要重发现已知生成机制。
- MetaMuse — 以多样性和路标反馈生成系统算法,模拟器分数不等于生产正确性或新颖性。
- CausalEvolve — 用结果因子、过程因子和多臂老虎机干预引导程序进化,但近似平均处理效应(average treatment effect,ATE)不构成真实因果识别。
系统制品与执行优化(4 篇)
- GEPA — 在固定任务、数据与反馈函数下反思优化提示词;属于短程系统研发,不是科学发现。
- AdaExplore — 从失败中学习 Triton 程序的有效性技能,再搜索更快的计算内核。
- AVO — 用七天的单条演化谱系改进 B200 注意力计算内核;最终结果强,但模型、成本和复现方差不透明。
- CAKE — 让编译器中间表示(intermediate representation,IR)、验证器与智能体共同演化;在匹配预算下优于直接生成 CUDA 或 PTX 代码。
给定目标的研究执行与复现评测(7 篇)
- MLAgentBench — 测量智能体在给定机器学习任务中规划、执行与迭代实验的能力。
- MLE-Bench — 用 Kaggle 私有排行榜衡量机器学习工程能力;多次运行的成功率强烈依赖重复次数与脚手架。
- MLR-Bench — 测量研讨会级研究任务,暴露结果编造与产物检查缺口。
- PaperBench — 用独立重执行与细粒度评分准则(rubric)测量论文复现,而非自主选题。
- AstaBench — 将研究子任务分解为可执行环境与混合评分准则,端到端成功率仍很低。
- HeurekaBench — 测量已发表单细胞洞见的重发现,不重执行完整工作流。
- ResearchClawBench — 用隐藏目标论文和跨学科数据审计实验规程、证据与结论是否匹配。
选题、长程与反馈机制评测(6 篇)
- RE-Bench — 展示短预算下智能体领先、长预算下人类领先的时间尺度反转。
- InnovatorBench — 在 2–36 小时研发任务中暴露异步作业、过早停止和资源管理失败。
- Beyond Final Scores — 把过程拆成问题构建、执行和反馈控制,并测量经验的正负迁移。
- DDR-Bench — 只给数据库与元数据,让智能体自行决定调查目标与停止时机。
- CausalGame — 用隐藏结构因果模型(structural causal model,SCM)给出硬真值,但问题和动作空间由设计者封闭。
- Lab-in-the-Loop Feedback — 证明模型能使用迭代实验反馈,但实验来自预计算数据库回放。
证据、验证与可审计基础设施(3 篇)
- EviGraph — 把问题到论断的依赖变成可检查、可失效和可回滚的研究状态。
- FlashInfer-Bench — 用真实服务工作负载、正确性沙箱与部署约定评测智能体的计算内核工程能力。
- SOL-ExecBench — 用硬件上界、输出检查和防投机检测约束 235 个 B200 计算内核问题。
邻接资料
- OpenHands 提供 CodeAct、事件流和 Docker 沙箱,是 Agent-Systems 的平台工作,也是重要的脚手架与实验变量;论文本身不自动化或评测研究过程。
- optimize_anything 把 GEPA 的声明式接口扩展到代码、智能体架构、技能、配置和视觉制品。GEPA 算法有 ICLR 2026 正式证据;八类扩展案例来自项目方材料,不能当作跨领域独立复现。
38 篇设计空间总表
| 论文 | 主角色 | 目标由谁设定 | 时长证据 | 最强验证 | 实际证明与人工边界 |
|---|---|---|---|---|---|
| MLAgentBench | 基准 | 人给任务、基线与指标 | 最多 5 小时、50 次动作 | 运行后的任务分数 | 测短程机器学习实验;不测新颖性 |
| R&D-Agent(Q) | 垂直研究闭环 | 人给市场、数据、目标与策略规则 | 30 轮;约 12 小时 | 执行检查与 Qlib 历史样本外(out-of-sample,OOS)回测 | 自动化量化内环;无实盘,重复选择仍可能造成研究过拟合 |
| AI Scientist | 端到端系统 | 人给方向与代码模板 | 单次约 12 小时 | 执行产物与大语言模型评审 | 能自动成稿;无独立科学验真 |
| MLE-Bench | 基准 | 人给 Kaggle 任务 | 主设定 24 小时,扩展至 100 小时 | 私有排行榜 | 测机器学习工程;多次运行成功率强依赖重复运行 |
| AI Scientist v2 | 端到端系统 | 人给研究方向,人工跨运行选稿 | 单次运行最多 15 小时;随机种子数未披露 | 执行产物与研讨会评审 | 3 篇投稿中 1 篇过线;约 40 个想法先经人工筛选 |
| Auto-Research Vision | 路线图与原型 | 各原型均由人给目标 | 无完整持续轨迹 | 人工抽查与局部指标 | 证明阶段组件可行,不证明闭环 |
| MLR-Bench | 基准 | 从研讨会主题到给定的三元组 | 重环节仅 10 个样本 | 大语言模型评分与产物检查 | 暴露 10 个样本中有 8 个编造结果;不是真实发现评测 |
| AlphaEvolve | 程序搜索 | 人给问题、代码边界与评估器 | 大规模异步;未披露统一墙钟时间 | 精确或数值检查,以及专家复核或生产部署 | 发现算法与工程优化;选择空间由人限定 |
| ASI-ARCH | 架构搜索 | 人给初始方案、约束和基准 | 约 20,000 个图形处理器小时,并行运行 | 损失、基准和大语言模型评分 | 证明窄域搜索产出率;不证明长程自治 |
| Kosmos | 数据与文献系统 | 科学家给目标和预处理数据 | 12 小时、20 个循环、200 多条轨迹 | 专家抽检与独立计算验证 | 79.4% 的抽样论断得到支持;专家选取有意义结论 |
| FunSearch | 数学程序搜索 | 人给程序骨架与评估器 | 最难实验约 2 天并行搜索 | 精确构造检查 | 新构造成立;意义与搜索空间迭代依赖人类 |
| AutoScientists | 长时多智能体系统 | 人给任务、数据、指标、初始程序 | 4–16 小时 | 可执行的基准指标 | 证明协作脚手架;不测自主选题或湿实验 |
| BES | 搜索算法 | 人给任务与最终目标 | 每题约 50–200 次调用 | 最终精确或数值目标,以及局部代理指标 | 改善搜索;未产出外部确认的新知识 |
| GEPA | 提示词优化器 | 人给系统、数据划分与反馈函数 | 17–92 次反思调用;非长程研究轨迹 | 留出集自动评测 | 短程工程成功;不是可验证科学发现 |
| AlphaProof Nexus | 形式证明搜索 | 人给出并审核形式命题 | 24–48 小时异步搜索 | Lean 与 SafeVerify | 形式正确;题意、新颖性与意义仍由专家把关 |
| AstaBench | 基准 | 多数给定目标和详细步骤 | 多数少于 12 步;单元执行限时 5 分钟 | 程序检查与大语言模型评分准则混合 | 测研究子任务;端到端成功率最高仍约 5% |
| DeepScientist | 前沿计算搜索 | 人给任务、最先进起点与指标 | 最长一个月、16 块 H800,持续人工监督 | 脚本重执行与人类核验 | 21 个进展;搜索自主不等于无人科研 |
| InnovatorBench | 长时基准 | 人给隐藏参考答案的研究任务 | 2–36 小时;峰值常在 11 小时后 | 可执行分数与评分准则 | 暴露异步作业、过早停止与资源管理失败 |
| RE-Bench | 人机基准 | 人给 7 个研发任务 | 比较 2–32 小时总预算 | 任务评分器 | 2 小时智能体领先、8 小时后人类反超;32 小时为四次尝试取最佳 |
| Co-Scientist | 假设协作系统 | 科学家给目标、约束并选候选 | 异步多轮;不以无人时长为证据 | 专家与体外湿实验 | 有科学发现证据;最终选择与实验由人完成 |
| SR-Scientist | 方程搜索 | 人给数据与任务 | 每题约 1,000 次调用,最长 25 轮内环 | BFGS 数值误差与大语言模型等价判断 | 重发现已知方程;结构或机制不由数值拟合保证 |
| HeurekaBench | 基准 | 人给问题,答案来自已发表论文 | CellVoyager 每题约 1 小时 | GPT-4o 最终答案评分 | 测已知单细胞洞见重发现;不重执行工作流 |
| DDR-Bench | 开放调查基准 | 只给实体与数据库模式,不给查询目标 | 自主停止,少数达到 100 轮 | 检查清单与大语言模型支持度评分 | 目标自主性高;新洞见真值与预算控制较弱 |
| PaperBench | 论文复现基准 | 人给目标论文与数据 | 主设定 12 小时,o1 扩展至 36 小时;人类子集 48 小时 | 独立重执行与 8,316 个细粒度评分项 | 测复现而非选题;最佳智能体总分 21.0% |
| CausalGame | 机制基准 | 人给生存目标与动作空间 | 10 次部署,最终运行 1,000 架无人机 | 隐藏结构因果模型与语言评分准则 | 硬真值但封闭世界;高任务分不等于因果理解 |
| Robin | 生物发现系统 | 人给疾病,科学家筛选并运行实验 | 智能体认知环节少于 2 小时;实验周期间断由人衔接 | 人类分析与多轮体外实验 | 支持药物再利用发现;实验规程与操作并未自动化 |
| MetaMuse | 系统算法生成 | 人给问题、接口、工作负载与模拟器 | 每种方法生成 350 个候选 | 工作负载仿真与安全检查 | 证明性能与多样性;新颖性和生产泛化需专家或线上验证 |
| CausalEvolve | 程序进化 | 人给四个优化目标与评估器 | 约 80–200 个演化步骤 | 可执行目标,3 个随机种子 | 得分更高、速度更快;所谓因果因子未被真实干预识别 |
| Lab-in-the-Loop Feedback | 反馈能力实验 | 人给特征、候选库与历史结果 | 10 轮迭代,共 800 次离线运行 | 预计算的显著性概率值与随机反馈对照 | 证明能利用反馈;没有在线湿实验 |
| ResearchClawBench | 跨学科基准 | 人给问题、文献、原始数据;隐藏目标论文 | 代表系统平均每题约 26–27 分钟 | 专家评分准则与 GPT-5.1 评分 | 最佳智能体 21.5/100;仍是参考论文锚定的重发现 |
| Beyond Final Scores | 过程基准 | 人给 36 个目标、起点、参考与验证器 | 2–12 小时,共 756 次运行 | 基于规则的 C1、C2、C3 指标与人工新颖性评审 | 252 个三次尝试最佳解中仅 3 个判为新颖;经验可正负迁移 |
| EviGraph | 证据状态系统 | 人给研究目标与基准 | 有预算的修复循环;未做持续数天的压力测试 | 运行产物与大语言模型论断归属判断 | CSR 为 37.85%、EDC 为 87.73%;按其抽取协议,62.15% 的论断未判为有支持 |
| OmniScientist | 多模态研究系统 | 人给数据、研究对象与目标属性 | 构思 24 步、实验 50 步 | 执行账本、代码关口与大语言模型评分 | 36 次运行全部成稿;无独立专家或外部实验验真 |
| FlashInfer-Bench | 计算内核基准与部署 | 人给定义、工作负载与参考实现 | 每题固定智能体预算 | 正确性沙箱与专家计算内核 | 测人工智能计算内核工程;不测自主选题或科学新颖性 |
| SOL-ExecBench | 硬件实测基准 | 人给 235 个计算内核问题 | 由多个智能体分轮生成基线 | 输出检查、硬件上界与防投机检查 | 14.5% 的提交被拒;SOL 模型自身仍需审计 |
| AdaExplore | 计算内核搜索 | 人给任务、领域专用语言与运行时间目标 | 最多 100 个搜索步骤 | 编译、正确性与运行时间 | 从失败中学习技能;主要证明窄域工程优化 |
| AVO | 长时计算内核演化 | 人给初始方案、B200 和注意力基准 | 7 天单条谱系、40 次代码提交 | 数值检查与 cuDNN、FA4 计时 | 发现微架构优化;智能体、模型与成本未充分公开 |
| CAKE | 编译器与智能体共同演化 | 人给计算内核规格、标准答案与硬件 | 从零开始使用 8,000 万个词元 | 类型化验证器、图形处理器实测与基线 | 证明中间表示共同设计的收益;编译器演化含累积先验 |
综合判断
1. “验证器强”必须先说清验证对象
| 证据层 | 能排除什么 | 不能自动排除什么 | 代表工作 |
|---|---|---|---|
| 软评审/自评 | 明显不完整、格式或叙事问题 | 同源偏好、事实错误、实验未运行 | AI-Scientist-arXiv24、MLR-Bench-arXiv25 |
| 代理分数与独立留出集 | 固定任务上的性能退化、部分过拟合 | 指标错位、新颖性、机制真实性 | GEPA-ICLR26、MLE-Bench-ICLR25、ASI-ARCH-arXiv25 |
| 执行来源追踪与独立重执行 | 数字编造、代码未运行、产物错配 | 错误分析程序、选择偏差、结论越界 | PaperBench-ICML25、OmniScientist-arXiv26、EviGraph-arXiv26 |
| 精确约束与编译器 | 构造无效、程序不编译、确定性约束违反 | 搜索空间外的更优解、科学意义、新颖性 | FunSearch-Nature24、AlphaEvolve-arXiv25 |
| 形式化证明 | 给定形式系统中的逻辑漏洞 | 自然语言题意映射、新颖性与重要性 | AlphaProofNexus-arXiv26 |
| 专家、独立数据与湿实验 | 一部分领域错误和现实效应缺失 | 外部有效性、长期安全性、临床有效性 | Robin-Nature26、Co-Scientist-Nature26、Kosmos-AI-Scientist-arXiv25 |
强验证器的真实贡献是把“候选可能胡说”转化为“候选能否通过某个明确检查”。它没有消灭幻觉,而是自动丢弃错误候选,并把主要代价转移到搜索产出率、评估器覆盖与目标对齐。GEPA 的测试集改进、FunSearch 的合法构造和 AlphaProof Nexus 的 Lean 定理因此是三种不同的成功。
2. 长墙钟、总算力和长程自主不是同一量
这里的长程只作为自动科研的过程维度;状态、恢复、故障注入和副作用语义的完整诊断框架见 长程智能体可靠性。
RE-Bench-ICML25 的时间尺度反转最直接:2 小时智能体约为人类 4 倍,8 小时后人类均值已领先;32 小时点又是四名专家各做 8 小时后取最佳值,不是一名研究者连续工作 32 小时。PaperBench-ICML25 中智能体约 1 小时后趋于停滞,InnovatorBench-ICLR26 的最佳结果却常在 11 小时之后出现,表明任务反馈周期会改变“合理的长程”定义。
Beyond Final Scores 进一步把长循环拆成问题构建、执行和反馈控制。七个模型的执行能力都相对强,真正的差异来自能否选对方向、保护最佳状态、从性能倒退中恢复并正确使用经验。在 36 个持续 2–12 小时的任务和 756 次运行中,三次运行平均值的最高与最低结果相差 0.237,而三次运行最佳值只差 0.122:很多模型偶尔能找到好解,却不能稳定复现。
因此至少要同时报告:单条谱系的连续时长、最长依赖链、并行度、图形处理器总时数、上下文压缩与恢复次数、最佳状态丢失率和人工介入。FunSearch 的两天、ASI-ARCH 的约 20,000 个图形处理器小时、DeepScientist 的一个月研究活动都是重要规模证据,但不能单独证明通用长程自治。
3. 最佳结果必须与筛选分母一起读
| 系统或基准 | 公开筛选分母 | 应如何解释主要结果 |
|---|---|---|
| AI Scientist | 616 个想法,525 个自判新颖,327 个通过实验,290 个成文 | 证明流水线吞吐,不等于 290 篇论文在科学上成立 |
| AI Scientist v2 | 约 40 个想法,人工选 3 篇投稿,1 篇研讨会论文过线 | 3 篇投稿中 1 篇过线,不是无条件的整轮成功率 |
| FunSearch | 容量为 512 的无三项等差集合在 140 次独立运行中出现 4 次 | 最佳构造正确,但复现该最好值的概率低 |
| DeepScientist | 4,879 个想法,1,108 个实现,21 个进展发现 | 筛选后成功率约为 1%–3%;工程失败占主导 |
| ASI-ARCH | 1,773 次试验,约 1,350 个潜力候选,约 400 个扩大验证,106 个进入展示集,5 个完整运行 | “106 个最先进结果”是本文协议中多层选择的产物 |
| AlphaProof Nexus | Erdős 问题为 9/353;整数数列在线百科(Online Encyclopedia of Integer Sequences,OEIS)问题为 44/492 | 最终证明零容错,整轮研究的产出率仍低 |
| MLE-Bench | 单次运行成功率为 16.9%,八次运行至少一次成功率为 34.1% | 重复尝试可将奖牌率翻倍,不能只报八次中的最佳结果 |
| Beyond Final Scores | 252 个三次尝试最佳解中,仅 3 个经人工保留为新颖,16 个利用了评估器漏洞 | 高分更常来自组合既有技巧,偏离常规时也更可能利用漏洞 |
强验证器可以让被选中的最终候选很可靠,却不能让每轮研究活动都高产。成功率、候选总数、独立重复、被丢弃原因和人工筛选工时必须计入发现成本。
4. 证据状态正从日志升级为研究操作系统
长程系统的关键抽象逐渐从“更长的提示词”转向可失效、可回滚的研究状态:
- AutoScientists-arXiv26 记录当前最佳方案、失败方向、论坛讨论和团队拓扑,解决多人重复探索与状态漂移。
- EviGraph-arXiv26 把上游节点变更传播到下游论断,并用检查点拒绝让一次修复破坏已验证链;但只给出一个未触发回滚的案例,关键恢复分支仍主要是设计而非经验事实。
- OmniScientist-arXiv26 用执行记录约束每个数字和论断;36 次运行中有 115 次最终提交被代码关口退回、67 项分析被降级,说明结果选择问题比数字编造更常见。
- Kosmos-AI-Scientist-arXiv25 用结构化世界模型压缩 200 多条轨迹;解释与综合类论断的支持率仍显著低于数据与文献类论断,说明“记住证据”和“正确解释证据”是两种能力。
这类基础设施应允许论断随数据、代码、假设或评估器版本变化自动失效,而不是只保存一份成功报告。MLR-Bench 的结果编造、PaperBench 极低的结果匹配率和 ResearchClawBench 的证据不匹配都指向同一缺口。
5. 真正的科学证据仍是科学家参与闭环
Robin-Nature26 从干性年龄相关性黄斑变性文献出发,提出增强视网膜色素上皮细胞的吞噬作用,筛出药物候选,分析流式细胞术与 RNA 测序,并得到 ripasudil、KL001 和可能的 ABCA1 机制线索。证据包含多轮体外实验和人类复核,但科学家仍要选择候选、改变细胞或检测方法、撰写实验规程、实际操作实验并决定何时继续;Robin 自动化的是关键认知环节,不是实验室执行。
Co-Scientist-Nature26 同样由科学家定义目标并从智能体候选中选择,后续以急性髓系白血病、肝纤维化和抗微生物药物耐药性的专家评审与体外实验检验;结果仍是早期体外证据,不是临床确认。DeepScientist-ICLR26 的三项人工智能结果经脚本与三名监督者验证,但没有湿实验;Kosmos-AI-Scientist-arXiv25 有独立计算重分析和专家论断审核,部分生物机制仍待实验。
与之相反,Lab-in-the-Loop Feedback 所谓的“实验室”完全来自 JUMP 数据库中已有的显著性概率值:800 次运行、10 轮反馈、每轮 100 个基因都是离线查询。随机反馈对照确实说明 Sonnet 4.6 会利用反馈内容,但不能证明智能体能处理真实的培养板噪声、批次效应、延迟、实验失败或仪器异常。
6. 开放发现与可重复评测仍有结构性张力
三种新基准正好形成三角:
- DDR-Bench-ICML26 的目标最开放——只给数据库模式,由智能体决定查什么;但“新洞见”主要由检查清单和大语言模型比较,真值覆盖最软,且自选轮数混入计算预算。
- CausalGame-ICML26 的真值最硬——隐藏结构因果模型和主动干预可计算最优策略;但目标、变量和动作空间都封闭,恢复的是设计者已知机制。
- ResearchClawBench-arXiv26 用 40 篇隐藏论文锚定十个领域的真实问题、数据和多模态评分准则;可审计性较强,却仍主要测目标论文的重发现。最佳智能体只有 21.5/100,失败集中在实验规程不匹配、证据不匹配与遗漏科学核心。
越开放,越难建立完整真值;越容易评分,越可能重走已知路径。合理做法不是选一端,而是明确基准测的是目标形成、过程控制、重发现还是新发现,并把任何超越参考答案的结果交给独立领域团队验证。
7. 脚手架是实验变量,不是背景常量
同一模型更换脚手架会改变可观测能力。MLE-Bench-ICLR25 中 GPT-4o 配合 AIDE 的奖牌率为 8.7%,配合 OpenHands 为 4.4%,采用 MLAgentBench 风格脚手架时只有 0.8%。AstaBench 的专用 Asta v0 含任务路由器和模块先验,不能与极简 ReAct 当作只差模型。Beyond Final Scores 则在固定 36 题上发现,原生或开源执行框架主要提升三次运行平均值的稳定性,三次运行最佳值与模型排序变化较小;自动演化执行框架的收益只稳定迁移到同类系统优化任务,跨任务族效果尚不清楚。
公平比较至少应固定模型、任务、环境、总墙钟时间、词元与图形处理器预算、重启次数和可见反馈,并分别报告模型、执行框架与并行选择器的贡献。OpenHands 的价值因而是提供可复用实验底座,而不是作为科研能力的直接证据。
共同结论
- “自主”通常从问题形成之后才开始。 程序骨架、数据、评估器、形式命题、基线和停止规则仍大多由人提供;DDR-Bench 只在目标选择上走得更远,R&D-Agent(Q) 也仍由人设定市场、数据、目标和回测协议。
- 执行能力已经领先于证据控制与方法新颖性。 Beyond Final Scores 中执行能力最集中,252 个三次尝试最佳解中只有 3 个判为新颖;ResearchClawBench 也显示完整报告常缺核心实验规程和证据链。
- 强验证器提高最终正确率,却把问题转成产出率与覆盖范围。 它不能自动判断任务是否值得、指标是否正确或结果是否新颖。
- 长时失败主要是系统问题。 过早停止、异步作业冲突、忘记最佳状态、错误经验迁移和上下文压缩都会让更长预算失效;具体测量与恢复语义见 长程智能体可靠性。
- 过程反馈既能教学,也能误导。 Lab-in-the-Loop Feedback 的随机标签会显著伤害智能体;Beyond Final Scores 的跨任务经验有时提分,有时会诱发局部最优或利用评估器漏洞。
- 所谓“因果”需要真实识别证据。 CausalGame 有已知结构因果模型但世界封闭;CausalEvolve 的因子和近似平均处理效应用于搜索引导,却没有满足无混杂或跨环境识别条件。
- 多模态感知扩展了问题空间,不自动扩展真值。 OmniScientist 证明原始记录会改变研究问题,但最终论断仍需独立领域验证。
- 成本必须统一记账。 运行次数、大语言模型调用数、图形处理器小时、候选评估算力、美元、墙钟时间、人工审查和湿实验成本不能互换。
假设冲突与脆弱点
- 通用性与硬验证能否兼得? 通用系统的论断空间开放,精确验证器只能覆盖局部;窄域搜索的验证器强,却把问题构建留给人。
- 证据账本能否检查错误分析本身? 来源追踪可证明数字来自某次运行,不能证明统计模型、数据清洗和因果解释正确。
- 发现数量是否随算力扩展? ASI-ARCH 与 DeepScientist 都给出上升曲线,但缺少多个随机种子、固定试验总数和独立研究活动;不能据此建立扩展规律。
- 更多经验为何有时更差? 未经验证的总结会固化错误结论,跨任务经验可能携带仅适用于特定评估器的捷径;记忆需要删除、反证和版本语义。
- 自动评审能否成为最终科学关口? EviGraph、OmniScientist、ResearchClawBench 都让大语言模型参与论断或评分准则判断;当前缺乏足够大规模的盲法人类一致性检验和跨实验室复现。
- 离线反馈能否外推到真实实验室? 清洁数据库中的命中或未命中没有批次效应、失败实验和延迟;Robin 与 Co-Scientist 的真实湿实验又依赖大量人工操作,二者之间仍有系统鸿沟。
- 参考答案锚定的基准会不会惩罚真正创新? 隐藏论文提供可审计锚点,却让评分器偏向已知实验规程;超过参考答案的候选仍需另建外部验证流程。
值得关注的研究方向
1. 建立可失效的论断—证据账本
将每条论断绑定问题版本、数据哈希、代码提交、环境、完整测试族、输出和解释;上游节点变化时自动使下游论断失效。先在 MLR-Bench 或 PaperBench 风格任务上测量数字编造、过期论断与独立重执行率,再扩展到科研数据。
2. 对长程研究系统做故障注入
在固定模型和总预算下,注入上下文压缩、异步作业延迟、节点重启、错误高分、过期经验和评估器版本变化,分别测量最佳状态保持率、恢复时间和错误论断传播距离。它比单报最终分更能检验研究操作系统;统一指标见 长程智能体可靠性。
3. 把候选选择偏差纳入验证器设计
除最终留出集外,再保存一份从未参与搜索的二级留出集;随候选数报告泛化差距,并用固定候选池比较标量反馈、带噪语言反馈、编译器诊断和形式证明。这样才能分离 GEPA、MetaMuse 和 CausalEvolve 的反馈信息量与搜索器贡献。
4. 做等预算脚手架因果实验
固定模型、词元、墙钟时间、并行度和评估器调用数,对比极简 ReAct、OpenHands 或 AIDE、证据图、共享论坛和自动生成的执行框架;报告多次运行平均值、多次运行最佳值、状态丢失、人工介入与真实总成本。
5. 为科学家参与闭环建立人工介入日志
Robin、Co-Scientist、Kosmos 和 DeepScientist 应统一记录人类何时改题、更换检测方法、删除候选、修复代码、解释结果和决定停止。目标不是消除人类,而是区分智能体贡献、领域安全关口和不可替代的实验劳动。
6. 从便宜、强验证的窄域建立可复现发现率
小团队可选择组合数学、编译器启发式算法、计算内核或量化投研中的预注册任务,运行多轮独立研究活动,完整公开候选分母、失败类型、验证算力与专家新颖性判断。R&D-Agent(Q) 提供了低成本闭环起点,但还需要盲化时间切分、交易成本、候选选择偏差和独立重执行。比复制超大并行搜索更重要的是建立可复现的发现产出率。