深度调研(Probe):面向智能体的量化研究系统
阅读提示
本文所说的面向智能体(agent-native),是指软件环境从一开始就便于智能体理解、操作、检查和恢复,而不是让大语言模型(Large Language Model,LLM)直接给出买卖指令。全文把一次研究中可保存、复查和重放的完整记录称为研究产物(artifact);把执行检查并给出通过或失败结论的组件称为验证器(verifier);把承载工具调用、任务状态和失败恢复的执行层称为运行时(runtime)。回测(backtest)是在历史数据上模拟策略;样本外(out-of-sample,OOS)评价使用未参与训练或调参的数据;封存留出集是研究过程完全不可见、只在最终检验时解封的数据;模拟交易(paper trading)则在实时市场中运行策略但不投入真实资金。智能体任务效率(agent-task efficiency,ATE)衡量智能体完成框架任务所花费的时间、交互轮数、上下文和计算资源。
研究范围:本调研关注如何把量化研究环境设计成适合智能体工作的系统。系统需要把研究假设、历史时点可见数据、因子或模型代码、回测结果、研究论断、组合决策以及模拟交易和实盘发布关口组织成显式、可审计的研究产物。它不研究让 LLM 直接输出买入、卖出或持有指令。
证据口径与覆盖
- wiki 强证据:论文页同时标记为
review_status: complete和evidence_level: full-text,可用于支撑关键观察与脆弱假设。 - wiki 线索证据:
needs-review/full-text只用于定位问题或与强证据交叉印证,不能单独支撑脆弱假设;包括 101-Alphas-arXiv15、TimesFM-Fin-arXiv24、RD-Agent-Quant-arXiv25、AI-Scientist-arXiv24、AI-Scientist-v2-arXiv25、OpenHands-ICLR25、OpenHands-SDK-MLSys26 与 AgenticCache-MLSys26。 - 本次补齐的强证据:已下载、全文解析并生成 AgonAlpha-arXiv26、AlphaForgeBench-KDD26、Market-Bench-arXiv25、TradeTrap-arXiv25、DeepFund-arXiv25 与 BacktestBench-KDD26 六个论文页。其中后两篇 KDD 工作按正式发表状态使用
kdd26-*raw 标识。 - 外部摘要线索:Chain-of-Alpha 已被 arXiv 撤稿;页面注明提交者当时无权同意许可,当前不提供 PDF。本文只用其摘要定位“双链回测反馈”路线,不让它单独支撑张力、脆弱假设或空白。
- 产业资料:Microsoft RD-Agent、Qlib、QuantConnect Assistants、WorldQuant BRAIN 与 Numerai 只用于说明公开功能和运行边界,不能当作经过独立同行评审的效果证据。
研究版图
量化研究对象、闭环与验证
| 工作 | 证据 | 做了什么 | 没做什么 | 关键观察 | 隐含假设 | 可攻击点与脆弱点 |
|---|---|---|---|---|---|---|
| 151 Strategies | 强 | 把 150 多类策略和 550 多个公式整理为研究先验与策略分类体系 | 没有统一回测、样本外评价、部署流程或智能体闭环 | 市场结构变化会使策略失效;现代单个超额收益信号往往很弱,需要组合使用 | 公式和文献指针足以界定有价值的搜索空间 | 实现自由度很大,智能体可通过调整预测期限、股票范围和成本假设,让旧模板再次出现过拟合 |
| 101 Alphas | 线索 | 公开 101 条生产因子公式,并报告相关性和换手率等统计,形成可执行的公式基准 | 不提供可复现数据、交易成本、现代样本外评价或策略退役协议 | 披露因子的平均相关性较低,因而可能适合组合 | 只要有公开价量数据和正确算子,就能近似复现信号结构 | 私有样本、无成本假设和 2010–2013 年市场环境,使其不能直接充当现代验证器 |
| TimesFM-Fin | 线索 | 通过金融领域持续预训练、对数损失和动态遮蔽生成价格预测 | 不形成智能体研究闭环,也不处理成本感知组合和实盘漂移 | 金融价格尺度差异和崩盘会使普通均方误差(Mean Squared Error,MSE)训练不稳定;较长预测期限表现更好 | 预测准确率能够转化为可交易信息,完整参数微调值得其成本 | 一阶自回归模型(first-order autoregressive model,AR(1))在部分市场更强;零成本和单次时间留出评价可能夸大价值 |
| News Shock | 线索 | 从 Reuters 通讯社新闻表示中剔除传统特征可预测部分,再用残差构造文本异常并滚动估计组合 | 不自动生成研究假设,也不覆盖实时处理、容量和模型版本漂移 | 新闻中未被传统特征解释的残差,在较长窗口仍含预测信息 | 线性正交化能够分离“新信息”,递归估计近似符合历史时点可见原则 | 专有新闻、模型版本、全样本解释变量选择和有限的成本敏感性分析会影响复现与实盘结果 |
| UPSA | 强 | 把多个岭回归组合做成非负集成,在高维因子集合中学习非线性收缩 | 不生成因子,也不把交易成本、冲击成本、借券和生产约束纳入目标 | 不同惩罚强度会产生互补收益流;面向投资组合效用选择收缩程度,比只优化协方差误差更合适 | 留一法效用(leave-one-out utility,LOO utility)在收益近似可交换时能代表样本外效用 | 自动生成因子会增大因子数与样本数之比 ;时间依赖、约束和成本可能吞掉集成收益 |
| R&D-Agent(Q) | 线索;由NeurIPS 2025 全文和官方实现交叉印证 | 用规格定义、方案合成、代码实现、结果验证和分析五类单元,闭合因子与模型的联合优化,并用多臂老虎机调度研究方向 | 没有模拟交易或实盘评价、封存留出集、重启恢复和策略退役 | 数据模式隔离只让 LLM 看到字段结构,不让它读取原始取值;再由 Qlib 执行实验。因子与模型联合搜索优于只搜索一类对象 | 这种数据隔离足以抑制信息泄漏;反复读取同一验证反馈不会造成严重研究过拟合 | 样本外窗口约 18 个月,只展示单条当时最佳路径;与微软工具生态共享组件,且调度对照未严格统一预算,都会削弱信息比率(Information Ratio,IR)的外推性 |
| Chain-of-Alpha | 摘要线索 | 摘要声称以因子生成链和优化链反复利用回测反馈 | 撤稿且无全文,实验协议、候选数量和证据边界均不可核对 | 摘要把公式因子描述为适合自动搜索 | 作者控制的回测可同时充当搜索反馈与最终评价 | 无全文使任何实验结论都不能进入强证据;只保留为覆盖记录 |
| AgonAlpha | 强 | 搜索冻结且携带证据的研究产物;独立上下文审查者可复跑并否决;感知在途任务的蒙特卡洛树搜索(Monte Carlo Tree Search,MCTS)分配并发预算 | 不联合优化模型和组合,不进入模拟交易或实盘;多数风险警告仅供参考 | 24 个冻结报告中有 2 个因证据错配被归零,说明公式记录不足以承载审计 | WorldQuant BRAIN 的外部治理能隔离作者;两个角色已足以形成对抗检查 | 60 次提交都在同一 2019–2023 窗口中选择;树调度和角色数量无同预算消融,平台也不可独立重算 |
| AlphaForgeBench | 强 | 让 LLM 生成可执行因子和策略,再由确定性引擎比较研究能力 | 不负责持续搜索、组合、发布与恢复;只测单资产长仓 | 温度 0 与 0.7 的 Sharpe 比率最大差异低于 0.008,执行分离显著提高重放稳定性 | 代码生成比逐时动作更接近真实量化研究能力 | 903 个问题仍绑定固定回测器、固定成本和规则语言;稳定执行不等于样本外有效 |
| Market-Bench | 强 | 构造三类可执行回测器,并把盈亏、回撤和持仓路径与参考实现对齐 | 不评价因子发现、数据治理或长程研究 | Qwen3 Max 的 15 轮都能执行,但总体平均绝对误差约为 | 参考实现能充当可信的金融语义标准 | 未归一化误差会受量纲影响;只有三类策略,参考实现仍由作者决定 |
| BacktestBench | 强 | 用 18,246 个任务覆盖指标抽取、SQL 检索、代码生成与回测,并给出三角色 AutoBacktest 基线 | 不覆盖开放因子发现、组合、模拟交易、故障恢复或选择偏差记账 | Kimi Linear 48B 的代码执行正确率为 99.22%,指标计算准确率却只有 0.19%;语法与金融逻辑明显解耦 | 43 个标准因子与 7 个指标足以代表回测的主要语义 | 代码到文本构造会清除真实需求歧义;零成本、日频开收盘协议远离生产成交 |
| TradeTrap | 强 | 对市场信息、策略提示、记忆和仓位状态注入扰动,观察两类交易智能体的错误传播 | 只做历史闭环回测,不构造研究产物,也不覆盖发布生命周期 | 只篡改流程型智能体看到的仓位,就使总收益降至 -61.02%、最大回撤升至 91.97% | 两类实现可以代表开放工具调用与固定流程架构 | 一个月、单实现和预设攻击不能代表生产尾部;真实券商限额可能阻断部分损失路径 |
| DeepFund | 强 | 使用模型知识截止时间之后的实时数据,以多角色智能体进行基金评价 | 不生成可复现因子或模型代码,也不处理长期退役和独立重复研究 | 最初 24 个交易日中只有 Grok 3 获得正累计收益;格式有效不代表盈利 | 截止时间后的短期实时数据足以降低预训练污染并比较模型 | 单次路径和接口版本无法估计长期超额收益;扩展到整个季度后部分模型由亏转盈 |
面向智能体的软件、状态与执行契约
| 工作 | 证据 | 做了什么 | 没做什么 | 关键观察 | 隐含假设 | 可攻击点与脆弱点 |
|---|---|---|---|---|---|---|
| PithTrain | 强 | 用约 11 千行代码(thousand lines of code,KLoC)、以 Python 语言为主、调用关系显式的实现和任务技能,降低编码智能体操作混合专家模型训练框架的成本 | 不让智能体参与数值训练,也不评价跨模型修改、长期维护和故障恢复 | 注册表、原生扩展边界和隐式调用会增加代码探索、上下文和重复训练;可执行技能显著减少交互轮数 | 当前智能体更擅长局部、显式和单语言代码;较窄的功能范围足以代表目标任务 | PithTrain 的 ATE-Bench 基准与框架由同一团队共同设计,且只固定一种智能体;生产覆盖增长后,紧凑性可能失效 |
| OpenHands | 线索 | 用 CodeAct 代码动作接口、事件流和 Docker 容器统一工具、工作目录、用户界面和过程重放 | 不提供量化研究语义、长程恢复或生产安全攻防证据 | 命令行、Python 和浏览器可覆盖大量数字工作;事件流能让智能体与运行时解耦 | 文件、代码和执行组成的循环足以表达研究任务 | 长文件、长上下文、容器逃逸和外部数据权限会成为量化部署瓶颈 |
| OpenHands SDK | 线索 | 用不可变组件、ConversationState 会话状态对象和只追加的 EventLog 事件日志,重构生产软件开发工具包(Software Development Kit,SDK) | 不证明跨版本重放、本地与远程环境等价或多租户延迟与可用性目标 | 隐藏配置覆盖会破坏确定性重放;把会话状态集中到一个可变对象有利于恢复 | 事件溯源(event sourcing,即按顺序保存事件来恢复状态)能完整重建会话;本地优先适合多数开发场景 | 会话中途改变策略、密钥或模型版本会破坏重放;“可用于生产”的论证主要来自功能清单 |
| SkVM | 强 | 把技能视为程序,针对模型、智能体外壳和执行环境做预先编译、即时编译、环境绑定和回滚 | 不理解金融语义,也不评价跨天恢复或失效数据 | 原始技能会让 15% 的任务退化;流程结构与目标能力不匹配是一等问题 | 技能所需的结构能力可由有限的基础能力表示 | 结构检查通过不代表历史时点、统计或合规正确;生成安装脚本和固化代码还会扩大供应链风险 |
| Agentix | 强 | 向调度器暴露完整智能体程序及调用进度,缓解请求层和程序层的队首阻塞(head-of-line blocking) | 不感知金融实验价值、工具副作用或验证失败 | 程序等待时间可能超过模型执行时间;单请求抽象会丢失调度信号 | 已完成调用数越多,程序通常越接近结束 | 回测重试、动态分支和失败重跑会使调用数与剩余工作反向;优先快完成任务还可能饿死长研究 |
| Murakkab | 强 | 用声明式有向无环图、性能画像、混合整数线性规划和自动扩缩容,联合选择工作流、模型、工具和硬件 | 没有真实生产智能体轨迹、工具恰好执行一次的语义,也没有开放任务的质量验证器 | 工作流配置的收益并不单调,不能假设“大模型或更多审查者总会更好” | 不同层的画像可以组合,并能代表未来任务;平台方掌握完整技术栈 | 提示词、工具和数据漂移会使画像失效;量化回测与模拟交易任务的长尾和副作用没有覆盖 |
| AgenticCache | 线索 | 缓存常见计划转移作为快速路径,由后台 LLM 异步确认和纠错 | 只在离散仿真任务中评价,不覆盖研究产物、市场漂移和实盘状态 | 常见计划具有局部重复性,但纯缓存会因环境变化显著降低成功率 | 少量元数据能识别多数失效计划,异步纠错也足够及时 | 旧研究流程或旧市场状态被缓存后,可能稳定放大错误;缓存投毒、删除和跨版本失效均未评价 |
| EviGraph | 强 | 把问题、假设、实验、发现和论断建成可检查、可失效、可回滚的证据图 | 不检测代码中的信息泄漏、错误统计或金融外部有效性,也缺少统一预算的消融实验 | 上游错误会沿研究阶段传播;执行产物可以约束发现和论断的来源 | 固定证据模式足以表达主要依赖,LLM 检查器能定位根因 | 证据图可能内部一致、统计上却错误;外部论断支持率仍只有 37.85%,关键回滚分支也缺少故障注入 |
| AutoScientists | 强 | 用当前最佳方案、无效方向登记、共享讨论区、动态团队和噪声晋级门槛维持多智能体实验 | 不提供强事务运行时、模型调用与实验资源的双预算扩展规律,也没有量化专用样本外防线 | 长时搜索的方向会随结果变化;实验算力比模型调用更稀缺;噪声会污染当前最佳方案 | 不同方向可以近似独立并行;同伴批评能过滤较差方案;智能体会遵守共享协议 | 单个图形处理器(Graphics Processing Unit,GPU)或强耦合研究中,并行收益消失;批评可能错杀大胆方案,Markdown 文件中的状态也可能发生竞态 |
| AVO | 强 | 以单条演化谱系、Git 版本状态和强验证器进行七天内核优化 | 不比较种群搜索,不覆盖有噪声的多目标或金融非平稳性 | 专家级优化需要多轮环境交互;收益来自少数结构性跳跃 | 正确性和性能验证器可信;单调保护当前最佳方案有益 | 只接受不退步的修改会拒绝必须暂时变差的重构;金融目标比内核运行时间更嘈杂、更易漂移 |
过程评测与验证边界
| 工作 | 证据 | 做了什么 | 没做什么 | 关键观察 | 隐含假设 | 可攻击点与脆弱点 |
|---|---|---|---|---|---|---|
| MLAgentBench | 线索 | 用文件操作、Python 执行和固定验证器评价短程机器学习实验循环 | 不评价新颖性、过程诚信、多机任务或长程恢复 | 常见失败并非不会写代码,而是未运行实验就宣称改进、早期计划错误后无法恢复,以及提交格式错误 | 研究计划、事实核查和较短历史足以维持 50 步任务 | 事实核查仍由模型自评;旧任务和知名任务更容易受预训练污染,步数增加还常使结果退化 |
| MLE-Bench | 强 | 用 Kaggle 私有排行榜和多次尝试成功率评价机器学习工程闭环 | 不评价自主选题、生产部署或持续共享状态 | 智能体外壳和重复尝试能显著提高分数,第二张 GPU 几乎没有被利用 | 私有排行榜可以充当可靠的隐藏目标 | 多次尝试的最好结果会掩盖单轨失败;反复尝试和旧竞赛资料仍可能带来选择或污染优势 |
| PaperBench | 强 | 把论文复现拆为代码开发、真实执行和结果匹配,并独立重执行提交 | 不评价选题或多节点生产研究 | 代码表面正确远强于真正执行和复现结果;智能体约一小时后便停止取得明显进展 | 作者认可的细粒度评分规则和封闭执行环境能代表复现质量 | 自动评审器在代码判断上的 F1 分数(F1 score,综合精确率与召回率)有限,任务依赖没有显式表达,软件生态漂移也会改变分数 |
| RE-Bench | 强 | 在 2–32 小时预算下比较智能体与人类专家完成研发任务的结果 | 不评价月级项目、共享代码维护或真实金融结果 | 智能体优势来自高频反馈和大量重新开始;延长单条轨迹的边际收益迅速下降 | 任务可以复制,多个独立尝试中的最好结果足以代表研发价值 | 量化研究若反复查询同一个回测器,就会把“快反馈优势”转化为自适应过拟合 |
| InnovatorBench | 强 | 用 2–36 小时、异步且使用多张 GPU 的研究任务暴露资源与执行治理问题 | 不评价开放选题、生产安全或崩溃后一致快照 | 智能体会杀掉仍有价值的长任务、忘记已运行任务并制造 GPU 冲突 | 把任务控制暴露给 LLM 可以测量科研能力 | 一个确定性资源账本就可能消除大量失分,因此基准混合了模型缺陷和智能体外壳缺陷 |
| Beyond Final Scores | 强 | 用三次运行平均值和最好值,以及论文定义的 C1–C3 三类过程指标(分别刻画方案定向、执行和反馈控制),分解稳定性、执行和反馈控制,并评价经验迁移 | 不评价开放科学、数天恢复或同预算人类基线 | 经验既能正向迁移,也会固化局部最优;252 个最好解中只有 3 个被判为新方法,16 个利用了验证器捷径 | 验证器分数的推进能代表真实研究进展 | 研究产物本身已经携带经验;C3 在没有故障时不能证明恢复能力,量化验证器捷径还可能跨任务传播 |
| DDR-Bench | 强 | 去掉显式问题,让智能体在结构化数据中自行决定查什么、何时停止 | 不运行完整量化研究流程,也没有同成本的人类能力上限 | 主动发现比执行给定问题更难;通用记忆、规划和多智能体组件不能稳定提高准确率 | 隐藏核对清单能代表应发现事实;极简推理与行动循环能测到内生主动性 | 核对清单无法穷举真正洞见;模型自行选择预算,字段覆盖熵等替代指标也未必等于信息价值 |
| ResearchClawBench | 强 | 用隐藏论文和专家评分规则,评价跨学科实验协议、证据和报告链 | 不统一重执行研究产物,也不评价真正未知的发现或长时恢复 | 报告可以很专业,却缺少决定性证据;执行失败只占 1.5%,协议或证据不匹配更常见 | 目标论文可以作为可审计的人类参考路径 | 参考论文可能惩罚不同但正确的方法;单次运行、LLM 评审和网络资料污染都会削弱结论 |
| GEPA | 强 | 从文字化执行反馈中反思并改写提示词,用按样例保留局部优胜者的帕累托选择维持互补策略 | 不覆盖金融非平稳性、长期治理或安全审计 | 单个标量奖励会丢失诊断信息;局部优胜者可能包含全局最优提示词没有的策略 | 反馈可以可靠序列化,反思规则也能泛化 | 反复使用验证集会造成自适应过拟合;嘈杂的金融反馈可能让帕累托前沿放大噪声 |
| FlashInfer-Bench | 强 | 用任务定义、真实工作负载、候选实现和评价结果四部分契约,以及 apply() 接口,把智能体生成的内核接入部署 | 不覆盖金融语义或多 GPU 通信,长时间运行与回滚证据也有限 | 任务必须由真实执行轨迹和精确参考实现共同定义,孤立的内核小题不够 | 可执行的正确性沙箱能隔离生成智能体和部署系统 | 数据、引擎版本、恶意研究产物和隐藏工作负载的代表性仍需治理 |
| SOL-ExecBench | 强 | 以硬件速度上界和防投机沙箱评价 235 个内核问题 | 不覆盖开放研究或有统计噪声的目标 | 14.5% 的提交会攻击基准;相对弱基线的加速不代表已接近硬件上限 | 速度上界足够准确,也能跨问题归一化 | 金融目标没有类似可信的物理上界;只要验证器有漏洞,智能体就可能系统性利用 |
整体上,量化论文已经能生成因子或模型、读取回测反馈、向外部平台提交,并维护部分研究谱系;通用智能体系统已经具备事件溯源、技能编译、程序调度和证据图;产业平台甚至公开了从研究、验证、回测到模拟交易和实盘监控的流程。尚未闭合的关键并不是“再增加一个智能体角色”,而是能否把这些能力组织成同一套研究契约:结果可验证,旧证据会在上游变化后失效,任务失败后可以恢复,而且搜索过程本身不会污染样本外评价。
矛盾与张力
1. 快速反馈既提高产出,也加速自适应过拟合
RE-Bench-ICML25 表明,当前智能体的优势来自频繁查询验证器和大量重新开始;RD-Agent-Quant-arXiv25 也依靠持续回测反馈生成下一轮候选。Chain-of-Alpha 的摘要描述了相似的双链反馈,但因撤稿只算路线线索。量化评价不像编译测试:同一个验证窗口被查询得越多,偶然噪声越容易被固化为研究知识。UPSA-NBER23 对 与估计误差的警告进一步放大了这一张力。
2. 外部验证器可以隔离作者,却不能自动证明未来有效
AgonAlpha-arXiv26 借助 WorldQuant BRAIN,让系统作者无法控制数据、模拟规则、指标和提交门槛;DeepFund-arXiv25 则认为,只有模型知识截止时间之后的实时数据才能防止“提前知道未来”。前者仍在固定的 2019–2023 历史窗口中选结果;后者最初只有 24 个交易日,而且扩展到整个季度后部分模型由亏转盈。外部治理、封存样本外评价和实时前瞻测试解决的是不同问题,不能互相替代。
3. 紧凑显式代码有利于局部修改,生产覆盖却需要更多抽象
PithTrain-arXiv26 表明,扁平 Python、局部错误栈和任务技能可以显著降低智能体成本;OpenHands-SDK-MLSys26 与 Murakkab-OSDI26 在面对版本兼容、远程工作目录、多租户和完整工作流时,却必须增加接口和控制面。量化平台还要处理历史时点数据、公司行动、借券、优化器、模拟交易接口、实盘接口和合规要求。因此问题不是“代码越少越好”,而是区分不可删除的业务语义与纯粹的智能体探索成本。
4. 多角色专业化与最小对抗结构没有统一结论
AutoScientists-arXiv26 认为动态团队、同伴批评和无效方向登记可以扩大搜索覆盖;DeepFund-arXiv25、BacktestBench-KDD26 与 QuantConnect 按分析、检索、验证或回测职责拆分角色;AgonAlpha-arXiv26 则认为提议者和审查者已是形成对抗验证的最小结构。DDR-Bench-ICML26 还发现,通用多智能体组件不能稳定提高发现准确率。真正需要比较的是独立信息、权限边界、否决权和交接成本,而不是角色数量。
5. 来源可追踪能阻止编造,却不能证明金融结论正确
EviGraph-arXiv26、PaperBench-ICML25 与 AgonAlpha-arXiv26 都把论断绑定到执行记录或独立重跑,因此能够发现“数字并非来自这次运行”。Market-Bench-arXiv25 与 BacktestBench-KDD26 又显示,代码能执行、数据查询正确和金融逻辑正确是三种不同性质。但这些边界仍不能自动发现错误的历史时点关联、幸存者偏差(只保留后来仍存在的资产造成的样本偏差)或不现实成交;确定性复现也可以稳定复现错误协议。
6. 固化技能提高复现性,也可能稳定执行过时流程
PithTrain-arXiv26 的技能消融表明,操作手册可以显著减少智能体交互轮数;SkVM-SOSP26 却发现原始技能会让 15% 的任务退化,AgenticCache-MLSys26 的纯计划缓存也会因环境变化而失效。量化技能若固化旧股票范围、旧数据延迟、旧成本模型或旧合规规则,智能体只会更一致地执行错误研究。
7. 直接交易更接近最终结果,研究产物更容易控制
AlphaForgeBench-KDD26 观察到,直接输出买卖动作的智能体即使采用确定性解码,也会出现动作分歧;TradeTrap-arXiv25 进一步展示小扰动如何通过组合账本和执行层放大。让 LLM 只生成因子、代码和证据产物,能够改善可复现性,却只是把风险后移到组合构建、模拟交易和实盘发布,不能省略这些阶段。
脆弱假设
1. “LLM 不看原始市场数据”足以防止信息泄漏
这一假设来自 RD-Agent-Quant-arXiv25。数据模式隔离能阻止智能体直接读取测试数据行,却不能阻止它从字段名、反复返回的信息系数(Information Coefficient,IC)和 IR、预训练记忆以及验证器的错误反馈中推断测试分布。验证时应固定候选预算,比较完整数据、只给字段结构和打乱字段语义三组设置;同时保留智能体从不访问的第二层时间留出集,报告验证集与封存集差距如何随查询次数变化。
2. 反复回测后的收益增长代表真实发现率
这一假设来自 RD-Agent-Quant-arXiv25、AgonAlpha-arXiv26、RE-Bench-ICML25 与 GEPA-ICLR26;Chain-of-Alpha 的撤稿摘要只能说明社区也在尝试类似反馈环。快速反馈确实能提高多次尝试中的最好结果,但也扩大多重检验问题。评价应完整记录候选总数、候选家族、验证次数和淘汰原因,并结合经选择偏差修正的夏普比率(Sharpe ratio)、回测过拟合概率(Probability of Backtest Overfitting,PBO)、封存样本外评价和多次独立研究,同时报告平均结果、最好结果和有效发现率。
3. 外部平台得分足以代表可投资的超额收益信号
这一假设来自 AgonAlpha-arXiv26、WorldQuant BRAIN 与 Numerai。外部平台能减少作者操控,却可能使用闭源数据和规则;历史评分也不包含真实借券、容量、冲击成本和研究者自己的投资约束。需要把同一个冻结研究产物依次送入外部评分、未参与搜索的前瞻窗口、成本感知组合和模拟交易,并测量每一级的晋级存活率,而不能只看最高夏普比率。
4. 紧凑、显式且以 Python 为主的量化框架会减少研究错误
这是把 PithTrain-arXiv26 外推到量化领域的核心待测假设,目前没有直接证据。量化智能体的主要成本可能来自数据语义和统计判断,而不是代码导航;生产框架的共享抽象也可能降低跨市场和跨策略修改成本。应固定智能体与量化任务,在 Qlib 和 RD-Agent、QuantConnect 和 LEAN,以及一个紧凑参考框架上比较会话时间、交互轮数、上下文、失败运行、数值错误但能执行的回测,以及跨策略修改引入的缺陷。
5. 更多智能体或更细角色能提高研究质量
这一假设来自 AutoScientists-arXiv26、DeepFund-arXiv25、BacktestBench-KDD26 和 QuantConnect Assistant Teams(按职责编排多个助理的产品),同时受到 DDR-Bench-ICML26 与 AgonAlpha-arXiv26 的挑战。需要在模型、令牌数、回测次数和实际运行时间相同的条件下,比较单智能体加技能、固定流水线、提议者与审查者双角色,以及动态团队;分别测量候选多样性、错误相关性、交接损失、封存样本外有效发现率和总成本。
6. 执行来源可追踪足以保证研究正确
这一假设来自 EviGraph-arXiv26、PaperBench-ICML25、Market-Bench-arXiv25 与 BacktestBench-KDD26。可重跑只证明同一代码能够得到同一数字;错误数据快照、未来函数和错误成本模型仍然可以确定性复现。研究产物还需要记录数据谱系、历史时点、股票范围、公司行动、随机种子、执行环境、代码提交、成本模型和约束模型;验证时应逐类注入错误,测量验证器的检出率。
7. 日志或 Markdown 足以安全恢复研究状态
这一假设来自 OpenHands-SDK-MLSys26、AutoScientists-arXiv26、InnovatorBench-ICLR26 与 长程智能体可靠性。异步回测、过期结果、模型或数据版本切换和进程重启,可能让恢复后的状态绑定到错误研究产物。应注入进程崩溃、结果乱序、重复回调、损坏检查点、上下文压缩和验证器升级,报告研究产物是否只提交一次、状态丢失率、恢复时间和重复副作用。
产业动态
Microsoft RD-Agent 与 Qlib
RD-Agent 官方仓库 已提供 rdagent fin_quant、fin_factor 与 fin_model,并以 Qlib 承担数据处理、因子或模型实现和回测。NeurIPS 2025 论文集 确认该论文进入数据集与基准赛道(Datasets and Benchmarks Track);这说明 wiki 中的 arXiv25 发表信息已经滞后。本文不修改论文层,只记录这一覆盖缺口。官方实现支持加载并继续会话,也用 Docker 隔离执行环境;但公开证据仍集中在历史回测,仓库免责声明也明确它不是可直接用于投资的成品系统。
QuantConnect 智能体流水线
QuantConnect Assistants 是公开资料中最接近完整面向智能体量化流程的工业系统。Research Assistant 在研究笔记本中形成报告;Research Validation Assistant 使用增广迪基—富勒检验(Augmented Dickey-Fuller test,ADF)、Breusch-Godfrey 自相关检验、Breusch-Pagan 异方差检验和总体稳定性指数(Population Stability Index,PSI)检查模型;Backtest Assistant 反复编写、编译、修复并运行代码;Paper Testing Assistant 比较模拟交易与同期回测,最多诊断三轮并可停止算法;Live Monitoring Assistant 只负责告警,不建议交易。公开文档说明了功能和权限边界,但没有受控效果评价、封存样本外防线、故障注入或选择偏差记账。
WorldQuant BRAIN 外部评测平台
WorldQuant BRAIN 提供数据、Fast Expression 表达式语言、模拟、性能面板和提交门槛,使智能体可以在外部治理的 DSL 中构造并验证超额收益信号。AgonAlpha-arXiv26 已把它用作独立验证器。优势是智能体不能修改验证器;代价是数据、规则和评级并不公开,学术界无法完整审计历史时点、成本与候选总数,历史评级到实盘管理资产规模(assets under management,AUM)的映射也不公开。
Numerai 与 Numerai Signals
Numerai 使用混淆数据、延迟结算目标、相关系数(correlation,CORR)、对总模型的边际贡献(Meta Model Contribution,MMC)、代币质押和实时轮次,形成外部评价与激励;Numerai Signals 允许研究者提交自己的信号。它比作者自建回测更独立,也更接近前瞻评价,但不会自动执行从假设到代码再到证据的研究过程,指标和数据版本仍由平台治理。
覆盖缺口
- 本次已补齐 AgonAlpha-arXiv26、AlphaForgeBench-KDD26、Market-Bench-arXiv25、TradeTrap-arXiv25、DeepFund-arXiv25 与 BacktestBench-KDD26。Chain-of-Alpha 因撤稿且无可用 PDF 只保留摘要线索;QuantConnect Assistants 是产品文档,不建立 paper 页。
- RD-Agent-Quant-arXiv25 已正式发表于 NeurIPS 2025,但论文页和文件名仍保留 arXiv 标识。
- 研究产物、封存留出集、历史时点数据谱系和策略退役在当前 wiki 中尚未形成独立概念页;目前只保留为概念候选,不在本调研中建页。
候选空白
1. 面向量化框架的智能体任务效率评价
PithTrain 的智能体任务效率(agent-task efficiency,ATE)基准 ATE-Bench 固定智能体和任务,只改变框架;量化基准却几乎都固定框架,只改变模型或智能体。尚未看到在相同数据快照、因子任务、回测任务和验证器下,对 Qlib 与 RD-Agent、QuantConnect 与 LEAN,以及紧凑参考框架比较交互轮数、上下文、失败运行、计算时间和“能运行但结果错误”的研究产物。
2. 带类型且可失效的量化研究产物
AgonAlpha-arXiv26 已冻结假设、表达式、平台证据、经济解释和审查状态;EviGraph-arXiv26 已建立论断依赖关系。但没有工作统一表达历史时点数据、股票范围、代码与环境、回测、统计检验、成本模型、组合约束、论断和晋级决定,并在上游变化时确定性地使下游证据失效。现有谱系多能解释“结果如何得到”,却不能回答“哪些结论现在仍然有效”。
3. 搜索器与最终评价之间的自适应过拟合隔离层
R&D-Agent(Q) 与 AgonAlpha-arXiv26 都从验证器获得搜索反馈,但没有同时实现预算记账、候选总数记录、搜索可见验证集、封存的第二层留出集、前瞻测试和晋级门槛。Chain-of-Alpha 的摘要描述相似反馈,却因缺少全文无法改善这一证据缺口。尤其缺少一种系统协议:智能体查询越多,最终证据门槛就相应提高。
4. 从回测到模拟交易再到实盘的机器可判晋级契约
QuantConnect 已公开功能链,DeepFund-arXiv25 提供实时基准,AlphaForgeBench-KDD26 主张把推理与执行分离;但尚无公开学术系统把每一级晋级所需的输入研究产物、容差、最短观察期、停止条件、回滚和人工批准统一成可复现实验。策略能完成回测,与策略可以投入真实资金之间仍是黑箱。
5. 崩溃一致且恰好执行一次的异步量化研究运行时
崩溃一致指系统失败后不会留下无法解释的半完成状态;恰好执行一次指重试不会重复产生外部副作用。InnovatorBench、Agentix、OpenHands SDK 和长程智能体可靠性研究已暴露异步任务、进度替代指标、事件日志与重启问题;量化研究仍缺少对过期回测、重复回调、错误的代码与结果绑定、数据修订和模拟订单重试的系统性故障注入。现有论文通常把这类失败当作智能体轨迹问题,而不是事务语义问题。
6. 策略退役与证据衰减
151 Strategies 明确指出市场结构会使策略失效,量化投研主题页也把监控和退役列为空白。当前智能体系统擅长生成候选和推进候选,却几乎没有公开证据说明如何根据超额收益衰减、相关性上升、容量下降、数据源失效或模型升级,自动使旧证据失效、切回尚未正式接管、仅作对照的影子方案,并决定退役。
7. 角色组织结构的同预算因果实验
产业产品偏好按组织职责拆分智能体,AutoScientists-arXiv26 偏好动态团队,AgonAlpha-arXiv26 偏好最小的提议者和审查者,PithTrain-arXiv26 则偏好单个编码智能体加技能。尚无量化工作负载在模型、令牌和回测次数相同的条件下因果比较这些组织结构。因此,“像真实对冲基金一样分工”目前更多是一种界面比喻,而不是已经验证的系统规律。
8. 面向智能体设计的紧凑性能否长期维持
PithTrain 没有评价功能增长后的紧凑性;量化系统却天然会不断增加资产类别、数据供应商、交易场所、风险模型和合规矩阵。尚无工作按版本追踪代码行数、间接调用层次、技能数量、跨策略修改规模、重复逻辑、回归缺陷和智能体成本,因此无法判断局部可读性的优势何时会转化为复制和治理负担。
关键未知
1. 量化研究智能体的真实瓶颈在哪里?
测量建议:采集完整事件轨迹,把主动工作时间分为文献与数据查找、代码导航、实现、数据加载、回测排队、调试、统计解释、组合与风险分析、人工把关;在 20–30 个真实任务上报告关键路径和失败长尾。若主要成本来自数据与统计,PithTrain 式代码紧凑化只能解决次要问题。
2. 不同框架的排序能否跨智能体和模型保持稳定?
测量建议:固定任务、容器、数据快照和验证器,在至少三种智能体外壳上交叉运行三个框架;每个组合至少运行 5 个随机种子,报告成功率、交互轮数、上下文规模、错误结果率、实际运行时间和总计算量,并用重复重采样得到自助法置信区间(bootstrap confidence interval)。
3. 查询多少次之后,验证集已经不再属于真正的样本外?
测量建议:对固定因子语法和搜索器分别允许 10、50、200 和 1000 次验证器查询,保留从不反馈的第二层时间留出集和前瞻窗口;绘制候选数量与验证集和封存集差距、经选择偏差修正的夏普比率、PBO 和有效发现率之间的关系。
4. 哪些错误必须由确定性验证器检查,哪些可以交给 LLM 审查者?
测量建议:构造错误变异测试集,分别注入未来信息关联、幸存者偏差、错误复权、延迟偏移、遗漏成本、持仓记账错误、论断扩大和市场状态挑选;比较规则或静态分析、独立重跑、独立上下文 LLM 和领域专家的检出率、误报率、成本与互补性。
5. 外部评级有多少能转化为可投资结果?
测量建议:冻结通过 BRAIN、Numerai 或学术门槛的候选,禁止继续调参,再进入预注册前瞻窗口、成本感知组合和模拟交易;报告每一级的存活率、净夏普比率、IR、容量、换手率、回撤和人工否决原因,而不只展示最好结果。
6. 能够正确恢复研究所需的最小状态是什么?
测量建议:从“假设、数据哈希与历史时点、代码提交、执行环境、任务编号、研究产物、验证器版本、当前最佳方案、失败方向”开始做删项实验;注入崩溃、结果乱序和验证器升级,测量系统能否恢复到同一研究前沿,以及缺少哪些字段会造成系统不报错、结果却已失效的无声污染。
7. 技能在市场、模型和数据版本变化后何时失效?
测量建议:把同一验证、回测和晋级技能迁移到 A 股与美股、日频与日内、Qlib 与 LEAN,以及不同智能体;同时注入接口模式、成本模型、应用程序编程接口(Application Programming Interface,API)和验证器版本变化,报告成功率、无声错误率、回退率和重新编写成本。
8. 多智能体收益来自并行、独立信息,还是权限分离?
测量建议:在预算相同的条件下,分别只增加工作智能体数量、只增加独立上下文、只赋予审查者否决权、只提供角色专用工具;用每次只改变一种机制的析因消融实验,比较候选多样性、错误相关性、审查检出率、封存集有效发现率和协调令牌成本。
9. 哪些关口必须由人类把守?
测量建议:记录人工干预日志,区分股票范围与风险偏好、数据许可、统计设计、封存样本外解封、模拟交易或实盘晋级和异常处置;比较无人把关、固定把关和风险触发把关三种设置的错误阻断率、漏放率、研究速度和操作人员负担。
10. 面向智能体的设计能否随生产覆盖增长而保持优势?
测量建议:维护 6–12 个月的版本序列,逐月记录代码行数、注册表与间接调用层次、技能时效、跨策略修改规模、重复逻辑、回归缺陷和 ATE;分别绘制局部修改、跨策略修改、数据供应商迁移和事故恢复任务中的增长曲线。