DeepFund 实时基金投资基准(arXiv 2025)
原题:Time Travel is Cheating: Going Live with DeepFund for Real-Time Fund Investment Benchmarking
一句话总结:DeepFund 用模型知识截止时间之后的实时数据评测九种 LLM,在最初 24 个交易日中只有 Grok 3 获得正累计收益,说明历史回测的预训练污染会掩盖模型面对真实市场时的脆弱性。
问题与动机
历史回测可能落在模型预训练语料覆盖期内,模型因记得事件结果而表现出虚假的预测能力。DeepFund 因而把评价窗口移到各模型知识截止时间之后,并让所有模型在相同实时数据和组合初始条件下运行。
论文评价的是直接投资决策智能体,而不是从假设、代码到证据的量化研究系统。它回答“模型能否实时管理基金”,不回答策略代码是否可复现、研究搜索是否过拟合或何时可以晋级实盘。
关键观察 / 隐含假设
- 观察 1:24 个交易日内九种模型都能完成数据、信号和决策流程,但只有 Grok 3 获得正累计收益(§4.1,表 3)。
- 依赖假设:知识截止时间之后的数据足以消除关键的预训练污染。
- 可能失效场景:模型可能已从更新后的检索源获得事件信息;短窗口也无法代表长期能力。
- 观察 2:论断与动作一致不等于盈利。Grok 的 11 次买入中 7 次有效、10 次卖出中 5 次有效;DeepSeek 的 3 次买入中仅 1 次有效(§4.3)。
- 依赖假设:论文对“有效决策”的次日价格方向判定足以代表经济价值。
- 假设 1:把规划者、分析师和组合经理分成多个角色能近似真实基金流程。
- 证据强度:弱;所有角色由同一基础模型驱动,没有与单智能体做同预算因果比较。
核心方法
DeepFund 由实时环境、角色流水线和评价界面组成。实时环境从 Yahoo Finance、Alpha Vantage 等接口获取价格、新闻、基本面和内部交易数据;规划者选择分析角色,技术、公司新闻、政策和内部交易分析师并行给出看多、看空或中性信号,组合经理结合信号、持仓与历史作出买入、卖出或持有决定。
系统用 FundState 保存当前现金、仓位、信号和决策,并把历史活动写入 PostgreSQL。这个设计使运行轨迹可检查,但论文没有证明跨模型版本或数据修订后的确定性重放。
设计取舍
- 实时评价换取低污染证据:避免在模型可能见过的历史事件上评分,但实验只能观察一条不可重复的市场路径。
- 固定角色接口换取可比性:统一输入和输出模式,但角色分工本身是否带来收益没有消融。
- 边界条件:最初窗口只有 24 个交易日、五只美股、无费用和市场约束;扩展到 2025 年第二季度后结论有所缓和,部分早期亏损模型最终转正。
实验与结果
- 2025-03-17 至 2025-04-17、五只 Berkshire Hathaway 重仓股、每模型初始资金 100,000 美元;4,320 个信号中 96% 格式有效,1,080 个决定中 98% 有效(§3)。
- 只有 Grok 3 在最初窗口获得正累计收益;DeepSeek 最大回撤达到 14.5%,而被动买入并持有对波动更有韧性(§4.1,表 3)。
- 两种模型都没有预判 AAPL 在 4 月 9 日从 172.42 美元升至 198.85 美元的反转(§4.2,图 4)。
- 总运行成本约 100 美元,其中模型接口、金融数据和云数据库分别约占 40%、40% 和 20%(§3)。
论断—证据表
| 论断 | 证据 | 评测边界 | 置信度 |
|---|---|---|---|
| 历史回测会高估直接交易智能体 | §1 的污染论证与 §4.1 实时结果 | 单次实时窗口,无法与同模型污染回测做严格配对 | 中 |
| 流程成功不能代表可盈利 | §3 的 96%/98% 有效率与表 3 的多数亏损 | 九种模型、五只美股、24 个交易日 | 强 |
| 角色分工改善投资决策 | 图 2 与系统实现 | 无单角色或角色数量消融 | 弱 |
批判性分析
论证链条
论文有力证明“能产生合法动作”不等于“能管理资金”,但没有直接证明亏损主要来自去除了预训练污染;市场窗口、提示词、角色流程和风险规则也可能造成差异。
假设压力测试
若评价期延长、资产范围扩大或加入费用,模型排序可能改变。扩展到整个 2025 年第二季度后 GPT-4.1、Claude 3.7 和 DeepSeek V3 转为盈利,已经说明最初 24 日排序不稳定。
实验可信度
同一实时路径提高了横向公平性,却没有随机种子重复、预注册门槛或统计置信区间。论文报告绝对收益,但未把候选选择、接口版本和人工调试纳入证据边界。
系统性缺陷
论文未讨论崩溃恢复、外部接口数据修订、订单恰好执行一次、状态完整性验证或模型版本漂移;这些问题在真实资金环境中比输出格式失败更危险。
局限与后续工作
- 局限 1:仅覆盖美股、短窗口和简化执行,不含费用、滑点与交易限制。
- 局限 2:所有角色共享同一模型,无法区分并行、独立信息和权限分离的作用。
- 后续工作 1:预注册至少 6 个月的多市场前瞻窗口,报告净收益、换手率、容量、人工干预和模型接口版本。
- 后续工作 2:在相同模型与令牌预算下比较单角色、固定多角色和带独立审查者的流程。