DeepFund 实时基金投资基准(arXiv 2025)

原题:Time Travel is Cheating: Going Live with DeepFund for Real-Time Fund Investment Benchmarking

一句话总结:DeepFund 用模型知识截止时间之后的实时数据评测九种 LLM,在最初 24 个交易日中只有 Grok 3 获得正累计收益,说明历史回测的预训练污染会掩盖模型面对真实市场时的脆弱性。

问题与动机

历史回测可能落在模型预训练语料覆盖期内,模型因记得事件结果而表现出虚假的预测能力。DeepFund 因而把评价窗口移到各模型知识截止时间之后,并让所有模型在相同实时数据和组合初始条件下运行。

论文评价的是直接投资决策智能体,而不是从假设、代码到证据的量化研究系统。它回答“模型能否实时管理基金”,不回答策略代码是否可复现、研究搜索是否过拟合或何时可以晋级实盘。

关键观察 / 隐含假设

  • 观察 1:24 个交易日内九种模型都能完成数据、信号和决策流程,但只有 Grok 3 获得正累计收益(§4.1,表 3)。
    • 依赖假设:知识截止时间之后的数据足以消除关键的预训练污染。
    • 可能失效场景:模型可能已从更新后的检索源获得事件信息;短窗口也无法代表长期能力。
  • 观察 2:论断与动作一致不等于盈利。Grok 的 11 次买入中 7 次有效、10 次卖出中 5 次有效;DeepSeek 的 3 次买入中仅 1 次有效(§4.3)。
    • 依赖假设:论文对“有效决策”的次日价格方向判定足以代表经济价值。
  • 假设 1:把规划者、分析师和组合经理分成多个角色能近似真实基金流程。
    • 证据强度:弱;所有角色由同一基础模型驱动,没有与单智能体做同预算因果比较。

核心方法

DeepFund 由实时环境、角色流水线和评价界面组成。实时环境从 Yahoo Finance、Alpha Vantage 等接口获取价格、新闻、基本面和内部交易数据;规划者选择分析角色,技术、公司新闻、政策和内部交易分析师并行给出看多、看空或中性信号,组合经理结合信号、持仓与历史作出买入、卖出或持有决定。

系统用 FundState 保存当前现金、仓位、信号和决策,并把历史活动写入 PostgreSQL。这个设计使运行轨迹可检查,但论文没有证明跨模型版本或数据修订后的确定性重放。

设计取舍

  • 实时评价换取低污染证据:避免在模型可能见过的历史事件上评分,但实验只能观察一条不可重复的市场路径。
  • 固定角色接口换取可比性:统一输入和输出模式,但角色分工本身是否带来收益没有消融。
  • 边界条件:最初窗口只有 24 个交易日、五只美股、无费用和市场约束;扩展到 2025 年第二季度后结论有所缓和,部分早期亏损模型最终转正。

实验与结果

  • 2025-03-17 至 2025-04-17、五只 Berkshire Hathaway 重仓股、每模型初始资金 100,000 美元;4,320 个信号中 96% 格式有效,1,080 个决定中 98% 有效(§3)。
  • 只有 Grok 3 在最初窗口获得正累计收益;DeepSeek 最大回撤达到 14.5%,而被动买入并持有对波动更有韧性(§4.1,表 3)。
  • 两种模型都没有预判 AAPL 在 4 月 9 日从 172.42 美元升至 198.85 美元的反转(§4.2,图 4)。
  • 总运行成本约 100 美元,其中模型接口、金融数据和云数据库分别约占 40%、40% 和 20%(§3)。

论断—证据表

论断证据评测边界置信度
历史回测会高估直接交易智能体§1 的污染论证与 §4.1 实时结果单次实时窗口,无法与同模型污染回测做严格配对
流程成功不能代表可盈利§3 的 96%/98% 有效率与表 3 的多数亏损九种模型、五只美股、24 个交易日
角色分工改善投资决策图 2 与系统实现无单角色或角色数量消融

批判性分析

论证链条

论文有力证明“能产生合法动作”不等于“能管理资金”,但没有直接证明亏损主要来自去除了预训练污染;市场窗口、提示词、角色流程和风险规则也可能造成差异。

假设压力测试

若评价期延长、资产范围扩大或加入费用,模型排序可能改变。扩展到整个 2025 年第二季度后 GPT-4.1、Claude 3.7 和 DeepSeek V3 转为盈利,已经说明最初 24 日排序不稳定。

实验可信度

同一实时路径提高了横向公平性,却没有随机种子重复、预注册门槛或统计置信区间。论文报告绝对收益,但未把候选选择、接口版本和人工调试纳入证据边界。

系统性缺陷

论文未讨论崩溃恢复、外部接口数据修订、订单恰好执行一次、状态完整性验证或模型版本漂移;这些问题在真实资金环境中比输出格式失败更危险。

局限与后续工作

  • 局限 1:仅覆盖美股、短窗口和简化执行,不含费用、滑点与交易限制。
  • 局限 2:所有角色共享同一模型,无法区分并行、独立信息和权限分离的作用。
  • 后续工作 1:预注册至少 6 个月的多市场前瞻窗口,报告净收益、换手率、容量、人工干预和模型接口版本。
  • 后续工作 2:在相同模型与令牌预算下比较单角色、固定多角色和带独立审查者的流程。

相关