深度调研(Probe):面向智能体的量化研究系统
阅读提示
本文所说的面向智能体(agent-native),是指研究环境从接口、状态和验证方式上就便于智能体操作、检查与恢复,而不是让大语言模型(Large Language Model,LLM)直接给出买卖指令。研究产物(artifact)是一次研究中可保存、复查和重放的假设、数据版本、代码、实验结果与论断集合;验证器(verifier)是执行检查并给出通过或失败结论的组件。
时点一致(point-in-time)要求每个历史决策只能使用当时已经可见的数据。样本外(out-of-sample,OOS)评价使用未参与训练或调参的数据;封存留出集则对整个搜索过程不可见,只在最终检验时解封。自适应过拟合(adaptive overfitting)是指搜索器反复读取同一验证反馈后,逐渐适应该窗口中的偶然噪声。崩溃一致性(crash consistency)要求失败后恢复出的状态仍然可解释;恰好执行一次(exactly-once)要求重试不会重复产生下单、提交或写入等外部副作用。
范围:本调研关注如何把研究假设、历史数据、因子或模型代码、回测、论断、组合决策以及模拟与实盘晋级组织成可审计的研究系统。仅输出交易动作、只做行情预测或只优化模型服务性能的工作,不因使用 LLM 自动成为核心路线。
一页结论
- 研究版图已经分成六条路线。 量化研究对象、自动研究闭环、金融语义验证、研究过程评测、证据生命周期和智能体运行时分别解决“研究什么、如何搜索、怎样判错、怎样评能力、怎样维护结论、怎样可靠执行”。目前没有一篇论文把六条路线闭合成一个系统。
- 时间上的关键变化不是模型更强,而是研究状态逐渐显式化。 2015–2018 年工作公开公式和策略分类;2024–2025 年系统开始闭合假设到实验的反馈;2026 年重点转向冻结研究产物、执行账本、证据失效和受约束沙箱。
- 最普遍的缺陷是评价边界没有随自动化速度同步加强。 六篇仓库内闭环工作都没有同时提供搜索不可见的终局评价和长期前瞻结果;十四篇量化核心论文都没有贯通封存评价、模拟交易、实盘治理与策略退役。
- 可重放、可追踪和金融正确是三种不同保证。 BacktestBench 等工作证明代码可以运行但指标仍然错误;EviGraph 与 OmniScientist 能绑定数字来源,却不能自动发现未来信息泄漏、错误成本模型或不现实成交。
- 提案前最需要的不是再设计一个角色,而是测量三个边界。 一是验证集与封存集差距如何随查询次数增长;二是上游数据、代码或验证器改变时哪些下游结论必须失效;三是崩溃、乱序结果和重复回调下,研究状态能否无重复副作用地恢复。
范围与证据
本次从 Finance、Auto-Research、Agent-Systems 与 Long-Horizon-Agents 出发,复核 40 篇仓库论文页。其中 29 篇为 complete/full-text,11 篇为 needs-review/full-text。后者只补充路线覆盖,不单独支撑共同缺陷、关键争议或候选空白。
量化领域的直接证据来自 Finance 的 14 篇核心论文;其余 26 篇用于回答通用研究智能体已经具备哪些验证、状态与运行时机制,以及这些机制迁移到量化场景时缺什么。外部搜索补充 XALPHA 与 AQuA,它们尚未进入 wiki,本文只把论文原页可核对的信息作为外部线索,不让它们单独支撑强结论。自主公式阿尔法发现综述已升级为 内部全文证据。
研究版图
| 研究路线 | 核心问题 | 代表工作 | 当前边界 |
|---|---|---|---|
| 量化研究对象与目标 | 智能体究竟搜索公式、预测模型还是组合权重 | 101 Alphas、TimesFM-Fin、UPSA、自主公式化阿尔法发现综述 | 对象定义较成熟,但数据、成本和市场状态会改变其可交易性 |
| 自动研究闭环 | 如何让实验反馈改变下一轮假设与实现 | R&D-Agent(Q)、AutoScientists、AgonAlpha | 已能持续搜索和保留部分经验,终局评价仍可能被搜索污染 |
| 金融语义验证 | 如何区分代码能运行、数值正确与策略可投资 | Market-Bench、BacktestBench、AlphaEval | 确定性基准覆盖局部语义,未覆盖完整生产成交和长期有效性 |
| 研究过程评测 | 如何衡量问题构建、执行、反馈控制和验证器利用 | PaperBench、RE-Bench、Beyond Final Scores | 能诊断长程失败,但固定任务与真实开放研究之间仍有鸿沟 |
| 证据生命周期 | 如何让论断绑定来源,并在上游变化后失效或回滚 | EviGraph、OmniScientist、Cordis | 来源追踪逐渐成熟,统计正确性、外部副作用与故障恢复证据不足 |
| 面向智能体的运行时 | 如何降低操作成本并管理程序、技能、调度和状态 | OpenHands SDK、SkVM、Murakkab | 通用机制丰富,但不理解历史时点、订单、成本和研究晋级语义 |
六条路线不是平行产品模块,而是一条证据链的不同层级:研究对象定义候选,闭环产生候选,金融验证淘汰局部错误,过程评测判断搜索是否可靠,证据生命周期维护结论有效性,运行时保证整个过程在故障和并发下仍可执行。当前论文大多只证明其中一层。
时间脉络
总体阶段
公开公式与策略分类
→ 可执行研究与过程基准
→ 根据反馈持续搜索
→ 冻结产物并独立复跑
→ 让证据可失效、状态可恢复、策略可退役最后一阶段仍主要是待完成的系统边界,而不是已有论文已经闭合的能力。
量化研究对象:从静态公式到组合与多模态信号
- 2015 — 101-Alphas-arXiv15:把生产因子从私有知识变成可执行公式集合,但收益统计仍绑定专有数据和无成本环境。
- 2018 — 151-Trading-Strategies-SSRN18:把公式扩展为跨资产策略分类,并明确提出市场结构变化会让策略失效,研究对象首次带上生命周期问题。
- 2023 — UPSA-NBER23:把重点从发现单个信号转向在高维、有限样本下稳健组合多个收益流,说明下游估计误差会反过来改变上游候选价值。
- 2024–2026 — TimesFM-Fin-arXiv24 与 NewsShock-NBER26:研究对象从人工公式扩展到基础模型和新闻表示;信息源更丰富,但预测准确率到净可交易收益之间的链路更长。
- 2026 — Yu-FormulaicAlphaDiscovery-arXiv26:把公式搜索重新表述为受噪声适应度、非平稳市场和多目标约束的六组件进化闭环,使研究对象扩展到发现过程本身。
自动研究闭环:从执行流水线到持久研究状态
- 2024 — AI-Scientist-arXiv24:首次把想法、代码、实验、写作和自动评审串成完整流水线,代价是验证高度依赖同类模型自评。
- 2025 — RD-Agent-Quant-arXiv25:把闭环落到量化因子与模型联合优化,使回测反馈真正改变下一轮研究对象。
- 2025 — Kosmos-AI-Scientist-arXiv25:用结构化世界模型压缩并行研究轨迹,关注点从“跑完流程”转向“跨轮次保存什么经验”。
- 2026 — AutoScientists-arXiv26:把当前最佳方案、失败方向和团队讨论变成共享状态,说明多智能体价值可能来自状态协议而非角色数量。
- 2026 — AgonAlpha-arXiv26:冻结假设、公式、平台证据和审查结论,并让独立上下文审查者复跑,关注点进一步转向证据归属与否决权。
- 2026 外部线索 — XALPHA 与 AQuA:前者把报告知识与历史发现反馈写入多源记忆,后者用两个相互隔离的受限沙箱保留验证过的证据;两者都显示持续学习正在成为量化闭环的主线,但尚未进入本仓库全文审计。
评价:从最终分数到执行语义和过程控制
- 2024 — MLAgentBench-ICML24:把机器学习实验循环变成可执行任务,暴露坏规划、未运行便宣称成功和长轨迹退化。
- 2025 — MLE-Bench-ICLR25、PaperBench-ICML25 与 RE-Bench-ICML25:分别引入隐藏排行榜、独立重执行和人类时间预算对照;评价开始区分重复尝试、真实执行和结果匹配。
- 2025 — Market-Bench-arXiv25 与 TradeTrap-arXiv25:量化评价从收益分数扩展到持仓路径、记账语义和状态篡改后的错误传播。
- 2026 — BacktestBench-KDD26、AlphaForgeBench-KDD26 与 AlphaEval-KDD26:形成确定性回测、代码稳定性和高吞吐筛选三种互补边界,同时更清楚地暴露“可执行不等于金融正确、筛选高效不等于终局有效”。
- 2026 — Yu-FormulaicAlphaDiscovery-arXiv26:用搜索效率、适应度可靠性、残余质量、经济多样性、可交易性、进化自主性、非平稳稳健性和可复现性八维矩阵,把评价对象从最终因子扩展到完整发现过程。
- 2026 — Li-LongHorizonResearchEvaluation-arXiv26、DDR-Bench-ICML26 与 ResearchClawBench-arXiv26:评价对象扩展到问题构建、主动停止、经验迁移和证据匹配,不再只看最终得分。
状态与运行时:从事件日志到可失效证据
- 2025 — OpenHands-ICLR25:用动作—观察事件流和容器把工具执行变成通用智能体平台能力。
- 2026 — OpenHands-SDK-MLSys26 与 PithTrain-arXiv26:一条路线用事件溯源和不可变组件支撑集成,另一条路线用紧凑显式代码降低智能体探索成本,形成“完整控制面”和“最小可操作表面”的分歧。
- 2026 — SkVM-SOSP26、Agentix-NSDI26 与 Murakkab-OSDI26:技能、完整程序和工作流画像成为运行时对象,调度不再只面对单次模型请求。
- 2026 — EviGraph-arXiv26、OmniScientist-arXiv26 与 Cordis-TechReport26:研究状态从日志升级为依赖图、执行账本和可撤销效应;新的核心问题是错误输入如何使下游论断失效,以及外部副作用是否真的可恢复。
各类工作的演化
量化研究对象与目标
共同目标:定义可被程序生成、执行和比较的研究对象。公式因子强调可解释和可组合,时间序列模型与新闻表示扩大信息来源,UPSA 处理候选进入组合后的估计误差,自主公式化阿尔法发现综述则把表示、生成、评价、选择、记忆和市场适应纳入同一对象边界。
演化与分歧:101-Alphas-arXiv15 和 151-Trading-Strategies-SSRN18 把人类知识编码成公式模板;TimesFM-Fin-arXiv24 尝试减少人工特征设计;NewsShock-NBER26 用传统特征无法解释的文本残差界定新信息;UPSA-NBER23 不生成信号,而是稳健组合已有收益流;自主公式化阿尔法发现综述提供跨路线坐标,却没有实证校准。它们对“研究对象”的定义不同,不能只用单一预测指标横向排序。
共同边界:六篇工作都不能单独证明某个候选在真实成本、容量、借券和市场状态变化下仍可投资。它们是自动研究系统的对象层,不是发布关口。
相关工作:101-Alphas-arXiv15、151-Trading-Strategies-SSRN18、TimesFM-Fin-arXiv24、NewsShock-NBER26、UPSA-NBER23、Yu-FormulaicAlphaDiscovery-arXiv26
自动研究闭环
共同目标:让历史实验不只产生报告,还能改变下一轮假设、实现和预算分配。
演化与分歧:AI Scientist 系列以树搜索扩大候选;R&D-Agent(Q) 用固定研究单元和多臂老虎机在因子与模型之间分配方向;Kosmos 与 AutoScientists 强调跨轨迹记忆和共享最佳状态;AgonAlpha 强调冻结研究产物、独立复跑和外部平台。外部的 XALPHA 与 AQuA 又分别把研究记忆和受限沙箱推到中心位置。
共同边界:仓库内六篇闭环工作都让某种验证反馈进入后续决策,但没有同时提供搜索不可见的最终数据、完整查询预算、长期前瞻结果和策略退役协议。闭环越快,这一缺口越严重。
相关工作:AI-Scientist-arXiv24、AI-Scientist-v2-arXiv25、RD-Agent-Quant-arXiv25、Kosmos-AI-Scientist-arXiv25、AutoScientists-arXiv26、AgonAlpha-arXiv26
金融语义验证
共同目标:把“模型生成了代码”分解为代码能执行、数据查询正确、金融指标正确、路径记账正确和结果可能可交易。
演化与分歧:Market-Bench 对齐参考实现的盈亏、回撤和持仓路径;BacktestBench 把查询、指标和代码拆成独立任务;AlphaForgeBench 用一次生成、确定性执行减少运行间随机性;AlphaEval 以多个代理指标提高筛选吞吐;TradeTrap 直接破坏新闻、记忆和仓位视图;DeepFund 用模型知识截止时间之后的实时数据降低预训练污染。
共同边界:六篇工作分别覆盖语义、稳定性、攻击面或实时性,没有一篇同时覆盖时点一致数据、成本、容量、部分成交、故障恢复和前瞻存活率。廉价筛选与完整回测应是分层关系,不能互相替代。
相关工作:DeepFund-arXiv25、Market-Bench-arXiv25、TradeTrap-arXiv25、BacktestBench-KDD26、AlphaForgeBench-KDD26、AlphaEval-KDD26
研究过程评测与验证器边界
共同目标:判断智能体是在稳定推进研究,还是依靠重复尝试、评估器捷径或表面正确获得高分。
演化与分歧:MLAgentBench、MLE-Bench、PaperBench 和 RE-Bench 从不同角度固定任务与结果;InnovatorBench 和 Beyond Final Scores 开始测异步资源、最佳状态保护和反馈控制;DDR-Bench 与 ResearchClawBench 减少显式问题或隐藏参考论文;GEPA 证明文字反馈比标量奖励携带更多诊断信息;AVO、FlashInfer-Bench 与 SOL-ExecBench 展示强执行验证器在计算内核上的上限和被投机风险。
共同边界:越开放的研究越难建立完整真值,越容易自动评分的任务越接近封闭工程优化。金融收益没有编译器或硬件上界那样稳定的正确性裁判,因此这些评测方法只能迁移过程控制,不能直接迁移成功标准。
相关工作:MLAgentBench-ICML24、MLE-Bench-ICLR25、PaperBench-ICML25、RE-Bench-ICML25、InnovatorBench-ICLR26、Li-LongHorizonResearchEvaluation-arXiv26、DDR-Bench-ICML26、ResearchClawBench-arXiv26、GEPA-ICLR26、AVO-arXiv26、FlashInfer-Bench-MLSys26、SOL-ExecBench-arXiv26
证据生命周期
共同目标:让每条论断知道自己依赖哪些数据、代码和执行结果,并在上游变化后能够失效、重建或撤销。
演化与分歧:EviGraph 用类型化依赖边和检查器重建错误链;OmniScientist 用执行账本和代码门禁拒绝没有来源或不显著的分析;Cordis 从程序语义出发,把副作用逆操作与依赖重连分开建模。前两者面向研究论断,后者面向动态组件生命周期。
共同边界:来源一致不等于统计正确,逆操作存在也不等于外部副作用可以撤销。三篇工作都没有在量化场景中同时注入未来信息、错误复权、重复订单、进程崩溃和验证器升级。
相关工作:EviGraph-arXiv26、OmniScientist-arXiv26、Cordis-TechReport26
面向智能体的运行时
共同目标:让智能体可以用较少上下文可靠地操作代码、工具和长时程序,并让系统能够调度、缓存或恢复这些操作。
演化与分歧:OpenHands 与 OpenHands SDK 强调通用事件流和组合接口;PithTrain 追求紧凑、显式、以 Python 为主的代码表面;SkVM 把技能编译到特定模型、执行框架和环境;Agentix 与 Murakkab 暴露程序进度和工作流画像;AgenticCache 用缓存计划作为快路径并异步纠错。
共同边界:这些系统优化的是可操作性、吞吐、延迟或任务成功率,不理解金融数据版本、组合账本、订单副作用和发布权限。若不增加领域契约,它们只会更高效地执行可能错误的研究流程。
相关工作:OpenHands-ICLR25、OpenHands-SDK-MLSys26、PithTrain-arXiv26、SkVM-SOSP26、Agentix-NSDI26、Murakkab-OSDI26、AgenticCache-MLSys26
跨工作共同缺陷
| 共同缺陷 | 覆盖范围 | 为什么是系统性问题 | 已有缓解与剩余缺口 |
|---|---|---|---|
| 搜索反馈与最终证明没有隔离 | 自动研究闭环 6/6;还影响 GEPA 和 AlphaEval | 验证器被查询得越多,偶然噪声和代理指标越容易成为持久研究经验 | AgonAlpha 引入外部平台,AQuA 外部线索使用封闭沙箱;仍缺查询预算、二级封存集和预注册前瞻评价 |
| 可重放或可追踪不等于结论正确 | 七个代表系统 7/7:AgonAlpha、AlphaForgeBench、BacktestBench、PaperBench、EviGraph、OmniScientist、Market-Bench | 错误数据快照、未来信息、错误统计和不现实成本也能稳定重放并拥有完整来源 | 独立复跑、执行账本和参考实现能缩小错误面;仍缺金融性质测试与外部有效性关口 |
| 量化论文停在历史或短期评价 | Finance 核心论文 13/13 | 没有工作同时覆盖封存样本外、模拟交易、实盘监控、人工批准和策略退役,研究收益无法直接映射为可投资结果 | DeepFund 提供短期实时路径,QuantConnect 展示产品流水线;两者都没有形成公开、受控、长期的端到端证据 |
| 多角色收益与预算变量混杂 | 七个代表多智能体或工作流系统 7/7:AI Scientist v2、R&D-Agent(Q)、DeepFund、BacktestBench、AutoScientists、AgonAlpha、Murakkab | 角色数、模型调用、并行度、实验次数和墙钟时间往往一起变化,无法判断收益来自独立信息、权限分离还是更多预算 | AutoScientists 匹配实验预算,AgonAlpha 设置独立审查;仍缺同时固定词元、实验、时间和工具调用的析因实验 |
| 状态机制缺少故障与版本压力测试 | 证据生命周期和运行时两条路线 10/10 | 正常路径上的日志、缓存和依赖图不能证明崩溃、乱序结果、重复回调或验证器升级后状态仍有效 | EviGraph 规定回滚,Cordis 规定逆操作,OpenHands SDK 规定重放;尚无量化故障矩阵验证恰好执行一次和跨版本恢复 |
这里的计数按“该缺陷适用的工作集合”给出,而不是用全部 40 篇作无意义分母。needs-review/full-text 页面只扩大覆盖范围;每项模式均有 complete/full-text 工作独立支持。
关键争议
1. 生成研究产物,还是直接生成交易动作?
AlphaForgeBench-KDD26 显示,一次性生成代码再确定性执行,比逐时输出动作更容易重放;TradeTrap-arXiv25 又表明直接动作会把错误状态迅速放大为集中度和回撤。反面是:只生成因子或代码会把风险推迟到组合、成交和发布阶段,而不是消除风险。更合理的条件化结论是,开放研究阶段优先生成可审计产物,真实交易阶段必须由受限执行器和独立风险关口接管。
2. 外部闭源验证器,还是公开可复现协议?
AgonAlpha-arXiv26 使用 WorldQuant BRAIN,减少作者修改数据和评分器的空间;Market-Bench-arXiv25 与 BacktestBench-KDD26 则依赖公开参考实现和确定性答案。闭源平台更接近真实治理,却难以独立审计;公开协议可复现,却可能过度简化成交和数据。外部治理、公开重算和前瞻评价解决的是不同问题,不应互相替代。
3. 更多角色,还是更强的权限边界?
AutoScientists-arXiv26 倾向动态团队,DeepFund-arXiv25 与 BacktestBench-KDD26 按职责拆分角色,AgonAlpha-arXiv26 只保留提议者和审查者;DDR-Bench-ICML26 发现通用多智能体组件不能稳定提高准确率。现有证据更支持比较独立上下文、专用工具、否决权和交接损失,而不是比较角色数量本身。
4. 紧凑显式框架,还是完整生产抽象?
PithTrain-arXiv26 说明扁平、局部和单语言实现能降低智能体探索成本;OpenHands-SDK-MLSys26、Murakkab-OSDI26 与 Cordis-TechReport26 为组合、远程执行、调度和生命周期增加更多控制面。量化系统还必须处理历史时点、公司行动、借券、成本和权限。真正需要删除的是偶然复杂度,不是业务语义。
5. 保护当前最佳方案,还是允许跨越暂时退化?
AVO-arXiv26 的单调谱系防止七天优化丢失最佳状态,AutoScientists-arXiv26 也用噪声门槛保护当前最佳方案;但跨结构重构可能必须先变差。金融目标又比内核运行时间更嘈杂。系统需要区分“生产最佳方案”和“探索分支”,而不是让单一晋级规则同时承担安全与探索。
产业实践与学术缺口
Microsoft RD-Agent 与 Qlib
RD-Agent 官方仓库提供 fin_quant、fin_factor 和 fin_model,并由开源量化研究平台 Qlib 承担数据、实现与回测。官方配置文档允许设置因子和模型的训练、验证与测试时间段,但 QLIB_QUANT_* 当前只影响前端显示、不改变实际执行,说明“配置可见”与“协议真正生效”之间仍需审计。公开证据仍集中在历史回测,仓库也明确不替代金融专业人员审批。
QuantConnect 智能体流水线
QuantConnect Assistants 已公开研究、统计验证、回测、模拟交易和实盘监控的角色链。Research Validation Assistant执行残差平稳性、自相关、异方差和分布稳定性检查;Paper Testing Assistant比较模拟交易行为与同期回测,最多诊断三轮后停止或升级;Live Monitoring Assistant只监控和通知,不建议交易。它是公开资料中最完整的功能链,但官方文档没有给出封存评价、选择偏差记账、故障注入或受控效果实验。
WorldQuant BRAIN 与 Numerai Signals
WorldQuant BRAIN提供数据、操作符、模拟器和性能面板,AgonAlpha-arXiv26 已将其用作外部验证器。优势是系统作者不能直接修改平台;局限是数据、成本与评分规则不能由外部研究者完整重算。
Numerai Signals要求研究者提交自己的股票信号,以平台目标和相对已有信号的独特贡献评分,并通过实时轮次形成前瞻反馈。它比静态历史回测更独立,但不管理假设、代码、实验和论断的内部证据链,也不能证明提交信号在研究者自己的约束下可投资。
最新外部研究信号
XALPHA把报告知识、历史生成反馈和研究周期总结放入多源记忆;AQuA分别建立公式因子与可训练模型闭环,并用封闭沙箱固定数据切分、特征、标签和评价器;自主公式化阿尔法发现综述则把噪声适应度、市场非平稳、昂贵回测、语义冗余和多目标冲突视为统一问题。三者共同说明领域正在从“用 LLM 生成因子”转向“治理持续研究循环”;前两篇仍是外部线索,综述已完成全文审计。
候选空白
1. 搜索器与最终评价之间的自适应隔离层
这一空白直接来自“搜索反馈与最终证明没有隔离”。现有闭环会记录更多经验,却没有一种协议随查询次数提高证据门槛。缺的是统一记账:搜索可见验证集、候选总数、查询预算、二级封存集、前瞻窗口和晋级判据必须共同存在。
2. 带类型且可失效的量化研究产物
EviGraph 能传播上游变化,OmniScientist 能绑定执行来源,AgonAlpha 能冻结报告;没有工作统一表达历史时点数据、股票范围、代码环境、成本模型、组合约束、回测、论断和晋级决定,并在任一上游版本变化后确定性标记下游失效。
3. 崩溃一致且恰好执行一次的量化研究运行时
Cordis、OpenHands SDK 与 Agentix 分别处理撤销、事件重放和程序调度,但没有工作覆盖异步回测返回、重复平台提交、模拟订单重试、部分成交和进程重启之间的一致性。当前研究把这些失败当作轨迹问题,而不是事务语义问题。
4. 从回测到模拟交易再到实盘的机器可判晋级契约
QuantConnect 已展示功能链,DeepFund 提供短期实时评价,AlphaForgeBench 强调确定性执行;仍没有公开学术系统定义每一级所需的研究产物、最短观察期、容差、停止条件、回滚和人工批准,并在同一实验中验证这些关口。
5. 策略退役与证据衰减
151 Strategies 明确指出市场结构变化会让策略死亡,AgenticCache 又说明旧计划会因环境变化失效;现有系统几乎都优化候选生成和晋级,没有根据收益衰减、相关性上升、容量下降、数据源变化或模型升级自动使旧证据失效并安全退役策略。
6. 角色组织结构的同预算因果实验
动态团队、固定流水线、提议者—审查者双角色和单智能体加技能都有正面结果,却没有量化工作负载同时固定模型、词元、回测次数、墙钟时间和工具调用,只改变独立信息、权限或并行度。角色设计目前仍更接近界面选择而非系统规律。
7. 面向量化框架的智能体任务效率与长期复杂度
PithTrain 固定智能体和任务、比较框架可操作性;量化基准通常固定框架、比较模型。尚无工作在相同数据快照和验证器下,对 Qlib、QuantConnect 的开源交易引擎 LEAN 与紧凑参考框架比较交互轮数、上下文、无声数值错误、跨策略修改和版本增长后的回归缺陷。
关键未知与测量
1. 查询多少次之后,验证集不再是真正的样本外?
最小测量:固定因子语法与搜索器,分别允许 10、50、200 和 1000 次查询;以信息系数、AlphaEval 和完整回测作为三种反馈,保留从不反馈的二级时间留出集。报告验证—封存差距、候选总数、净夏普比率、回测过拟合概率和有效发现率。
2. 哪些金融错误能由确定性验证器发现?
最小测量:构造错误变异集,分别注入未来信息、幸存者偏差、错误复权、延迟错位、遗漏成本、持仓记账错误和论断扩大。比较规则检查、独立重跑、独立上下文 LLM 与领域专家的检出率、误报率和成本。
3. 正确恢复研究所需的最小状态是什么?
最小测量:从假设、数据哈希与时点、代码提交、环境、任务编号、研究产物、验证器版本、当前最佳方案和失败方向开始做删项实验;注入崩溃、乱序结果、重复回调和验证器升级,测恢复率、重复副作用率与无声污染率。
4. 外部平台得分有多少能转化为可投资结果?
最小测量:冻结通过 BRAIN、Numerai 或学术门槛的候选,禁止继续调参,再进入预注册前瞻窗口、成本感知组合和模拟交易。逐级报告存活率、净风险调整收益、容量、换手率、回撤和人工否决原因。
5. 多智能体收益来自并行、独立信息还是权限分离?
最小测量:在总预算相同下,分别只增加工作者数量、只隔离上下文、只赋予审查者否决权、只提供角色专用工具。比较候选多样性、错误相关性、封存集有效发现率、交接损失和总成本。
6. 紧凑框架优势能否随生产覆盖增长而保持?
最小测量:在 Qlib、LEAN 和紧凑参考框架上固定 20–30 个因子、回测、组合与故障恢复任务,持续记录 6–12 个月的代码规模、间接调用层次、技能时效、交互轮数、无声错误率和跨策略修改缺陷。
7. 策略证据应在何时衰减或失效?
最小测量:对固定策略注入数据供应商修订、成本模型变化、相关结构突变、容量下降和模型升级;比较固定阈值、统计变化检测和依赖图失效三种策略,报告误退役、漏退役、恢复时间和风险暴露。
8. 哪些发布关口必须由人类把守?
最小测量:记录人工介入日志,区分资产范围、数据许可、统计设计、封存集解封、模拟与实盘晋级和异常处置;比较无人把关、固定把关和风险触发把关的错误阻断率、漏放率、研究速度与操作负担。
覆盖缺口
- XALPHA 与 AQuA 高度相关但尚未进入原始论文层与 wiki 层;本次只保留外部证据卡。
- Chain-of-Alpha 已撤稿且当前不提供 PDF,只能说明双链回测反馈曾被提出,不能支撑任何强结论。
- RD-Agent-Quant-arXiv25 已正式发表于 NeurIPS 2025,但 wiki 文件名与 frontmatter 仍使用 arXiv 标识;本文不修改论文层。
- 40 篇内部证据中有 11 篇为
needs-review/full-text,主要集中在早期量化基础、AI Scientist 系列和部分通用运行时。 - 研究产物、封存留出集、历史时点数据谱系和策略退役尚未形成独立概念页(concept page);本调研只把它们记录为候选,不自动建页。
附录:逐篇证据卡
路线一:量化研究对象与目标
101-Alphas-arXiv15
- 路线与角色:量化研究对象;公式因子语料的奠基工作。
- 证据等级:
needs-review/full-text。 - 做了什么:公开 101 条生产因子公式及相关性、换手率等统计。
- 没做什么:不提供公开数据复现、现代样本外协议、交易成本或策略退役机制。
- 关键观察:披露因子的平均相关性较低,组合多个弱信号可能比依赖单一因子更合理。
- 隐含假设:公开价量数据和正确算子足以近似恢复信号结构。
- 可攻击点 / 脆弱点:专有样本、2010–2013 年市场状态和无成本评价使绝对收益不可外推。
151-Trading-Strategies-SSRN18
- 路线与角色:量化研究对象;策略空间与生命周期的奠基分类。
- 证据等级:
complete/full-text,无统一实证。 - 做了什么:整理 150 多类策略、550 多个公式和约 2000 条参考文献。
- 没做什么:不统一回测,也不证明所列策略在当前市场仍然有效。
- 关键观察:交易所结构和参与者行为变化会让策略突然失效,现代单个信号往往很弱。
- 隐含假设:公式和文献指针足以界定有价值的研究先验。
- 可攻击点 / 脆弱点:大量实现自由度允许研究者通过期限、股票范围和成本假设重新制造过拟合结果。
Yu-FormulaicAlphaDiscovery-arXiv26
- 路线与角色:量化研究对象与闭环;统一自动公式发现路线的最新综述。
- 证据等级:
complete/full-text,无作者自有数值实验。 - 做了什么:用表示、变异、适应度评价、选择、记忆和适应六组件比较八类方法,并提出覆盖发现过程与因子质量的八维评价矩阵。
- 没做什么:不提供端到端系统、前瞻收益、运行时恢复或生产晋级实证,也没有公开文献编码的一致性统计。
- 关键观察:金融评价是噪声观测;表示与候选生成的进步快于可靠适应度、经验证的记忆和市场适应。
- 隐含假设:进化计算分类能覆盖主要自动公式发现方法,定性组件标签足以暴露跨路线的结构性失衡。
- 可攻击点 / 脆弱点:统一抽象可能掩盖数据治理、成交语义与故障恢复差异,八维矩阵也没有经过同预算系统对照校准。
TimesFM-Fin-arXiv24
- 路线与角色:量化研究对象;从公式扩展到时间序列基础模型。
- 证据等级:
needs-review/full-text。 - 做了什么:通过金融数据继续训练、对数损失和动态遮罩改造 TimesFM 价格预测。
- 没做什么:不形成研究闭环,也不处理成本感知组合、模型失效和实盘治理。
- 关键观察:价格尺度差异和崩盘会使普通均方误差训练不稳定,简单基线在部分市场仍更强。
- 隐含假设:预测准确率能转化为可交易信息,完整参数调整值得其成本。
- 可攻击点 / 脆弱点:一次时间留出、零成本和市场选择可能夸大经济价值。
NewsShock-NBER26
- 路线与角色:量化研究对象;把新闻表示变成资产定价信号的扩展工作。
- 证据等级:
needs-review/full-text。 - 做了什么:剔除传统特征可预测的新闻表示成分,以残差构造新闻冲击和多空组合。
- 没做什么:不自动生成假设,也不覆盖实时新闻延迟、容量和模型版本漂移。
- 关键观察:传统特征无法解释的新闻部分在较长窗口仍包含预测信息。
- 隐含假设:线性正交化能分离新信息,递归估计近似满足时点一致。
- 可攻击点 / 脆弱点:专有新闻、模型版本和全样本变量选择会影响复现与实盘结果。
UPSA-NBER23
- 路线与角色:量化研究对象;从信号发现转向高维组合的扩展工作。
- 证据等级:
complete/full-text。 - 做了什么:以非负方式混合多种岭回归收缩强度,面向投资组合效用学习权重。
- 没做什么:不生成因子,也不把成本、冲击、借券和生产约束纳入主目标。
- 关键观察:不同收缩强度产生互补收益流,有限样本估计误差会改变组合结果。
- 隐含假设:留一法效用在时间依赖收益上仍能代表样本外效用。
- 可攻击点 / 脆弱点:自动生成大量因子会提高候选数与样本数之比,放大均值和协方差噪声。
路线二:自动研究闭环
AI-Scientist-arXiv24
- 路线与角色:自动研究闭环;端到端流水线的奠基工作。
- 证据等级:
needs-review/full-text。 - 做了什么:串联想法生成、代码修改、实验、写作和自动评审。
- 没做什么:不提供独立科学验证、可靠恢复或量化专用数据防线。
- 关键观察:完整流水线能高吞吐地产生实验和文稿,但许多候选会在执行或评审阶段失败。
- 隐含假设:LLM 评审和固定实验环境足以过滤主要错误。
- 可攻击点 / 脆弱点:生成者与评审者共享模型偏好,论文数量不能代表科学发现率。
AI-Scientist-v2-arXiv25
- 路线与角色:自动研究闭环;以树搜索扩大候选的扩展工作。
- 证据等级:
needs-review/full-text。 - 做了什么:用智能体树搜索探索实验分支,并将部分结果提交人类评审。
- 没做什么:不证明树搜索在同预算下优于简单多次采样,也不处理生产生命周期。
- 关键观察:约 40 个想法经人工跨运行筛选后只形成少量投稿,最终过线更少。
- 隐含假设:树结构能把验证反馈转化为更有效的探索。
- 可攻击点 / 脆弱点:人工选择、运行数和分支预算混杂,最佳案例容易掩盖整轮低产出率。
RD-Agent-Quant-arXiv25
- 路线与角色:自动研究闭环;首个核心量化落地和路线转折。
- 证据等级:
needs-review/full-text,由正式论文与官方实现交叉印证。 - 做了什么:用规格、方案、代码、验证和分析单元闭合因子与模型联合优化。
- 没做什么:没有封存终局集、前瞻交易、崩溃恢复或策略退役。
- 关键观察:只向 LLM 暴露数据结构、由 Qlib 执行实验,可以形成持续反馈循环。
- 隐含假设:数据隔离足以防泄漏,反复读取同一验证反馈不会严重污染结论。
- 可攻击点 / 脆弱点:短样本外窗口、单条最佳路径和未统一预算削弱结果外推性。
Kosmos-AI-Scientist-arXiv25
- 路线与角色:自动研究闭环;结构化研究记忆的转折工作。
- 证据等级:
needs-review/full-text。 - 做了什么:用结构化世界模型汇总并行文献与数据分析轨迹,支撑多轮研究。
- 没做什么:不支持原始大规模数据、运行中干预,也没有量化记忆压缩造成的发现遗漏。
- 关键观察:跨轨迹缺少可查询共享记忆会破坏长程一致性;解释与综合论断比数据论断更不可靠。
- 隐含假设:轨迹摘要能保留决定性证据,并足以指导后续任务分解。
- 可攻击点 / 脆弱点:提示词敏感、随机运行不收敛和专家筛选成本限制“持续发现”的外推。
AutoScientists-arXiv26
- 路线与角色:自动研究闭环;共享状态和动态团队的扩展工作。
- 证据等级:
complete/full-text。 - 做了什么:维护当前最佳方案、失败方向、共享讨论和动态团队,并以噪声门槛晋级。
- 没做什么:不提供强事务运行时,也没有同时匹配模型调用与实验资源预算。
- 关键观察:长时搜索的方向会随结果变化,实验算力比模型调用更稀缺,噪声会污染最佳状态。
- 隐含假设:研究方向可并行,同伴批评能过滤弱方案,智能体会遵守共享协议。
- 可攻击点 / 脆弱点:单图形处理器或强耦合任务会消除并行收益,文本协议可能发生竞态。
AgonAlpha-arXiv26
- 路线与角色:自动研究闭环;可审计量化产物和独立审查的转折工作。
- 证据等级:
complete/full-text。 - 做了什么:冻结假设、公式、平台证据和解释,由独立审查者复跑并可归零。
- 没做什么:不联合组合与实盘,也没有二级封存集和崩溃恢复。
- 关键观察:24 个冻结报告中有 2 个因证据错配被归零,说明公式本身不足以承载审计。
- 隐含假设:外部平台和两个隔离角色足以形成可信治理。
- 可攻击点 / 脆弱点:所有候选反复使用同一历史窗口,树调度和角色结构缺少同预算消融。
路线三:金融语义验证
DeepFund-arXiv25
- 路线与角色:金融语义验证;实时前瞻评价的扩展工作。
- 证据等级:
complete/full-text。 - 做了什么:使用模型知识截止时间之后的实时数据评价多角色基金投资智能体。
- 没做什么:不生成可复现因子代码,也不处理长期退役、恢复和独立重复。
- 关键观察:最初 24 个交易日只有一个模型盈利,延长到季度后部分排序又发生变化。
- 隐含假设:截止时间后的短期实时路径足以降低污染并比较模型。
- 可攻击点 / 脆弱点:单次市场路径、接口版本和短窗口无法估计长期超额收益。
Market-Bench-arXiv25
- 路线与角色:金融语义验证;持仓路径参考实现的奠基基准。
- 证据等级:
complete/full-text。 - 做了什么:用三类可执行回测器对齐盈亏、回撤和持仓路径。
- 没做什么:不评价开放因子发现、数据治理、成本和长期研究。
- 关键观察:模型可以每次生成可执行代码,最终金融数值仍可能出现巨大误差。
- 隐含假设:作者参考实现能充当可信金融语义标准。
- 可攻击点 / 脆弱点:策略种类少、误差受量纲影响,参考语义仍由作者决定。
TradeTrap-arXiv25
- 路线与角色:金融语义验证;状态完整性与攻击传播的反例工作。
- 证据等级:
complete/full-text。 - 做了什么:对市场信息、提示、记忆和仓位状态注入扰动并观察损失传播。
- 没做什么:不构造研究产物,也不覆盖重复订单、部分成交和崩溃恢复。
- 关键观察:仅篡改智能体看到的仓位,就能让真实账本产生重复交易和巨大回撤。
- 隐含假设:两类实现能代表开放工具调用与固定流程架构。
- 可攻击点 / 脆弱点:一个月、有限实现和预设攻击不能代表生产尾部,券商限额可能阻断部分路径。
BacktestBench-KDD26
- 路线与角色:金融语义验证;大规模可执行回测基准。
- 证据等级:
complete/full-text。 - 做了什么:用 18,246 个任务拆分指标映射、数据查询、代码生成与回测。
- 没做什么:不覆盖开放发现、非零成本、持续状态和选择偏差。
- 关键观察:代码执行正确率可接近 100%,指标计算准确率却可能接近零。
- 隐含假设:固定指标词典和确定性答案覆盖回测的主要金融语义。
- 可攻击点 / 脆弱点:代码到文本清除了真实需求歧义,固定日频协议远离生产成交。
AlphaForgeBench-KDD26
- 路线与角色:金融语义验证;确定性策略代码执行基准。
- 证据等级:
complete/full-text。 - 做了什么:让模型生成因子和单资产策略代码,再由统一引擎执行与重复评价。
- 没做什么:不覆盖持续搜索、多资产组合、模拟交易和策略退役。
- 关键观察:代码生成把随机性限制在一次生成,直接动作智能体即使确定性解码仍可能分歧。
- 隐含假设:生成代码比逐时动作更接近真实量化研究能力。
- 可攻击点 / 脆弱点:固定回测器、规则语言和公开策略可能被适应;稳定执行不等于样本外有效。
AlphaEval-KDD26
- 路线与角色:金融语义验证;高吞吐多维因子筛选的扩展工作。
- 证据等级:
complete/full-text。 - 做了什么:用预测力、时间稳定性、扰动鲁棒性、金融逻辑和多样性评价因子。
- 没做什么:不评价仓位、成本、执行、路径记账、模拟交易或查询预算。
- 关键观察:排序稳定性与换手率、扰动保真与回撤存在强历史关联,筛选可高度并行。
- 隐含假设:合成扰动、轮内标准化和 LLM 逻辑评分能代表未来可交易质量。
- 可攻击点 / 脆弱点:候选池会改变分数,搜索器可能学习代理指标,独立噪声不代表制度切换。
路线四:研究过程评测与验证器边界
MLAgentBench-ICML24
- 路线与角色:研究过程评测;机器学习实验循环的奠基基准。
- 证据等级:
needs-review/full-text。 - 做了什么:用文件、Python 执行和固定验证器评价短程机器学习实验。
- 没做什么:不评价新颖性、过程诚信、多机任务或故障恢复。
- 关键观察:失败常来自坏规划、未执行便宣称改进和早期错误后无法恢复。
- 隐含假设:较短历史和模型事实核查足以维持约 50 步任务。
- 可攻击点 / 脆弱点:旧任务可能受预训练污染,步数增加常伴随性能退化。
MLE-Bench-ICLR25
- 路线与角色:研究过程评测;隐藏排行榜与重复尝试基准。
- 证据等级:
complete/full-text。 - 做了什么:用 Kaggle 私有排行榜和多次运行成功率评价机器学习工程闭环。
- 没做什么:不评价自主选题、生产部署或持续共享状态。
- 关键观察:脚手架和重复尝试显著改变成功率,额外硬件未必被有效利用。
- 隐含假设:私有排行榜可作为可靠隐藏目标。
- 可攻击点 / 脆弱点:多次尝试的最好结果掩盖单轨失败,竞赛资料仍可能造成污染优势。
PaperBench-ICML25
- 路线与角色:研究过程评测;独立重执行与结果匹配的转折基准。
- 证据等级:
complete/full-text。 - 做了什么:把论文复现拆为代码开发、真实执行和结果匹配,并重执行提交。
- 没做什么:不评价选题、多节点生产研究或研究状态恢复。
- 关键观察:代码表面正确远强于真正执行和复现结果,智能体约一小时后趋于停滞。
- 隐含假设:作者认可的评分准则和封闭环境能代表复现质量。
- 可攻击点 / 脆弱点:自动评审器有限,软件生态漂移会改变分数,任务依赖未显式建模。
RE-Bench-ICML25
- 路线与角色:研究过程评测;人与智能体时间尺度比较的转折工作。
- 证据等级:
complete/full-text。 - 做了什么:在 2–32 小时预算下比较智能体与人类专家完成研发任务。
- 没做什么:不评价月级项目、共享维护或真实金融结果。
- 关键观察:智能体的短预算优势来自高频反馈和多次重启,单轨延长的边际收益迅速下降。
- 隐含假设:多个独立尝试中的最好结果足以代表研发价值。
- 可攻击点 / 脆弱点:量化场景中的快反馈可能转化为对同一回测窗口的自适应过拟合。
InnovatorBench-ICLR26
- 路线与角色:研究过程评测;异步资源治理的扩展基准。
- 证据等级:
complete/full-text。 - 做了什么:用 2–36 小时、多图形处理器和异步任务暴露研究执行问题。
- 没做什么:不评价开放选题、生产安全或崩溃后一致快照。
- 关键观察:智能体会误杀有价值作业、忘记已运行任务并制造资源冲突。
- 隐含假设:把资源控制暴露给 LLM 能测量真实科研能力。
- 可攻击点 / 脆弱点:确定性资源账本可能消除大量失分,基准混合了模型与运行时缺陷。
Li-LongHorizonResearchEvaluation-arXiv26
- 路线与角色:研究过程评测;问题构建、执行与反馈控制的转折工作。
- 证据等级:
complete/full-text。 - 做了什么:比较多次运行平均与最好结果,并分解方案定向、执行和反馈控制。
- 没做什么:不评价真正开放科学、数天恢复或同预算人类基线。
- 关键观察:经验既会正向迁移也会固化局部最优;高分候选中存在验证器捷径。
- 隐含假设:验证器分数推进能代表真实研究进展。
- 可攻击点 / 脆弱点:无故障时的反馈指标不能证明恢复能力,捷径还可能跨任务传播。
DDR-Bench-ICML26
- 路线与角色:研究过程评测;开放问题形成的扩展基准。
- 证据等级:
complete/full-text。 - 做了什么:只提供数据库和元数据,让智能体自行决定查什么、何时停止。
- 没做什么:不运行完整量化研究,也没有统一成本的人类上限。
- 关键观察:主动决定目标比执行给定问题更难,通用记忆和多智能体组件不能稳定提分。
- 隐含假设:隐藏核对清单能代表应发现事实。
- 可攻击点 / 脆弱点:清单无法穷举真正洞见,模型自选轮数把能力与预算混在一起。
ResearchClawBench-arXiv26
- 路线与角色:研究过程评测;隐藏论文与证据匹配基准。
- 证据等级:
complete/full-text。 - 做了什么:用隐藏目标论文和专家评分规则评价实验协议、证据与报告链。
- 没做什么:不统一重执行,也不评价真正未知发现或长时恢复。
- 关键观察:报告可以很专业,主要失败仍是协议、证据和结论不匹配,而非工具执行失败。
- 隐含假设:目标论文能作为可审计的人类参考路径。
- 可攻击点 / 脆弱点:参考答案可能惩罚不同但正确的方法,LLM 评审与网络污染削弱结论。
GEPA-ICLR26
- 路线与角色:验证器边界;文字反馈驱动搜索的机制工作。
- 证据等级:
complete/full-text。 - 做了什么:从执行反馈反思并改写提示词,以局部帕累托选择保留互补策略。
- 没做什么:不覆盖金融非平稳、长期治理或安全审计。
- 关键观察:标量奖励丢失诊断信息,局部优胜策略可能包含全局最优者没有的能力。
- 隐含假设:文字反馈可靠且能跨样例泛化。
- 可攻击点 / 脆弱点:反复使用验证集会过拟合,金融噪声可能让帕累托前沿保存偶然结果。
AVO-arXiv26
- 路线与角色:验证器边界;长时单调谱系的强验证案例。
- 证据等级:
complete/full-text。 - 做了什么:用 Git 状态、正确性检查和性能验证器进行七天内核优化。
- 没做什么:不比较种群搜索,也不覆盖有噪声多目标与金融非平稳。
- 关键观察:专家级改进来自少数结构性跳跃,最佳状态保护对长时搜索重要。
- 隐含假设:验证器可信,拒绝任何退步有利于最终搜索。
- 可攻击点 / 脆弱点:单调门槛会拒绝必须暂时变差的重构,金融目标也缺少同等硬真值。
FlashInfer-Bench-MLSys26
- 路线与角色:验证器边界;真实部署工作负载与正确性沙箱案例。
- 证据等级:
complete/full-text。 - 做了什么:用任务、真实负载、候选实现和评价结果契约连接内核生成与部署。
- 没做什么:不覆盖金融语义、多图形处理器通信和长期回滚。
- 关键观察:可部署任务必须同时拥有真实轨迹和精确参考实现,孤立小题不足。
- 隐含假设:正确性沙箱能隔离生成器与部署系统。
- 可攻击点 / 脆弱点:版本、恶意产物和隐藏负载代表性仍需治理。
SOL-ExecBench-arXiv26
- 路线与角色:验证器边界;硬件上界与防投机评测案例。
- 证据等级:
complete/full-text。 - 做了什么:以硬件速度上界、输出检查和防投机沙箱评价 235 个内核问题。
- 没做什么:不覆盖开放研究或统计噪声目标。
- 关键观察:14.5% 的提交会攻击基准,相对弱基线的加速不等于接近真实上界。
- 隐含假设:硬件速度上界准确并可跨问题归一化。
- 可攻击点 / 脆弱点:金融收益没有物理上界,只要验证器有漏洞,智能体就可能系统性利用。
路线五:证据生命周期
EviGraph-arXiv26
- 路线与角色:证据生命周期;类型化依赖、失效和回滚的转折工作。
- 证据等级:
complete/full-text。 - 做了什么:把问题、假设、实验、发现和论断建成可检查、可失效、可回滚的证据图。
- 没做什么:不检查未来信息、错误统计和金融外部有效性,也缺少等预算消融。
- 关键观察:上游语义错误会沿阶段传播,执行产物能约束数字和论断来源。
- 隐含假设:固定图模式覆盖主要依赖,LLM 检查器能找到根因。
- 可攻击点 / 脆弱点:图可内部一致但科学错误;回滚、损坏检查点和并发版本冲突缺少故障注入。
OmniScientist-arXiv26
- 路线与角色:证据生命周期;执行账本和代码门禁的扩展工作。
- 证据等级:
complete/full-text。 - 做了什么:让多模态原始证据贯穿选题、实验和写作,以执行账本与门禁约束数字。
- 没做什么:不证明科学新颖性,也没有独立领域团队复现和系统故障恢复。
- 关键观察:多数失败来自选择不显著分析,而非凭空生成数字;证据接口会改变研究问题。
- 隐含假设:代码门禁覆盖最重要错误,多模态感知发现的结构是真实信号。
- 可攻击点 / 脆弱点:来源追踪不能发现混杂和因果越界,多重候选选择仍可能被包装为主线。
Cordis-TechReport26
- 路线与角色:证据生命周期;可撤销副作用和依赖重连的运行时奠基工作。
- 证据等级:
complete/full-text,形式与采用证据强,受控实证缺失。 - 做了什么:让原子操作返回逆操作,并以依赖状态机支持组件卸载和重连。
- 没做什么:不验证逆操作正确性,也不处理不可逆外部输出和持久进程恢复。
- 关键观察:撤销“做过什么”和重连“依赖什么”是两个不同问题。
- 隐含假设:重要共享状态都经过统一上下文,跨组件效应足够独立。
- 可攻击点 / 脆弱点:订单、消息和数据库写入常越过系统边界;进程崩溃后逆操作日志未必存在。
路线六:面向智能体的运行时
OpenHands-ICLR25
- 路线与角色:智能体运行时;通用代码动作平台的奠基工作。
- 证据等级:
needs-review/full-text。 - 做了什么:用代码动作接口、事件流和容器统一工具、工作目录、用户与评测。
- 没做什么:不提供量化语义、长程恢复或生产安全攻防证据。
- 关键观察:命令行、Python 和浏览器覆盖广泛数字任务,事件流能解耦智能体与运行时。
- 隐含假设:文件、代码和执行循环足以表达研究任务。
- 可攻击点 / 脆弱点:长文件、外部权限、容器边界和不可逆工具副作用会成为量化部署瓶颈。
OpenHands-SDK-MLSys26
- 路线与角色:智能体运行时;事件溯源与可组合 SDK 的扩展工作。
- 证据等级:
needs-review/full-text。 - 做了什么:用不可变组件、单一会话状态和只追加事件日志重构平台。
- 没做什么:不证明跨版本重放、本地与远程等价或多租户服务目标。
- 关键观察:隐藏配置覆盖会破坏重放,显式事件有利于恢复和集成。
- 隐含假设:事件日志完整记录决定状态的全部输入,本地优先适合多数开发场景。
- 可攻击点 / 脆弱点:模型、密钥、策略和工具版本中途改变会让相同事件产生不同结果。
PithTrain-arXiv26
- 路线与角色:智能体运行时;框架可操作性与紧凑设计的反例工作。
- 证据等级:
complete/full-text。 - 做了什么:以紧凑、Python 为主、调用关系显式的训练框架和任务技能降低智能体成本。
- 没做什么:不让智能体参与数值训练,也不评价长期维护、跨模型修改和恢复。
- 关键观察:注册表、原生扩展和隐式调用会增加探索、上下文与重复运行。
- 隐含假设:当前智能体更适合局部、显式、单语言代码,较窄范围能代表目标任务。
- 可攻击点 / 脆弱点:框架与基准由同一团队设计,生产覆盖增长后紧凑性可能转成复制负担。
SkVM-SOSP26
- 路线与角色:智能体运行时;技能编译与版本化的转折工作。
- 证据等级:
complete/full-text。 - 做了什么:把技能视为程序,按模型、执行框架和环境做预先编译、即时编译、绑定和回滚。
- 没做什么:不理解金融语义,也不评价跨天恢复、失效数据和供应链安全。
- 关键观察:原始技能会让 15% 的任务退化,技能与目标能力不匹配是一等问题。
- 隐含假设:技能所需结构能力可由有限基础能力表示。
- 可攻击点 / 脆弱点:结构检查不能保证历史时点、统计和合规正确,固化代码可能稳定执行旧流程。
Agentix-NSDI26
- 路线与角色:智能体运行时;程序级调度的转折工作。
- 证据等级:
complete/full-text。 - 做了什么:向调度器暴露完整智能体程序和调用进度,缓解两级队首阻塞。
- 没做什么:不感知实验价值、工具副作用、验证失败和金融优先级。
- 关键观察:程序等待可能超过模型执行时间,单请求抽象会丢失重要调度信号。
- 隐含假设:完成调用越多,程序通常越接近结束。
- 可攻击点 / 脆弱点:重试、动态分支和失败重跑会让调用数与剩余工作反向,短任务优先可能饿死长研究。
Murakkab-OSDI26
- 路线与角色:智能体运行时;完整工作流画像与资源编排的扩展工作。
- 证据等级:
complete/full-text。 - 做了什么:用声明式有向无环图、画像、优化器和自动扩缩容联合选择模型、工具与硬件。
- 没做什么:没有真实生产轨迹、恰好执行一次语义和开放任务质量验证器。
- 关键观察:工作流配置收益并不单调,更大模型或更多审查者不必然更好。
- 隐含假设:各层画像可以组合,并能代表未来工作负载。
- 可攻击点 / 脆弱点:提示、工具与数据漂移会使画像失效,量化长尾和副作用未覆盖。
AgenticCache-MLSys26
- 路线与角色:智能体运行时;计划缓存快路径的扩展工作。
- 证据等级:
needs-review/full-text。 - 做了什么:缓存高频计划转移,由后台模型异步确认、纠错和替换。
- 没做什么:只在离散仿真任务中评价,不覆盖研究产物、市场漂移和实盘状态。
- 关键观察:常见计划具有局部重复性,但纯缓存会因环境变化显著降低成功率。
- 隐含假设:少量元数据能识别多数失效计划,异步纠错足够及时。
- 可攻击点 / 脆弱点:旧市场流程可能被稳定放大,缓存投毒、删除与跨版本失效未评价。
外部证据卡
XALPHA:多源记忆量化研究系统
- 路线与角色:自动研究闭环;多源记忆驱动的最新外部线索。
- 证据等级:外部论文原页与摘要,未进入 wiki 全文审计。
- 做了什么:把报告知识、历史生成反馈和周期总结写入研究记忆,指导假设到代码闭环。
- 没做什么:本调研未核验完整时间切分、搜索查询预算和前瞻交易协议。
- 关键观察:孤立的因子生成不足,连续研究需要吸收外部知识与历史失败。
- 隐含假设:记忆摘要能持续提高候选质量,而不会固化过期市场规律。
- 可攻击点 / 脆弱点:在同一历史环境反复使用记忆可能加速自适应过拟合。
AQuA:递归量化研究系统
- 路线与角色:自动研究闭环;受限沙箱与验证证据复用的最新外部线索。
- 证据等级:外部论文原页与摘要,未进入 wiki 全文审计。
- 做了什么:分别建立公式因子和可训练模型系统,以固定数据、标签和评价器的沙箱闭合研究循环。
- 没做什么:摘要未证明两个闭环能共享状态,也未提供长期实盘和故障恢复证据。
- 关键观察:受限动作空间和固定评价器能把持续改进约束在可执行边界内。
- 隐含假设:固定切分上的验证证据能够安全指导后续提案。
- 可攻击点 / 脆弱点:若反复读取同一留出反馈,密封沙箱仍可能被搜索过程适应。