Market-Bench 入门量化回测基准(arXiv 2025)

原题:Market-Bench: Evaluating Large Language Models on Introductory Quantitative Trading and Market Dynamics

一句话总结:Market-Bench 要求 13 种大语言模型(Large Language Model,LLM)从自然语言实现三类回测,并把运行成功与数值正确分开;Qwen3 Max 虽 15 轮全部可执行,总体平均绝对误差却约为 ,揭示“代码能跑”不是可信验证。

问题与动机

通用代码基准不能检查订单簿流动性、持仓、盈亏和风险的金融语义。Market-Bench 用参考实现逐时比较模型生成回测器的盈亏、回撤和仓位路径,测试模型是否真正实现给定策略。

关键观察 / 隐含假设

  • 观察 1:结构正确与语义正确明显解耦;Qwen3 Max 全部 15 轮可执行,却因配对交易逻辑偏离而产生约 的总体平均绝对误差(§5.3,表 4)。
    • 依赖假设:参考实现准确表达了题目中的金融语义。
  • 观察 2:任务从单股定时执行扩展到配对交易和期权德尔塔对冲后,可执行轮数下降且误差跨越多个数量级(§5.1–§5.2)。
    • 可能失效场景:三种策略规模太小,难代表完整量化研究。
  • 假设 1:逐指标绝对误差可以汇总为模型正确性。
    • 证据强度:中;未归一化指标会让大尺度变量主导总分。

核心方法

基准包含单股定时成交、KO/PEP 配对均值回归和 MSFT 期权德尔塔对冲。每种策略有五轮数据和参数配置,每轮最多采样三次;执行失败使用“重复初始指标”的基线误差,成功则计算模型结果与参考路径的平均绝对误差。

题目要求维护成交后合成订单簿、共享资本、先进先出成本、交易所延迟和订单类型,从而同时暴露语法错误与运行后仍错误的金融逻辑。

设计取舍

  • 参考执行提高可判定性:能区分可执行与数值正确,但正确性被绑定到作者选择的市场微观结构假设。
  • 少量策略提高审计性:便于逐条定位错误,却牺牲了因子发现、组合构建和真实部署覆盖。

实验与结果

  • 所有模型结果都相比可验证参考实现计算误差(error);执行失败则使用重复初始指标的基线误差,从而把结构失败和数值偏差纳入同一评分(§4.1–§4.4)。
  • 在 13 种模型、五轮 MSFT 单股订单簿任务上,平均可执行 4.08/5 轮,即 81.6%;Gemini 3 Pro 与 Claude Sonnet 的平均绝对误差分别为 14.83 和 16.36(§5.1.1,表 1)。
  • 在相同五轮协议的 KO/PEP 配对任务上,模型平均可执行 3.46/5 轮;Qwen3 Max 虽五轮全部可执行,平均绝对误差却约为 (§5.1.2,表 2)。
  • 在相同五轮协议的 MSFT 德尔塔对冲任务上,模型平均可执行 3.38/5 轮;GPT-5.2 的最低平均绝对误差为 1,369.59,Grok 4 为 1,482.33(§5.1.3,表 3)。
  • 三种策略、13 种模型共 329 次尝试;同一模型不同轮次的平均误差与最优误差显著分离,因此最优一次不能代表平均可靠性(§8)。

论断—证据表

论断证据评测边界置信度
可执行性不能代表金融语义正确§5.3 Qwen3 Max 的 15 次通过与巨大误差三种入门策略
多资产与对冲状态更容易出错表 1–3 的通过率和误差单一数据协议与参考实现
当前模型不能替代量化工程师§6 的失败分类未覆盖工具辅助、测试驱动修复和长期任务

批判性分析

基准准确击中“无报错但算错”的风险,但总体误差未归一化,跨策略排名可能受指标尺度影响。温度设为 0 仍不能保证服务端完全确定,且每轮最多三次的采样不足以估计长尾失败率。

作者的参考实现是必要的裁判,却也是单点假设:订单簿消耗、延迟、资本限制和会计规则若与生产环境不同,模型偏离不一定全是模型错误。

局限与后续工作

  • 局限 1:仅三种策略,不含成本敏感执行、多资产组合和真实风险限额。
  • 局限 2:绝对误差难以跨量纲比较。
  • 后续工作 1:加入性质测试与错误变异集,分别测量前视偏差、会计、订单语义和风险约束的检出率。
  • 后续工作 2:评价带单元测试、参考数据字典和迭代修复工具的智能体,而非只看一次代码生成。

相关