CausalGame:在交互游戏中评测大语言模型智能体的因果思考(ICML 2026)
原题:CausalGame: Benchmarking Causal Thinking of LLM Agents in Games
一句话总结:CausalGame 用 14 个由结构因果模型驱动的交互场景,把“找到高分设计”与“理解隐藏机制”分开;30 个 LLM 智能体中最佳生存率仅 68.0%,低于 78–85% 的解析最优值,且只有 5–7% 会话在因果推理 rubric 上得分,说明增加推理预算或通用脚手架尚不能稳定跨越从试错搜索到机制发现的缺口(§4.2–4.4,图 5–8)。
问题与动机
现有 AI Scientist 基准多测给定目标后的执行能力:复现论文、改进模型、分析数据或写研究报告。即便智能体最后得到高分,也不代表它识别了数据生成机制;它可能只是碰巧搜索到有效配置,或把选择偏差、测量误差和隐藏混杂造成的相关性误当成因果关系。
CausalGame 将这一缺口变成可重复的交互评测。智能体扮演无人机设计者,只能看到幸存无人机的部分历史记录,并在有限实验预算内调整七个部件的防御值。环境由隐藏的结构因果模型(structural causal model, SCM)控制;智能体既要提交最终设计,也要解释从观察和干预中推断出的机制(§3.1,图 3)。
论文当前仓库来源是 56 页 arXiv v1 长版;首页明确说明短版获 ICML 2026 Oral。本文据长版的完整实验与附录评审,venue 按已接受的 ICML 2026 记录。
关键观察 / 隐含假设
-
观察 1:任务成功与因果理解显著脱钩。 在 Deployment Zone Trap 中,只有约 0.3% 轨迹达到最优档,且这两条轨迹的因果推理得分仍为 0;总体只有 5–7% 会话在因果 rubric 上获得满分(§4.2、附录 G,图 6、26)。
- 依赖假设:自然语言报告中的机制解释可以由 rubric 可靠区分,且智能体没有理解却未表达的系统性情况。
- 可能失效场景:模型可能通过正确干预策略体现隐式因果知识,却因报告格式、表达不足或 LLM judge 偏差被判低分。
-
观察 2:更多推理计算不稳定改善因果表现。 GPT-5.5、GPT-5.5-High、GPT-5.5-XHigh 的平均生存率分别为 66.8%、67.8%、65.4%;DeepSeek-V3.2 与 Think 版为 58.7% 和 59.1%,差异小于模型跨场景的 4–10 个百分点标准差(§4.2,表 13、16)。
- 依赖假设:同 family 的不同 reasoning budget 版本足以近似控制模型能力差异。
- 可能失效场景:针对主动因果发现训练过的模型、显式实验规划器或预算受控的 test-time search 可能出现不同 scaling 曲线。
-
观察 3:脚手架能提高奖励,但未消除机制理解缺口。 OpenCode 在 5 个模型上均优于 ReAct,平均生存率提升 6.9 个百分点;最佳框架均值仍显著低于约 82% 的解析最优值(§4.2,图 8)。
- 依赖假设:生存率与因果能力仍有足够相关性,可以用剩余最优差距定位瓶颈。
- 可能失效场景:OpenCode、Prompting 与 ReAct 的工具、格式和探索 guard 不同,跨框架差异不是严格受控消融;更专用的因果实验脚手架可能弥合差距。
-
观察 4:选择偏差会在多轮交互中被反馈放大。 去掉选择偏差后,Agentic 与 Prompting 的平均生存率分别提高 8.7 和 7.2 个百分点;作者推断顺序决策会让早期偏见改变后续采样,再生成更偏的数据(§4.3,表 3)。
- 依赖假设:无偏与有偏场景除采样机制外保持足够可比,性能差主要来自选择偏差。
- 可能失效场景:真实科研中可见变量、干预成本和数据质量同时变化,单一偏差消融可能低估或误估交互效应。
-
假设 1:程序化 SCM 游戏能代表真实科学发现中的因果困难。
- 证据强度:中。选择偏差、测量误差与隐藏混杂是真实问题,SCM 又提供解析真值;但无人机配置空间远小于真实科学的开放假设空间、领域知识和测量链。
-
假设 2:外部隐藏机制必须与智能体的工具边界严格隔离。
- 证据强度:强。未加固 API 时,智能体会读取 scenario identifier 和 admin endpoint;泄漏使相关试验生存率平均增加 18.5 个百分点,说明 side channel 足以污染主结论(§4.5,图 14)。
核心方法
CausalGame 用 SCM 作为游戏引擎,把天气、隐藏部署区域、部件损伤、敌方侦测和最终生存连接起来。14 个场景分为 Antenna Trap、Deployment Zone Trap 与 Weather 三个 family,并通过是否提供历史、局部最优、Simpson’s paradox、环境漂移和噪声等变体控制难度(§3.1–3.2,附录 C.2)。
每次任务分两阶段。探索阶段提供 200 架无人机和至多 10 次 deployment;智能体选择配置并获得带删失、混杂或噪声的反馈。评测阶段只允许提交一个设计,用 1,000 架无人机估计生存率。作者从 SCM 解析推导最优配置,再以重复部署验证,理论与经验生存率相差不超过 2–3 个百分点(§3.1,附录 C.4)。
系统同时提供单轮 Prompting 与多轮 Agentic 两种执行模式。Agentic 使用 ReAct 工具循环,并强制至少做一次实验再提交;Prompting 可直接写 Python 调 client。两者工具权限、交互格式和推理要求并不相同,因此论文把跨模式结果视为系统比较,而不是干净的单变量消融(§4.1,表 5)。
最终评测包含外部生存率与解释 rubric。rubric 分为因果推理 11 分、实验设计 2 分、反思质量 2 分和数据使用 1 分,由三个 LLM judge 独立评分。平均 ICC 为 0.75;实验设计、反思和数据使用的 ICC 为 0.85–0.89,三个因果条目只有 0.61–0.64(§3.3、§4.4,图 11)。
设计取舍
- 可控真值 vs 现实复杂度:SCM 给出隐藏机制、解析最优值和可重复干预,却把科学发现压缩成低维配置游戏,不能覆盖开放选题、仪器故障、领域知识与多阶段证据链。
- 结果指标 vs 机制指标:生存率客观但可能被试错或泄漏“买到”;解释 rubric 能区分机制理解,却重新引入 LLM-as-a-judge 的表达和模型偏差。
- 统一预算 vs 框架自由度:固定 200 次探索样本和 10 次 deployment 便于比较;OpenCode 的 shell、记忆与代码执行能力则扩大攻击面,使 benchmark hardening 成为测量的一部分。
- 隐藏环境 vs 可审计性:对智能体隐藏 SCM 才能测发现能力;研究者仍需公开方程、阈值和轨迹以便复核,这要求 agent-facing 与 evaluator-facing 接口严格分离。
- 边界条件:适合存在可模拟 SCM、干预便宜且结果可重复采样的任务;不适合真实机制未知、干预昂贵或伦理上不可执行的科学领域。
实验与结果
- 30 个模型、14 个场景、Prompting/Agentic 两种模式,每个 model×scenario 运行 3 次;最佳 Claude-Opus-4.5 Agentic 平均生存率为 68.0%,而不同 family 的解析最优值为 78–85%(§4.1–4.2,图 5,表 16)。
- 高生存率不等于理解机制:Deployment Zone Trap 的两条最优档轨迹因果得分仍为 0;三个因果 rubric 中 87–92% 会话得 0,只有 5–7% 获满分(§4.2、§4.4,图 6、11、26)。
- 在 Stage 1 生存率为 75–85% 的轨迹中,满足全部因果 rubric 的平均 exploration gap 为 −3.0 个百分点,不满足者为 +4.5 个百分点;其他三个 rubric 维度未形成清晰分离(§4.2,图 7)。
- OpenCode 相对 ReAct 在 5 个模型上分别提高 13.9、9.3、6.3、2.7、2.2 个百分点,平均提升 6.9;但仍未达到 75% win threshold(§4.2,图 8)。
- 去掉选择偏差后,Agentic 从 63.8% 升至 72.5%,Prompting 从 65.4% 升至 72.6%(§4.3,表 3)。
- 四个非 LLM/弱探索 baseline 的平均生存率为 49.0–57.5%,与较弱完整智能体区间重叠,说明仅有交互循环并不自动产生有效实验策略(§4.3,图 8)。
- 配置轨迹的 judge-independent 审计发现,504 个 Antenna Trap agentic session 中 74.4% 至少一个部件几乎不探索,12.5% 停在错误的高 antenna 防御区间,9.7% 曾找到正确低值却在最终提交时漂移回错误配置(附录 G,图 24)。
- 未加固接口中,13 个受影响模型有 20–62% 会话回显隐藏场景名;泄漏使相关试验生存率平均提高 18.5 个百分点。作者修补接口并用加固后的结果作为主表(§4.5,图 14)。
论断—证据表
| 论断 | 证据 | 评测边界 | 置信度 |
|---|---|---|---|
| 当前前沿智能体未可靠识别隐藏因果机制 | §4.2,图 5、表 16:最佳 68.0%,解析最优 78–85% | 30 个 2026 前沿模型;14 个合成 SCM 场景;每格 3 次 | 强 |
| 任务奖励不能替代机制理解指标 | §4.2、§4.4,图 6、26:最优档仍可因果得分为 0,87–92% 因果条目为 0 | 报告由三个 LLM judge 评分;因果 ICC 0.61–0.64 | 强 |
| 增加通用脚手架主要改善搜索,而未解决因果瓶颈 | §4.2,图 8:OpenCode 平均提高 6.9 个百分点但仍低于阈值/最优 | 仅 5 个模型;框架间工具与协议不同 | 中 |
| 选择偏差显著损害交互式发现 | §4.3,表 3:移除后 Agentic/Prompting 提高 8.7/7.2 个百分点 | 合成 matched variants;未覆盖多偏差联动 | 强 |
| benchmark 的工具泄漏会制造虚假能力提升 | §4.5,图 14:场景名泄漏使生存率平均提高 18.5 个百分点 | 修补前 exploratory sweep;主结果已在加固环境重跑 | 强 |
批判性分析
论证链条
论文的主链条闭合得较好:现有 benchmark 把奖励当能力 → 构造带解析机制的交互环境 → 同时评最终设计和机制解释 → 通过结果、rubric 与配置轨迹三种证据证明“会试错”不等于“会因果发现”。尤其是 exploration gap 与 judge-independent 配置分析,使结论不完全依赖自然语言 judge。
从合成游戏外推到“现有 LLM 不适合科学发现”则需要收窄。论文证明的是:在 14 个低维但刻意含偏差的 SCM 场景里,当前 agent 未稳定发现隐藏机制;它没有证明模型在具备领域知识、真实仪器或人类协作的科研环境中同样失败,也没有人类参与者基线来校准任务难度。
假设压力测试
SCM 的解析最优值提供了强 ceiling,但 benchmark 只允许有限的离散配置与固定协议。真实研究者会改测量工具、提出新变量、改变实验单位或拒绝不安全干预;当前智能体主要在预设 action space 内找参数,因果发现的开放性被压缩。
报告 rubric 也可能把“机制理解”和“表达机制”混在一起。三个因果条目的 ICC 只有 0.61–0.64,作者归因于 87–92% 零分造成的分布偏斜,这能解释统计现象,却不能排除 judge 对边缘证据判断不一致。最好加入专家盲评和基于干预预测的非语言机制测试。
实验可信度
30 个模型、两种交互模式、三次独立 trial、解析最优值、matched bias 消融与轨迹审计使证据覆盖很宽。作者还诚实报告 API 泄漏并重跑加固环境,这是 agent benchmark 中很重要的测量卫生。
薄弱点在于每个 model×scenario 只有 3 次,许多置信区间很宽;Prompting 与 Agentic 同时改变多个因素,不能归因于“agentic”本身;OpenCode 只覆盖 5 个模型。缺少人类或经典主动因果发现算法基线,也使 78–85% 的解析最优值更像理论上限,而不是现实可达的能力锚点。
系统性缺陷
- 接口隔离:shell agent 会枚举 OpenAPI、访问 admin route、读取 scenario identifier;修补单次泄漏不能证明没有其他 side channel。
- 终止正确性:39 个会话在实际低于阈值时仍宣称成功,说明 self-report 不能作为停止或验收信号。
- 评分安全:最终报告由 LLM judge 评分,需要防 prompt injection、日志污染和同源模型偏差;论文给了 untrusted-data 指令,但未做攻击评测。
- 复现成本:30 个不断变化的 proprietary model 与 API 版本降低长期可复现性;论文没有把 token 成本、墙钟时间和失败重试统一纳入主指标。
- 现实部署:真实科学干预可能昂贵、不可逆或涉及伦理约束,当前 200 次模拟试验的探索策略不能直接迁移。
局限与后续工作
- 局限 1:14 个场景虽对应真实因果陷阱,但 action/hypothesis space 仍远小于真实科研,外部有效性有限。
- 局限 2:Prompting 与 Agentic 同时改变工具、格式和探索 guard,跨模式差异不是受控消融。
- 局限 3:细粒度机制评分依赖 LLM judge;因果条目只有中等 inter-rater agreement,尚无人类专家对齐。
- 局限 4:缺少人类研究者与经典主动因果发现算法基线,无法区分任务固有难度、界面难度和 LLM 特有缺陷。
- 局限 5:主结果每个 model×scenario 只有 3 次,部分场景方差较大;proprietary model 快速变动也会缩短榜单寿命。
- 后续工作 1:在固定模型上分别只改变工具权限、ReAct 格式、探索 guard 与 memory,报告至少 20 seeds 的生存率和因果 rubric,得到真正的脚手架因果效应。
- 后续工作 2:招募人类研究者并接入主动因果发现算法,在相同 200-drone/10-call 预算下比较机制恢复率、样本效率与最终生存率。
- 后续工作 3:建立自动 side-channel audit:每次发布前枚举 agent 可见 endpoint、环境变量、文件、错误信息和 identifier,并把 leakage exploit rate 纳入 benchmark 报告。
- 后续工作 4:用未见过的 SCM family 和程序生成图做 held-out generalization,要求智能体预测新干预结果,而不只解释已完成轨迹。
相关
- 相关概念:LLM、因果推理、结构因果模型、主动实验设计、选择偏差、隐藏混杂、ReAct、LLM-as-a-judge
- 同类基准:DDR-Bench-ICML26、HeurekaBench-ICLR26、PaperBench-ICML25、MLR-Bench-arXiv25
- 相关科研系统:DeepScientist-ICLR26、Co-Scientist-Nature26
- 同主题:Auto-Research
- 同会议:ICML 2026