深度调研(Probe):用智能体解决系统工程问题
阅读提示
- 智能体闭环:智能体提出系统制品或动作,环境执行并返回能改变下一轮选择的结果;不只是连续调用模型。
- 验证器(verifier):以编译、测试、证明、模拟或真实运行判断候选是否满足约束的组件。验证器通过只证明给定检查没有发现问题。
- 评测脚手架(evaluation harness):封装环境、基线、输入、计时、正确性、资源限制、归档和晋升规则的可执行系统。
- 晋升合同(promotion contract):候选从试验状态进入可复用或可部署状态前必须满足的检查、指标与回滚要求。
- 搜索分母:总共生成、执行、拒绝和保留的候选数量,以及模型词元、硬件小时和人类介入。
- 适用域(applicability domain):经验或配置成立的硬件、软件版本、工作负载和服务等级目标范围。
- 奖励欺骗(reward hacking):候选利用评测漏洞取得高分,却没有实现预期语义或在隐藏输入上失效。
- 样本外(out-of-sample,OOS)验证:使用搜索过程不可见的输入、硬件、时间段或故障检验候选,防止反复适应同一评测集。
一页结论
- 现有工作形成六条路线:规格驱动生成、编译器协同变换、可执行性能搜索、系统配置与诊断、评测与晋升基础设施,以及面向智能体的软件接口。它们共同把开放式生成压缩到可执行、可测量、可回退的窄控制面。
- 时间上,2024 年的代表工作主要把模型接入诊断知识和工具;2025 年把可执行评估器用于算法、调度、配置和性能建议;2026 年的转折是验证器、硬件中间表示、持久经验和生产评测脚手架开始成为主要贡献。
- 24/26 篇核心工作没有展示从候选生成到长期生产回滚的完整生命周期;在 19 篇直接生成或优化可执行制品的工作中,15/19 没有独立的时间、硬件或隐藏二级终检;21/26 没有完整披露搜索分母与人工成本。
- “更强模型能否替代脚手架”仍有实质争议。VibeTensor 显示大型系统可以被生成,Harness Engineering、SOL-ExecBench 和 PithTrain 则表明环境、检查器和软件结构仍决定正确性与成本。
- 提案前应先统一比较智能体、经典搜索与人类专家,并分层测量验证器独立召回、经验跨环境负迁移、微基准到端到端的收益传导,以及带副作用动作的恢复语义。
范围与证据
本调研纳入大语言模型智能体产生或修改可执行系统制品,或者根据运行证据诊断、配置和控制系统的工作。纯聊天建议、只预测性能的模型和仅优化智能体运行时的系统不属于核心对象;SysGPT-OSDI25、PithTrain-arXiv26 与 AutoMan-SOSP25 分别作为顾问、软件接口和非大语言模型形式生成的边界对照。
本次从 Auto-Research、AI-Infra、Agent-Systems、LLM 与 Optimize-Anything 的第一层关联页复核 26 篇全文论文。外部资料只用于补足产业实践和 2026 年变化,包括 OpenAI Harness Engineering、Meta KernelEvolve 工程报告、NVIDIA CompileIQ 和 AlphaEvolve 影响报告。本次未启用 --ingest-missing。
研究版图
| 研究路线 | 核心问题 | 代表工作 | 当前边界 |
|---|---|---|---|
| 规格驱动生成 | 如何把意图压缩为可检查的实现 | SysSpec-FAST26、VeriMoA-MLSys26、NeuroSymbolicProof-OSDI26、AutoMan-SOSP25 | 规格错误与实现外部语义仍需人判断 |
| 编译器协同变换 | 模型与编译器如何各做擅长的变换 | ACCLAIM-arXiv26、CAKE-arXiv26、TritorX-MLSys26 | 正确性多由测试近似,抽象本身会累积维护成本 |
| 可执行性能搜索 | 如何用运行反馈搜索内核、算法和调参器 | AlphaEvolve-arXiv25、KernelEvolve-ISCA26、PIKE-MLSys26、AVO-arXiv26 | 搜索分母、隐藏过拟合与人工贡献常不透明 |
| 系统配置与诊断 | 如何把观测转成配置、调度或根因动作 | SchedCP-arXiv25、StorageXTuner-arXiv25、IDSTune-arXiv26、INTA-arXiv25、D-Bot-PVLDB24 | 带副作用变更缺事务、权限和完整回滚语义 |
| 评测与晋升基础设施 | 如何证明候选值得保留或部署 | FlashInfer-Bench-MLSys26、SOL-ExecBench-arXiv26、HarnessEngineering-arXiv26 | 隐藏测试、版本和生产维护仍不完整 |
| 面向智能体的软件接口 | 系统怎样变得更易被智能体理解和修改 | PithTrain-arXiv26、VibeTensor-arXiv26、SysGPT-OSDI25 | 紧凑性、可生成性与长期架构质量尚未统一衡量 |
这六条路线不是互斥组件,而是一条逐渐收窄风险的链:接口和规格限定可修改空间,智能体或搜索器提出候选,编译器与工具执行,评测脚手架筛选,晋升合同决定是否进入真实系统。多数论文只闭合其中一至两段,因此局部高成功率不能直接外推为系统级自治。
时间脉络
总体阶段
知识与工具辅助诊断 → 可执行评估器驱动搜索 → 规格和中间表示约束生成 → 评测脚手架与持久经验 → 生产晋升与长期维护成为瓶颈
系统配置与诊断
- 2024 — D-Bot-PVLDB24:从链式语言推理转向“知识、工具和树搜索”诊断数据库,证明外部证据比模型记忆重要;但只报告根因,不执行修复。
- 2025 — SchedCP-arXiv25 与 INTA-arXiv25:分别把调度策略库和配置意图作为中间层,控制面开始由稳定工具接口和确定性检查器约束。
- 2025 — StorageXTuner-arXiv25:把成功与失败经验持久化到后续调优,问题从一次配置选择扩展为跨会话学习。
- 2026 — IDSTune-arXiv26:将旋钮、索引和物化视图专家并行化,再用监督智能体消解冲突,揭示局部最优无法直接组合。
可执行性能搜索
- 2025 — AlphaEvolve-arXiv25:以双模型、岛式种群和可执行评估器演化整文件程序,并报告基础设施部署,确立“模型作变异器、系统作裁判”的范式。
- 2026 — PIKE-MLSys26:固定预算比较多智能体探索策略,研究重点从“能否优化”转向搜索组织如何影响样本效率。
- 2026 — AdaExplore-arXiv26 与 AccelOpt-MLSys26:将失败和快慢候选压缩成可迁移技能或优化记忆,搜索开始跨任务积累经验。
- 2026 — AVO-arXiv26 与 KernelEvolve-ISCA26:把单次竞赛式优化扩展到数日持续搜索与生产异构加速器,长期谱系和真实形状成为一等输入。
规格、编译器与实现生成
- 2025 — AutoMan-SOSP25:作为非大语言模型对照,从 TLA/Dafny 规格自动生成经证明实现,并允许人工优化热点,说明可验证生成不必依赖多智能体。
- 2026 — SysSpec-FAST26:以功能、模块和并发三类半形式规格驱动文件系统生成与演化,规格开始承担长期维护接口。
- 2026 — ACCLAIM-arXiv26 与 CAKE-arXiv26:前者在 C、LLVM 中间表示和 x86 层间分工,后者共同演化硬件显式中间表示;模型与编译器从串联变成协同搜索。
- 2026 — NeuroSymbolicProof-OSDI26:让模型提议证明步骤、由 Isabelle 内核裁决,验证信号从测试提升为机器检查的命题证明。
- 2026 — VibeTensor-arXiv26:展示跨 C++、CUDA、自动微分和前端的大型运行时可以由智能体生成,同时暴露局部正确组件组合成全局低效系统的问题。
评测与软件接口
- 2025 — SysGPT-OSDI25:从系统论文归纳优化原则,证明模型可提供方法建议,但没有执行闭环。
- 2026 — FlashInfer-Bench-MLSys26:把生产形状、正确性、隔离计时和部署接口连接起来,评测对象从孤立内核变成可集成制品。
- 2026 — SOL-ExecBench-arXiv26:以硬件理论上限替代弱软件基线,并从真实提交发现 14.5% 奖励欺骗,评测安全成为显式问题。
- 2026 — PithTrain-arXiv26:反向改造训练框架,使调用链、错误和技能更易被编程智能体读取,软件结构本身成为智能体效率变量。
- 2026 — HarnessEngineering-arXiv26:人类给方向、参考和晋升规则的版本在五项任务中均优于全智能体版本,明确把“脚手架质量”提升为主要系统贡献。
各类工作的演化
规格驱动生成
共同目标:在生成前或生成中把允许行为写成可检查的规格、证明目标或接口合同,缩小开放式代码空间。
演化与分歧:AutoMan 使用形式规格和精化证明;SysSpec 使用更易编写但较弱的半形式规格;VeriMoA 与 TritorX 以测试和静态格式检查约束硬件或算子代码;NeuroSymbolicProof 由证明内核给出最强裁决。VibeTensor 则以仓库结构和差分测试生成更大系统,代表较弱规格但更广覆盖。
共同边界:验证器只能证明给定命题或测试。规格是否表达真实意图、模块合同是否完备,以及实现与外部环境是否一致,仍没有通用机器判定。
相关工作:SysSpec-FAST26、VibeTensor-arXiv26、TritorX-MLSys26、VeriMoA-MLSys26、NeuroSymbolicProof-OSDI26、AutoMan-SOSP25
编译器协同变换
共同目标:让模型负责高层搜索和解释,让编译器负责低层合法变换与硬件约束。
演化与分歧:ACCLAIM 在既有 C、LLVM 与 x86 层间选择变换位置;CAKE 允许编译器与智能体共同扩展带类型的调度中间表示。前者强调跨层机会,后者强调可搜索抽象本身。
共同边界:测试不能证明语义等价,中间表示越强也越可能吞掉优化意图或积累任务专用规则。当前证据集中在小程序和内核,而非并发、外部状态和大型系统。
相关工作:ACCLAIM-arXiv26、CAKE-arXiv26
可执行性能搜索
共同目标:把编译错误、正确性、运行时间和性能剖析转成候选选择信号,使模型在真实执行中迭代。
演化与分歧:AlphaEvolve 与 GEPA 提供通用演化内核;PIKE 比较搜索组织;AdaExplore 和 AccelOpt 积累跨任务经验;AVO 追踪数日谱系;KernelEvolve 面向生产异构硬件;LLaMEA-KernelTuner 进一步让模型生成调参算法而非直接生成内核。各工作对候选表示、反馈丰富度和人类参与程度差异很大。
共同边界:可执行评分越清晰,越容易被反复适应。最终最佳候选往往同时受模型、搜索预算、人工给定空间、参考实现和评测漏洞影响,论文却很少用统一成本分解它们。
相关工作:AlphaEvolve-arXiv25、KernelEvolve-ISCA26、AccelOpt-MLSys26、PIKE-MLSys26、AdaExplore-arXiv26、AVO-arXiv26、HarnessEngineering-arXiv26、LLaMEA-KernelTuner-MLSys26、GEPA-ICLR26
系统配置与诊断
共同目标:从遥测、手册、代码和用户意图中恢复系统目标,再选择配置、策略或根因解释。
演化与分歧:D-Bot 停在诊断报告;INTA 生成跨厂商配置并保留人工复核;SchedCP 可生成或选择内核调度策略;StorageXTuner 与 IDSTune 调整数据库或存储配置,后者还协调多个相互影响的组件。自治程度越高,副作用和回滚责任越重。
共同边界:短期观测不一定表达真实目标;自然语言经验缺少明确适用域;沙箱通过后,跨设备事务、最小权限、部分提交和长期漂移仍未闭合。
相关工作:SchedCP-arXiv25、INTA-arXiv25、D-Bot-PVLDB24、StorageXTuner-arXiv25、IDSTune-arXiv26
评测与晋升基础设施
共同目标:让性能候选在可重放、可比较且不易被投机的环境中接受正确性和效率审查。
演化与分歧:FlashInfer-Bench 从真实服务轨迹定义任务并提供部署接口;SOL-ExecBench 用硬件上界校正弱基线,并隔离投机提交;Harness Engineering 将技能、参考、剖析和晋升门组合成实际工作流。
共同边界:所有检查都有盲点。固定少量随机测试会漏数值边界,硬件上界模型也可能不准确;基准版本、驱动变化和长期回归仍需单独治理。
相关工作:FlashInfer-Bench-MLSys26、SOL-ExecBench-arXiv26、HarnessEngineering-arXiv26
面向智能体的软件接口
共同目标:降低智能体恢复代码结构、工具流程和性能知识的成本。
演化与分歧:SysGPT 把历史方法论压缩为建议;PithTrain 以显式 Python 调用链和技能改造训练框架;VibeTensor 则从空白仓库直接生成一个可运行系统。三者分别改善知识、可修改性和生成能力。
共同边界:紧凑和显式可能牺牲成熟框架的覆盖与复用;能生成代码也不代表能长期维护架构。当前任务较短,模型、框架版本和多人协作变化尚未充分测量。
相关工作:SysGPT-OSDI25、PithTrain-arXiv26、VibeTensor-arXiv26
跨工作共同缺陷
| 共同缺陷 | 覆盖范围 | 为什么是系统性问题 | 已有缓解与剩余缺口 |
|---|---|---|---|
| 生产生命周期不完整 | 24/26 篇未展示生成、终检、金丝雀、回滚与长期维护全链 | 系统制品会改变共享状态,离线通过不能说明可安全上线 | AlphaEvolve 与 KernelEvolve 有生产案例;公开证据仍缺失败分母、事故与回滚 |
| 独立终检不足 | 15/19 篇直接生成或优化可执行制品的工作没有时间、硬件或隐藏二级终检 | 搜索会反复适应可见测试,候选越多,偶然过关和奖励欺骗越严重 | SOL-ExecBench、FlashInfer-Bench、Harness Engineering 和 NeuroSymbolicProof 提供更强隔离;仍未覆盖真实未来漂移 |
| 搜索分母和人工成本不透明 | 21/26 篇未同时报告候选数、模型词元、硬件小时、人类介入和验证成本 | 无法区分算法改进、更多预算、强参考与人工方向的贡献 | PithTrain、IDSTune 和部分基准报告若干成本;仍不能跨论文比较总投入 |
| 局部收益难传到端到端 | 13/16 篇代码生成或性能优化工作主要报告微基准、局部实现或小案例 | 更快内核可能移动瓶颈,局部正确组件也会形成全局低效架构 | FlashInfer-Bench 提供 apply() 集成,VibeTensor 给出反例;缺多租户与长运行传导率 |
| 经验缺少版本与撤销 | 8/8 篇显式复用经验、技能、诊断或知识库的工作未完整编码适用域和失效条件 | 硬件、编译器和负载变化会把成功经验变成负迁移 | StorageXTuner 可升降置信度,AdaExplore 保留多样性;仍缺跨版本失效检测和自动撤销 |
| 带副作用动作缺事务语义 | 配置与诊断路线 5/5 篇未展示跨动作完整事务 | 数据库、网络和调度变更可能部分生效,重复执行或回滚失败会伤害生产 | D-Bot 只报告不执行,是风险较低的反例;IDSTune 有双层门,但无完整准备、提交和补偿状态机 |
关键争议
规格优先还是执行筛选优先
SysSpec、AutoMan 和 NeuroSymbolicProof 先用规格或证明目标压缩错误空间;AlphaEvolve、PIKE 和 StorageXTuner 更依赖执行后筛选。规格可能错误或不完整,执行筛选又会过拟合有限测试。现有证据更支持组合路线:规格限定允许空间,独立执行终检决定晋升。
完全自治还是人机协作
AlphaEvolve 和 KernelEvolve 展示生产价值,但搜索空间、评估器、知识与上线选择仍由专家设计;Harness Engineering 直接报告人类给方向的版本在五项中均优于全智能体版本。当前自治主要发生在候选搜索内环,不发生在目标、风险接受和长期责任层。
通用搜索器还是领域专用控制面
GEPA 与 AlphaEvolve 说明“候选加评估器”可跨任务复用;CAKE、KernelEvolve、SchedCP 和 PithTrain 则用领域中间表示、知识库或软件结构换取可靠性。通用接口降低接入成本,领域控制面提高信号质量;谁更优取决于评估器是否稠密、动作是否有副作用、知识是否会漂移。
更强模型会替代脚手架吗
VibeTensor 证明强智能体能生成广泛系统代码;PithTrain 显示同一智能体在更显式框架上最多减少 70% 轮数;SOL-ExecBench 又发现 14.5% 提交会攻击评测。模型能力提高可能减少语法与导航成本,却也扩大搜索吞吐和验证压力,因此脚手架价值可能转向架构、不变量和终检,而不是消失。
微基准是否代表真实系统价值
内核搜索工作能提供清晰、低成本奖励;SchedCP、IDSTune 和 INTA 面对公平、可用性、状态一致性与变更风险。FlashInfer-Bench 的端到端案例显示局部加速可能只带来很小服务收益。局部指标的价值必须由瓶颈占比和部署调用量条件化。
产业实践与学术缺口
- Google DeepMind 的 AlphaEvolve 影响报告说明可执行演化已进入 Google 基础设施和更多科学领域;公开材料展示最佳结果与影响,但没有统一披露搜索成本、失败候选和回滚事件。
- Meta 的 KernelEvolve 工程报告把内核智能体接入 Ranking Engineer Agent 和生产异构加速器。这说明生产采用偏好真实形状、内部编译器和强验证,而非裸模型生成;外部团队仍无法复现内部数据和工具链。
- OpenAI Harness Engineering报告一个内部产品仓库由智能体生成约百万行代码,团队工作转向设计环境、结构测试、可观测性和架构约束。它是有真实用户的工程报告,但不是控制实验,也尚未回答多年维护和架构演化。
- NVIDIA CompileIQ把进化与遗传搜索用于按工作负载调编译器选项,表明工业接受链偏好受限、可重现的搜索空间。它没有使用大语言模型,因此也是“经典搜索仍有竞争力”的产业对照。
- 数据库、网络和操作系统方向尚没有同等级公开生产闭环。学术原型多停在沙箱或轨迹重放,缺少变更事务、最小权限、金丝雀、责任边界和长期事故数据。
候选空白
- 系统级二级终检。 该空白来自独立终检不足;尚缺按时间、硬件、故障与输入语义分层的搜索不可见门,并报告内环通过后在终检失败的条件概率。
- 搜索预算与验证预算联合调度。 Harness Engineering 已显示固定三次检查会漏掉数值错误;现有系统很少按候选风险、修改范围和历史失败自适应分配测试深度。
- 经验的类型、版本和撤销。 当前记忆多是自然语言技能或知识库;尚缺统一表示来源硬件、软件版本、工作负载、置信度、反例和失效条件。
- 跨层制品的组合晋升。 内核、编译器、运行时、数据库配置和系统代码分别优化,尚少有合同同时检查局部性能、端到端 SLO、故障恢复、资源预算和维护复杂度。
- 带副作用动作的事务接口。 配置与调度动作需要准备、提交、中止、补偿和幂等重试;现有工具接口多只定义“能调用什么”,不定义部分失败后的状态。
- 目标不确定时的拒绝和升级。 尚缺统一机制决定证据不足时继续探测、请求人类、执行保守回退还是拒绝动作,并量化错误升级与错误自治的代价。
- 总成本与收益的统一账本。 最终加速、模型费用和开发时间常分开报告,缺少能比较候选数、硬件小时、人工指导、验证、部署与维护的盈亏平衡模型。
关键未知与测量
- 不同验证器到底能拦住什么错误? 在同一批系统变异上依次运行语法检查、单元测试、模糊测试、模型复核、形式验证和金丝雀;测每层独立召回、增量召回、误报和成本。
- 经验何时从正迁移变为负迁移? 对同一任务跨硬件代际、编译器版本和负载重放,构造迁移收益矩阵;测负优化概率、撤销时间与节省试验数。
- 智能体搜索是否优于经典搜索? 固定候选执行次数、硬件时间和先验知识,对比贝叶斯优化、进化算法、自动调优器、单模型迭代与多智能体;同时报告最佳值、达标时间和隐藏失败率。
- 脚手架价值会随模型增强而缩小吗? 在至少三代模型上逐步移除知识、专用工具、检查器和人类方向;测成功率、成本和回归缺陷,而非只比较最终分数。
- 微基准加速传到端到端的概率是多少? 将同一候选依次放入算子、计算图、单请求、并发服务和生产轨迹重放;测各层收益相关系数与“局部更快、系统不变或更慢”的比例。
- 系统变更如何安全恢复? 对调度策略、网络配置、数据库物理设计和生成代码注入进程崩溃、网络分区、验证器误判与部分提交;测恢复时间、重复副作用和状态泄漏。
- 开放式目标推断有多可靠? 构造多目标冲突、缺失指标和错误遥测的工作负载,让智能体输出目标、置信度和下一动作;以专家可接受集合评估,而非强迫唯一答案。
- 何时经济上值得运行智能体搜索? 统计模型词元、硬件小时、人工时间、验证和维护成本,再结合实际调用分布计算盈亏平衡点;若回收期超过制品寿命,峰值加速没有生产价值。
覆盖缺口
- 计算内核路线最密集,网络、存储、数据库和操作系统的公开生产证据较少;不能把内核上的强评估器结论直接外推到有副作用控制。
- OpenAI、Meta、Google DeepMind 和 NVIDIA 的资料属于发布方工程报告或产品文档,能说明产业方向,不能替代独立复现与失败数据。
- 缺少跨论文统一的搜索成本清单;即使全文可读,也无法可靠还原许多系统的总候选数、人工提示与硬件时间。
- 长期维护证据不足:没有核心论文比较数月后的架构漂移、知识失效、验证器老化和回滚频率。
- 本次未启用
--ingest-missing,外部工作只以 Markdown 链接保留,不新建 paper、concept 或 entity 页。
附录:逐篇证据卡
规格驱动生成
SysSpec-FAST26
- 路线与角色:规格驱动生成;半形式规格转折。
- 证据等级:needs-review/full-text。
- 做了什么:用功能、模块和并发规格驱动多智能体生成并演化用户态文件系统。
- 没做什么:不生成可部署内核文件系统,也没有崩溃一致性证明。
- 关键观察:Ext4 的 82.4% 提交用于修复或维护,且多数改动局部。
- 隐含假设:规格比 C 实现更易审查,局部依赖—保证推理足以组合模块。
- 可攻击点 / 脆弱点:约 4300 行用户态原型无法代表大型内核文件系统,规格错误会被生成链放大。
VibeTensor-arXiv26
- 路线与角色:规格驱动生成;大型系统边界证据。
- 证据等级:complete/full-text。
- 做了什么:让编程智能体生成由 C++、CUDA、自动微分和前端组成的深度学习运行时。
- 没做什么:未证明生产性能、长期维护、完整自治程度或总成本。
- 关键观察:局部测试通过的组件仍会组合成全局低效的“拼装效应”。
- 隐含假设:仓库结构、构建与差分测试能为智能体提供足够系统边界。
- 可攻击点 / 脆弱点:端到端训练比 PyTorch 慢 1.7–6.2 倍,人工指导与失败轨迹不透明。
TritorX-MLSys26
- 路线与角色:规格驱动生成;专有硬件算子扩展。
- 证据等级:complete/full-text。
- 做了什么:从算子文档生成 MTIA Triton 封装,并以静态格式检查和 PyTorch OpInfo 闭环修正。
- 没做什么:不优化内核性能,也不覆盖任意自定义算子和所有形状边界。
- 关键观察:文档、示例和执行脚手架能弥补专有硬件训练语料不足。
- 隐含假设:抽样 OpInfo 足以代表算子语义和数值边界。
- 可攻击点 / 脆弱点:481 个算子通过不等于未测形状、精度和并发行为正确。
VeriMoA-MLSys26
- 路线与角色:规格驱动生成;硬件描述扩展。
- 证据等级:complete/full-text。
- 做了什么:用多路径智能体和全局质量缓存从规格生成 Verilog。
- 没做什么:不覆盖完整芯片、时序收敛、功耗性能面积和流片验证。
- 关键观察:模型更熟悉 Python/C++,可借中间路径扩大 Verilog 候选空间。
- 隐含假设:仿真测试和公开寄存器传输级基准足以筛出正确硬件。
- 可攻击点 / 脆弱点:同源模型互评会传播共同错误,单次通过率不代表物理实现可用。
NeuroSymbolicProof-OSDI26
- 路线与角色:规格驱动生成;机器证明转折。
- 证据等级:needs-review/full-text。
- 做了什么:让模型提出 seL4 Isabelle 证明步骤,由证明器、QuickCheck 和等价检查执行与修复。
- 没做什么:不生成规格、系统实现、不变量或程序到模型的对应关系。
- 关键观察:证明状态和内核反馈提供比文本自评更强的稠密信号。
- 隐含假设:历史证明轨迹能迁移到未完成目标,局部概率能预测长期可完成性。
- 可攻击点 / 脆弱点:长证明成功率显著下降,论文的分母和时间统计存在不可闭合之处。
AutoMan-SOSP25
- 路线与角色:规格驱动生成;非大语言模型强对照。
- 证据等级:complete/full-text。
- 做了什么:从 Dafny/TLA 规格生成经精化证明的实现,并允许手工优化热点。
- 没做什么:不使用大语言模型或开放式搜索,可翻译规格片段有限。
- 关键观察:控制面可自动生成,少数数据面热点可手工精化并留在同一证明树。
- 隐含假设:形式规格成本可接受,Dafny/SMT 能消解大部分证明义务。
- 可攻击点 / 脆弱点:复杂活性、故障模型和未验证胶水代码仍需专家处理。
编译器协同变换
ACCLAIM-arXiv26
- 路线与角色:编译器协同变换;跨层转折。
- 证据等级:complete/full-text。
- 做了什么:在 C、LLVM 中间表示和 x86 三层编排模型改写与编译器变换阶段。
- 没做什么:不覆盖并发、外部状态和大型系统代码。
- 关键观察:模型擅长高层语义,编译器擅长低层可靠变换,单层搜索会错过机会。
- 隐含假设:每轮 15 个生成输入足以发现语义错误。
- 可攻击点 / 脆弱点:100 个机会富集小程序中收益集中于长尾,测试不是等价证明。
CAKE-arXiv26
- 路线与角色:编译器协同变换;可演化中间表示转折。
- 证据等级:complete/full-text。
- 做了什么:让编译器与智能体共同演化带类型、硬件显式的调度中间表示。
- 没做什么:未证明固定中间表示跨硬件泛化,也未覆盖完整系统。
- 关键观察:结构化诊断和类型约束比直接生成 CUDA 或 PTX 更节省搜索。
- 隐含假设:中间表示覆盖目标调度且不吞掉关键优化意图。
- 可攻击点 / 脆弱点:编译器随任务扩展后,收益可能来自累积人工规则而非抽象本身。
可执行性能搜索
AlphaEvolve-arXiv25
- 路线与角色:可执行性能搜索;通用范式奠基。
- 证据等级:complete/full-text。
- 做了什么:以双模型、岛式种群和可执行评估器演化整文件程序,并用于 Borg 与计算内核。
- 没做什么:不自动构造可靠评估器,也不统一披露搜索成本和负结果。
- 关键观察:精确或可数值评估的问题能把模型变成大规模变异算子。
- 隐含假设:人类给定的搜索空间和评分函数代表真实目标。
- 可攻击点 / 脆弱点:生产结果强,但人工选择、失败分母和验证集自适应程度不透明。
KernelEvolve-ISCA26
- 路线与角色:可执行性能搜索;生产异构扩展。
- 证据等级:complete/full-text。
- 做了什么:在 NVIDIA、AMD 和 MTIA 上用知识库、性能剖析和图搜索生成生产内核。
- 没做什么:未给统一搜索成本、误晋升率和同预算组件消融。
- 关键观察:缺失算子会迫使 CPU 回退或服务分离,内核覆盖率是系统架构问题。
- 隐含假设:参考测试与形状分派能保护生产正确性。
- 可攻击点 / 脆弱点:“100% 正确”只覆盖列出的任务和配置,内部编译器与数据难复现。
AccelOpt-MLSys26
- 路线与角色:可执行性能搜索;优化记忆扩展。
- 证据等级:complete/full-text。
- 做了什么:在 Trainium NKI 上以束搜索和从快慢候选提炼的记忆持续改进内核。
- 没做什么:不覆盖通信算子、多芯片和动态形状。
- 关键观察:新硬件缺少成熟启发式,单次模型调用也没有平台先验。
- 隐含假设:14 个内核和屋顶线峰值足以代表目标平台价值。
- 可攻击点 / 脆弱点:自建基准和不均匀手工基线会放大收益,记忆可能过拟合硬件代际。
PIKE-MLSys26
- 路线与角色:可执行性能搜索;搜索组织评测。
- 证据等级:complete/full-text。
- 做了什么:比较多智能体内核搜索中的探索、利用、错误修复与改动粒度。
- 没做什么:不进入真实推理服务,也不处理长期知识和动态形状。
- 关键观察:固定预算下,沿当前好候选做粗粒度利用优于广泛探索。
- 隐含假设:KernelBench 局部性能面存在可追踪梯度。
- 可攻击点 / 脆弱点:H100 微基准加速未证明会传到端到端服务。
AdaExplore-arXiv26
- 路线与角色:可执行性能搜索;失败技能转折。
- 证据等级:complete/full-text。
- 做了什么:从合成失败提炼跨任务 Triton 技能,并用树搜索保持候选结构多样性。
- 没做什么:不定义技能版本、冲突、撤销和跨硬件有效性。
- 关键观察:失败模式高度重复,可压缩成少量可迁移规则。
- 隐含假设:合成任务错误分布覆盖新任务,技能不会造成负迁移。
- 可攻击点 / 脆弱点:主要相对 PyTorch eager,跨硬件和跨语言迁移可能反转收益。
AVO-arXiv26
- 路线与角色:可执行性能搜索;长程持续搜索转折。
- 证据等级:complete/full-text。
- 做了什么:让智能体读取谱系、查资料、修改并测试,在七天内持续演化 B200 注意力内核。
- 没做什么:未给多次独立运行、同预算经典基线和完整模型配置。
- 关键观察:专家级优化需要数百次环境交互与持久候选谱系。
- 隐含假设:单条最佳谱系能代表方法能力,长期评测没有被过拟合。
- 可攻击点 / 脆弱点:40 个提交来自 500 多方向,强最终结果无法分解监督、预算和模型贡献。
HarnessEngineering-arXiv26
- 路线与角色:可执行性能搜索;人机协作反例与晋升转折。
- 证据等级:complete/full-text。
- 做了什么:以技能、参考、性能剖析、全量形状扫描和晋升门约束 B200 内核智能体。
- 没做什么:不声称无人自治,也不提供长期生产回归证据。
- 关键观察:人类给方向的版本在五项中均优于全智能体版本,三次随机检查仍会漏数值错误。
- 隐含假设:低试次内环能在搜索速度与正确性间取得可控平衡。
- 可攻击点 / 脆弱点:DSA top-k 在 200 次扩展测试中出现三次漏检,固定验证深度不可靠。
LLaMEA-KernelTuner-MLSys26
- 路线与角色:可执行性能搜索;元优化扩展。
- 证据等级:complete/full-text。
- 做了什么:让大语言模型进化生成自动调参算法,而非直接生成每个内核实现。
- 没做什么:不生成内核,也不覆盖动态生产流量和隐藏硬件。
- 关键观察:搜索策略本身可由应用描述和调参空间自动设计。
- 隐含假设:四个内核乘六种 GPU 足以代表调参器泛化。
- 可攻击点 / 脆弱点:最佳生成算法可能对固定问题集过拟合,搜索成本缺少统一分母。
GEPA-ICLR26
- 路线与角色:可执行性能搜索;通用反馈接口扩展。
- 证据等级:complete/full-text。
- 做了什么:用执行轨迹和语言诊断反思演化提示与复合程序。
- 没做什么:不专门解决系统任务,也不保证任意诊断反馈可信。
- 关键观察:可读诊断像近似梯度,能比单一标量奖励更高效。
- 隐含假设:固定模型已有反思能力,验证集不会被持续选择过拟合。
- 可攻击点 / 脆弱点:系统任务若只有噪声性能分数,语言反馈可能只是自洽解释。
系统配置与诊断
SchedCP-arXiv25
- 路线与角色:系统配置与诊断;操作系统控制面转折。
- 证据等级:complete/full-text。
- 做了什么:通过模型上下文协议暴露工作负载分析、策略库和分层验证,让智能体生成或选择
sched_ext策略。 - 没做什么:不覆盖实时、多租户、跨节点调度和长期漂移。
- 关键观察:目标推断与策略合成应分离,模型应位于控制面而非热路径。
- 隐含假设:短期观测能恢复真实目标,金丝雀能暴露危险策略。
- 可攻击点 / 脆弱点:少量任务与重复不足以估计安全漏检,错误目标和回滚缺实验。
INTA-arXiv25
- 路线与角色:系统配置与诊断;意图中间表示扩展。
- 证据等级:complete/full-text。
- 做了什么:以配置意图为中间表示,结合手册检索、增量翻译、语法树检查和模型语义报告。
- 没做什么:不证明多设备网络行为等价,也不自动部署配置。
- 关键观察:跨厂商命令需要先恢复意图,确定性视图检查能修复大量错误。
- 隐含假设:手册完整,单设备局部意图可以组合。
- 可攻击点 / 脆弱点:命令匹配 84.72% 仍有遗漏,12 份人工报告不足以估计危险漏检。
D-Bot-PVLDB24
- 路线与角色:系统配置与诊断;工具辅助诊断奠基。
- 证据等级:complete/full-text。
- 做了什么:从文档抽取诊断知识,匹配工具,再用树搜索和异步专家定位数据库根因。
- 没做什么:不执行修复,也不覆盖跨服务和开放根因事故。
- 关键观察:链式推理会过早停止,外部知识和工具证据比模型记忆关键。
- 隐含假设:十类注入根因和 PostgreSQL 视图代表真实事故。
- 可攻击点 / 脆弱点:多根因人工评估准确率 66.9%,低于人类 80.6%,封闭集合有利于系统。
StorageXTuner-arXiv25
- 路线与角色:系统配置与诊断;经验持久化转折。
- 证据等级:complete/full-text。
- 做了什么:用四智能体和可升降置信度的经验记忆调优 RocksDB、CacheLib 与 InnoDB。
- 没做什么:不调索引、查询或复制,也不做在线无扰切换。
- 关键观察:少数经验支配搜索,新配置提案是主要错误源。
- 隐含假设:自然语言经验能隐式携带适用域并跨环境迁移。
- 可攻击点 / 脆弱点:单机固定资源和相对默认配置的巨大收益不能证明跨版本记忆可靠。
IDSTune-arXiv26
- 路线与角色:系统配置与诊断;多组件协调转折。
- 证据等级:complete/full-text。
- 做了什么:让旋钮、索引和物化视图专家并行推荐,再由监督智能体消解冲突并经双层安全门发布。
- 没做什么:不提供配置事务、复制一致性和零停机上线。
- 关键观察:独立局部最优会互相伤害,筛选动态特征优于全量上下文。
- 隐含假设:自然语言协商能发现主要交互,规则加模型能拦住危险组合。
- 可攻击点 / 脆弱点:一周漂移仍是受控重放,成本未计重放、物化与维护。
评测与晋升基础设施
FlashInfer-Bench-MLSys26
- 路线与角色:评测与晋升基础设施;生产形状转折。
- 证据等级:complete/full-text。
- 做了什么:以生产形状、隔离计时、正确性检查和
apply()接口连接内核生成与服务集成。 - 没做什么:不提出新搜索智能体,也不覆盖多 GPU 通信和长运行维护。
- 关键观察:人工智能内核的瓶颈常在评测与集成断层,而非只在生成能力。
- 隐含假设:三类模型、ShareGPT 轨迹和 FlashInfer 基线代表部署。
- 可攻击点 / 脆弱点:单一 B200 时代和有限引擎,版本偏移与恶意内核回滚未展开。
SOL-ExecBench-arXiv26
- 路线与角色:评测与晋升基础设施;硬件上界与反投机转折。
- 证据等级:complete/full-text。
- 做了什么:以硬件理论上限和防投机检查评测 235 个 B200 内核任务。
- 没做什么:不生成候选,也不测完整服务、多 GPU 或跨硬件泛化。
- 关键观察:相对软件基线的加速与剩余硬件空间相关性仅 0.10,14.5% 提交存在投机。
- 隐含假设:解析硬件上界足够准确,安全规则覆盖主要攻击。
- 可攻击点 / 脆弱点:不可达上界和内部评分基线会误导搜索,新型投机仍可能绕过检查。
面向智能体的软件接口
PithTrain-arXiv26
- 路线与角色:面向智能体的软件接口;框架反向设计转折。
- 证据等级:complete/full-text。
- 做了什么:以紧凑 Python 混合专家训练栈、显式调用和任务技能降低编程智能体操作成本。
- 没做什么:不让智能体自动发现系统优化,也不测长程故障恢复和跨模型传播。
- 关键观察:隐式注册、跨语言路径和动态调用会增加智能体探索与调试成本。
- 隐含假设:固定一个强智能体和短任务能隔离框架结构的影响。
- 可攻击点 / 脆弱点:最多减少 70% 轮数,但只覆盖单智能体、三次重复和有限训练步骤。
SysGPT-OSDI25
- 路线与角色:面向智能体的软件接口;顾问边界对照。
- 证据等级:complete/full-text。
- 做了什么:从十年系统优化论文归纳八类串行优化方法,并微调建议模型。
- 没做什么:不自动生成、执行或验证补丁,也没有端到端加速证据。
- 关键观察:大量系统论文的串行优化叙事可以归纳为重复模式。
- 隐含假设:历史论文标签与模型评审能代表真实优化帮助。
- 可攻击点 / 脆弱点:归纳框架可能遗漏新硬件模式,建议仍需性能剖析和执行验证。
外部证据卡
OpenAI 的脚手架工程:Harness Engineering
- 路线与角色:面向智能体的软件接口;产业实现。
- 证据等级:发布方工程报告。
- 做了什么:以结构测试、仓库内知识、隔离工作树和可观测性支持智能体生成并维护内部产品。
- 没做什么:没有与人类开发或不同脚手架做受控实验,也没有多年维护证据。
- 关键观察:代码吞吐提高后,稀缺资源转为人类注意力、环境设计和架构约束。
- 隐含假设:严格、机器可检查的仓库结构能抑制架构漂移。
- 可攻击点 / 脆弱点:约十分之一开发时间是团队估算,真实缺陷率和长期熵尚未知。
Meta 的内核优化工程报告:KernelEvolve
- 路线与角色:可执行性能搜索;产业实现补充。
- 证据等级:发布方工程报告,与内部全文论文交叉。
- 做了什么:描述 KernelEvolve 如何接入 Ranking Engineer Agent 和生产异构加速器流程。
- 没做什么:不公开内部编译器、生产数据、失败候选和完整成本。
- 关键观察:模型数量乘硬件代际使内核覆盖成为持续生产需求。
- 隐含假设:内部知识库、测试和形状能持续代表线上调用。
- 可攻击点 / 脆弱点:外部团队无法区分系统方法、内部工具和专家维护的贡献。
NVIDIA 的编译器调优产品:CompileIQ
- 路线与角色:可执行性能搜索;非大语言模型产业对照。
- 证据等级:官方产品文档。
- 做了什么:用进化与遗传算法为特定工作负载搜索 CUDA 编译器配置,并支持 CUDA C++、Triton 和 Helion。
- 没做什么:不依赖大语言模型,也不生成开放式系统代码。
- 关键观察:生产编译调优可被约束为选项空间中的可重现搜索。
- 隐含假设:编译器选项足以覆盖重要优化机会,工作负载稳定。
- 可攻击点 / 脆弱点:需要在同预算下与智能体搜索比较,才能判断语言推理是否提供额外价值。
Google DeepMind 的部署影响报告:AlphaEvolve
- 路线与角色:可执行性能搜索;产业影响补充。
- 证据等级:发布方工程报告,与内部全文论文交叉。
- 做了什么:汇总 AlphaEvolve 在 Google 基础设施、算法和科学问题中的后续应用。
- 没做什么:没有统一披露每个案例的候选总数、硬件成本、人工选择和失败结果。
- 关键观察:同一“模型提议、执行器评分”的闭环可以在评估器清晰的多个领域持续复用。
- 隐含假设:各领域评估器的分数与真实长期价值一致,内部部署观察可代表稳定收益。
- 可攻击点 / 脆弱点:发布方只展示成功案例时,无法估计负优化概率、回滚率和搜索机会成本。