OSDI 2026

OSDI 2026 的 136 篇论文围绕一个共同问题展开:当硬件、工作负载和部署规模继续异构化,系统如何把原本隐含的资源、状态与正确性边界变成可测量、可调度、可恢复的对象。

概览

本届论文的主线不是单一硬件热点,而是“把跨层代价显式化”。kSTEP 控制内核事件与拓扑以重现调度器缺陷;Blink 直接在函数边界读取 PMU,修正短函数采样失真的诊断;Xkernel 则把内核性能常量变成运行时可调整的机器状态。三者分别处理可复现性、观测精度和调优闭环,说明性能工程正在从“采样后猜测”转向“控制实验条件后测量”。

另一条主线是数据移动。OBASE 将冷热对象而非整页作为迁移单位,VTC 消除只改变布局的中间张量搬运,DirectKV 直接让 GPU 读取 pinned CPU memory,ECHO 则围绕稀疏注意力的 KV cache 做无损预取。它们的收益都依赖更细的布局或访问语义,但适用边界不同:OBASE 受指针结构限制,DirectKV 依赖 GH200,ECHO 的预取本身只贡献最高 4% 的端到端收益。

AI 系统论文普遍把阶段不均衡和资源异构当作一等问题。EcoServe 在商用 GPU 集群中折中 prefill/decode 解耦,DynaRL 按动态超图迁移 RL worker,WEAVE 用另一作业的活跃阶段填补 RL 后训练空闲,Tessera 则在 4,096–12,288 GPU 的 MoE 训练中动态填充流水线气泡。共同证据是固定资源切分会浪费计算,但在线适应的迁移、同步和 SLO 成本必须单独测量。

系统边界也在向运维和正确性扩展。Chen-DataPipelines 使用 30,000 个生产训练 trace 定位数据管线停顿,PIMS 将维护、故障域和容量缓冲放进统一契约,AEGIS 从 3.5×10^7 GPU-hours 中检测 SDC,SDCHUNTER 用确定性训练回放定位生产 GPU 缺陷。相比只报告单机吞吐,这些工作把“能否长期运行”作为系统结果的一部分。

论文分类

计算、编译与 AI 执行(37 篇)

包括 ROLLARTMPKGraCEVTCTesseraKairoxCocoonHetuV2TileLoomADAngelECHODirectKVSyncopateSANITwillqTPUDrsNASWang-MoEInferenceKareusWEAVEStrataSERENOBatchGenNixieRakaiaRLinfPrismSoulLMETRICPOEGAFlowANN 等论文。它们分别从编译、调度、缓存、通信和能耗切入,不能用单一吞吐数字横向排序。

内存、存储与数据路径(31 篇)

DeLFSDINGOOBASEWiseCodeCoPilotIOEspressoumapMegalonOxbowMACLiteSwitchMerlinLi-ClusterHeterogeneityDuhuMDKTimelockDriveDPA-StoreSepiaConfluxPlutoS4-FIFOINFINIDEFRAGMoonBrightBlowfishRamRyder 等工作共同关注容量、带宽、缓存命中和维护 I/O 的耦合。

操作系统、网络与虚拟化(30 篇)

PeeRμShellSpiceHwang-PipelineParallelismJanusSPADEDGCMohabiQuotaMarketplaceNestedSEVJetpackmwait-schedMUSCHEDiLandM3UFORGEUCCL-Tran 等论文将调度、隔离、迁移和网络路径作为系统设计对象。

安全、正确性、测试与运维(38 篇)

SMARTTalkAletheiaAmbulanceCoreSecAcumenSpaingigiprofilerNeuroSymbolicProofSearchHighFidelityModelskSTEPMIMESYSValScopeECOOteDiTingMohabivBPFOtePompe-SROSDCHUNTEROpGuard 等工作把验证、诊断、隐私和生产反馈纳入系统边界。

研究趋势

  1. 把隐含资源变成显式状态。 DeLFS 将全局日志资源拆到核,SBB 将 timer/NIC 通知按核分配,vBPF 将 eBPF 事件归属到资源命名空间。它们都以减少中心化共享为代价换取扩展性;需要继续测量跨核负载不均衡和状态维护成本。
  2. 把慢路径移出关键路径。 CoPilotIO 让 CPU 轮询完成队列,umap 把 DFS 映射和缓存控制放在用户态,libDSE 允许持久化前继续传递消息。三者的共同限制是慢路径并未消失,只是转移到 CPU、恢复或一致性边界。
  3. 在线适应取代静态切分,但适应本身成为新成本。 DynaRLRLinfWEAVE 把资源随阶段变化重新分配;PrismEcoServe 在推理服务中处理模型与请求变化。比较这些路线必须统一迁移时间、SLO 违约和资源碎片指标。
  4. 生产证据成为设计的一部分。 Li-ClusterHeterogeneityChen-DataPipelinesPIMSDiTing 使用长期 trace 或生产部署,但生产规模不自动保证因果归因,仍需对照组和回滚数据。

设计空间矩阵

论文工作负载主要瓶颈核心机制资源/平台SLO 或正确性边界证据规模
DeLFSmanycore 随机写全局锁与日志元数据按核拆分资源与锁128 核、NVMe文件系统一致性单机基准
DINGOHDD 维护任务寻道与带宽声明候选集合、期限与缓存HDFS、HDD trace维护期限六家服务商 trace
OBASEYCSB 对象数据结构冷热对象混页对象级迁移DRAM 与分页后端C++ 指针限制YCSB
kSTEPLinux 调度器缺陷状态与事件不可控隔离 CPU、重置调度状态Linux、隔离 CPU缺陷可重现7 个真实、4 个新缺陷
PeeReBPF Redis/Memcached/TPC-C不可抢占软中断continuation 与预算检查CPU、sched_extP99 延迟247 ns 恢复开销
Chen-DataPipelines大模型生产训练checkpoint、启动和 CPU 变换预测复制与存储侧变换30,000 条 trace训练停顿生产 trace
EcoServeLLM prefill/decodeKV cache 传输与阶段干扰PaDG 与滚动激活L20、PCIe、10 Gbpsgoodput/SLO集群实验
ROLLARTagentic RL异构阶段与同步分离资源池、异步轨迹Qwen3、多 GPUtime-to-score8B–32B 模型
VTCDNN 推理中间张量搬运虚拟张量索引映射A100/H100推理正确性模型基准
DynaRLagentic RLrollout 长尾动态超图与迁移 workerGPU 集群在线调度开销 <1%数学/agentic RL
Strata长上下文 LLMKV cache I/OGPU-assisted I/O 与缓存调度GPU/CPU/SSD短上下文性能LooGLE 等负载
SDCHUNTER生产 LLM 训练SDC 不确定性确定性训练回放GPU 集群恢复阻塞 <1 小时40 起事件

共同观察

  • 共享状态会在规模上变成主瓶颈。 DeLFSSBBXkernel 分别从文件系统、网络运行时和内核调优验证了中心化状态的扩展代价;但拆分状态会引入复制、迁移或一致性维护。
  • 数据移动收益依赖访问语义,而非单纯增加带宽。 OBASEVTCECHO 都利用访问或布局结构减少搬运;非仿射访问、动态图变化和预取误判会削弱收益。
  • 生产 workload 的长尾会改变最优资源配置。 Chen-DataPipelinesDynaRLLi-ClusterHeterogeneityWEAVE 都显示平均利用率不足以解释停顿或浪费,阶段、拓扑和故障状态必须进入调度。

互相冲突的假设

  • Tessera 在超大规模训练中依赖 profiling 与运行时动态填充,而 TileLoom 依赖可静态描述的拓扑、仿射访问和 buffer 生命周期。需要在动态路由和共享设备干扰下测量两者的模型误差与调度开销。
  • EcoServe 通过跨实例滚动激活折中阶段隔离,Hwang-PipelineParallelism 则在单服务流水线中用在线预测减少气泡。前者的关键限制是 KV 传输,后者的关键限制是阶段失衡;统一比较应固定网络带宽并报告 P99 TTFT、TPOT 和 goodput。
  • TimelockDrive 把安全边界下沉到物理块检查器,USEC 把策略边界交给部署者声明的资源。前者牺牲恢复便利性,后者牺牲完整声明时的安全覆盖;需要故障恢复和遗漏资源的端到端测试。

值得关注的方向

  • 动态资源模型的可迁移校准:结合 Li-ClusterHeterogeneityPowerSightDVLA 的生产观察,用小规模 trace 重建跨硬件的容量、带宽和功率模型,验证模型漂移下的调度稳定性。
  • 面向尾延迟的跨层数据移动预算:把 LiteSwitchDirectKVStrata 的 CPU、CXL、NVLink 和 SSD 路径放入同一 microbenchmark,测量带宽、并发度和恢复成本的边界。
  • 可审计的动态系统调度:组合 kSTEP 的可重现事件控制、DiTing 的分布式观测和 OpGuard 的差异定位,构造能回放一次 SLO 违约的最小 trace,并验证调度决策是否可解释。

论文索引补充