OSDI 2026
OSDI 2026 的 136 篇论文围绕一个共同问题展开:当硬件、工作负载和部署规模继续异构化,系统如何把原本隐含的资源、状态与正确性边界变成可测量、可调度、可恢复的对象。
概览
本届论文的主线不是单一硬件热点,而是“把跨层代价显式化”。kSTEP 控制内核事件与拓扑以重现调度器缺陷;Blink 直接在函数边界读取 PMU,修正短函数采样失真的诊断;Xkernel 则把内核性能常量变成运行时可调整的机器状态。三者分别处理可复现性、观测精度和调优闭环,说明性能工程正在从“采样后猜测”转向“控制实验条件后测量”。
另一条主线是数据移动。OBASE 将冷热对象而非整页作为迁移单位,VTC 消除只改变布局的中间张量搬运,DirectKV 直接让 GPU 读取 pinned CPU memory,ECHO 则围绕稀疏注意力的 KV cache 做无损预取。它们的收益都依赖更细的布局或访问语义,但适用边界不同:OBASE 受指针结构限制,DirectKV 依赖 GH200,ECHO 的预取本身只贡献最高 4% 的端到端收益。
AI 系统论文普遍把阶段不均衡和资源异构当作一等问题。EcoServe 在商用 GPU 集群中折中 prefill/decode 解耦,DynaRL 按动态超图迁移 RL worker,WEAVE 用另一作业的活跃阶段填补 RL 后训练空闲,Tessera 则在 4,096–12,288 GPU 的 MoE 训练中动态填充流水线气泡。共同证据是固定资源切分会浪费计算,但在线适应的迁移、同步和 SLO 成本必须单独测量。
系统边界也在向运维和正确性扩展。Chen-DataPipelines 使用 30,000 个生产训练 trace 定位数据管线停顿,PIMS 将维护、故障域和容量缓冲放进统一契约,AEGIS 从 3.5×10^7 GPU-hours 中检测 SDC,SDCHUNTER 用确定性训练回放定位生产 GPU 缺陷。相比只报告单机吞吐,这些工作把“能否长期运行”作为系统结果的一部分。
论文分类
计算、编译与 AI 执行(37 篇)
包括 ROLLART、MPK、GraCE、VTC、Tessera、Kairox、Cocoon、HetuV2、TileLoom、ADAngel、ECHO、DirectKV、Syncopate、SANI、Twill、qTPU、DrsNAS、Wang-MoEInference、Kareus、WEAVE、Strata、SERENO、BatchGen、Nixie、Rakaia、RLinf、Prism、Soul、LMETRIC、POEGA、FlowANN 等论文。它们分别从编译、调度、缓存、通信和能耗切入,不能用单一吞吐数字横向排序。
内存、存储与数据路径(31 篇)
DeLFS、DINGO、OBASE、WiseCode、CoPilotIO、Espresso、umap、Megalon、Oxbow、MAC、LiteSwitch、Merlin、Li-ClusterHeterogeneity、Duhu、MDK、TimelockDrive、DPA-Store、Sepia、Conflux、Pluto、S4-FIFO、INFINIDEFRAG、MoonBright、Blowfish、RamRyder 等工作共同关注容量、带宽、缓存命中和维护 I/O 的耦合。
操作系统、网络与虚拟化(30 篇)
PeeR、μShell、Spice、Hwang-PipelineParallelism、Janus、SPADE、DGC、Mohabi、QuotaMarketplace、NestedSEV、Jetpack、mwait-sched、MUSCHED、iLand、M3U、FORGE、UCCL-Tran 等论文将调度、隔离、迁移和网络路径作为系统设计对象。
安全、正确性、测试与运维(38 篇)
SMARTTalk、Aletheia、Ambulance、CoreSec、Acumen、Spain、gigiprofiler、NeuroSymbolicProofSearch、HighFidelityModels、kSTEP、MIMESYS、ValScope、ECO、Ote、DiTing、Mohabi、vBPF、Ote、Pompe-SRO、SDCHUNTER、OpGuard 等工作把验证、诊断、隐私和生产反馈纳入系统边界。
研究趋势
- 把隐含资源变成显式状态。 DeLFS 将全局日志资源拆到核,SBB 将 timer/NIC 通知按核分配,vBPF 将 eBPF 事件归属到资源命名空间。它们都以减少中心化共享为代价换取扩展性;需要继续测量跨核负载不均衡和状态维护成本。
- 把慢路径移出关键路径。 CoPilotIO 让 CPU 轮询完成队列,umap 把 DFS 映射和缓存控制放在用户态,libDSE 允许持久化前继续传递消息。三者的共同限制是慢路径并未消失,只是转移到 CPU、恢复或一致性边界。
- 在线适应取代静态切分,但适应本身成为新成本。 DynaRL、RLinf 和 WEAVE 把资源随阶段变化重新分配;Prism 和 EcoServe 在推理服务中处理模型与请求变化。比较这些路线必须统一迁移时间、SLO 违约和资源碎片指标。
- 生产证据成为设计的一部分。 Li-ClusterHeterogeneity、Chen-DataPipelines、PIMS 和 DiTing 使用长期 trace 或生产部署,但生产规模不自动保证因果归因,仍需对照组和回滚数据。
设计空间矩阵
| 论文 | 工作负载 | 主要瓶颈 | 核心机制 | 资源/平台 | SLO 或正确性边界 | 证据规模 |
|---|---|---|---|---|---|---|
| DeLFS | manycore 随机写 | 全局锁与日志元数据 | 按核拆分资源与锁 | 128 核、NVMe | 文件系统一致性 | 单机基准 |
| DINGO | HDD 维护任务 | 寻道与带宽 | 声明候选集合、期限与缓存 | HDFS、HDD trace | 维护期限 | 六家服务商 trace |
| OBASE | YCSB 对象数据结构 | 冷热对象混页 | 对象级迁移 | DRAM 与分页后端 | C++ 指针限制 | YCSB |
| kSTEP | Linux 调度器缺陷 | 状态与事件不可控 | 隔离 CPU、重置调度状态 | Linux、隔离 CPU | 缺陷可重现 | 7 个真实、4 个新缺陷 |
| PeeR | eBPF Redis/Memcached/TPC-C | 不可抢占软中断 | continuation 与预算检查 | CPU、sched_ext | P99 延迟 | 247 ns 恢复开销 |
| Chen-DataPipelines | 大模型生产训练 | checkpoint、启动和 CPU 变换 | 预测复制与存储侧变换 | 30,000 条 trace | 训练停顿 | 生产 trace |
| EcoServe | LLM prefill/decode | KV cache 传输与阶段干扰 | PaDG 与滚动激活 | L20、PCIe、10 Gbps | goodput/SLO | 集群实验 |
| ROLLART | agentic RL | 异构阶段与同步 | 分离资源池、异步轨迹 | Qwen3、多 GPU | time-to-score | 8B–32B 模型 |
| VTC | DNN 推理 | 中间张量搬运 | 虚拟张量索引映射 | A100/H100 | 推理正确性 | 模型基准 |
| DynaRL | agentic RL | rollout 长尾 | 动态超图与迁移 worker | GPU 集群 | 在线调度开销 <1% | 数学/agentic RL |
| Strata | 长上下文 LLM | KV cache I/O | GPU-assisted I/O 与缓存调度 | GPU/CPU/SSD | 短上下文性能 | LooGLE 等负载 |
| SDCHUNTER | 生产 LLM 训练 | SDC 不确定性 | 确定性训练回放 | GPU 集群 | 恢复阻塞 <1 小时 | 40 起事件 |
共同观察
- 共享状态会在规模上变成主瓶颈。 DeLFS、SBB 和 Xkernel 分别从文件系统、网络运行时和内核调优验证了中心化状态的扩展代价;但拆分状态会引入复制、迁移或一致性维护。
- 数据移动收益依赖访问语义,而非单纯增加带宽。 OBASE、VTC 和 ECHO 都利用访问或布局结构减少搬运;非仿射访问、动态图变化和预取误判会削弱收益。
- 生产 workload 的长尾会改变最优资源配置。 Chen-DataPipelines、DynaRL、Li-ClusterHeterogeneity 和 WEAVE 都显示平均利用率不足以解释停顿或浪费,阶段、拓扑和故障状态必须进入调度。
互相冲突的假设
- Tessera 在超大规模训练中依赖 profiling 与运行时动态填充,而 TileLoom 依赖可静态描述的拓扑、仿射访问和 buffer 生命周期。需要在动态路由和共享设备干扰下测量两者的模型误差与调度开销。
- EcoServe 通过跨实例滚动激活折中阶段隔离,Hwang-PipelineParallelism 则在单服务流水线中用在线预测减少气泡。前者的关键限制是 KV 传输,后者的关键限制是阶段失衡;统一比较应固定网络带宽并报告 P99 TTFT、TPOT 和 goodput。
- TimelockDrive 把安全边界下沉到物理块检查器,USEC 把策略边界交给部署者声明的资源。前者牺牲恢复便利性,后者牺牲完整声明时的安全覆盖;需要故障恢复和遗漏资源的端到端测试。
值得关注的方向
- 动态资源模型的可迁移校准:结合 Li-ClusterHeterogeneity、PowerSight 和 DVLA 的生产观察,用小规模 trace 重建跨硬件的容量、带宽和功率模型,验证模型漂移下的调度稳定性。
- 面向尾延迟的跨层数据移动预算:把 LiteSwitch、DirectKV、Strata 的 CPU、CXL、NVLink 和 SSD 路径放入同一 microbenchmark,测量带宽、并发度和恢复成本的边界。
- 可审计的动态系统调度:组合 kSTEP 的可重现事件控制、DiTing 的分布式观测和 OpGuard 的差异定位,构造能回放一次 SLO 违约的最小 trace,并验证调度决策是否可解释。
论文索引补充
- paper-osdi26-chai
- paper-osdi26-chaudhry
- paper-osdi26-chen-zhenqian
- paper-osdi26-haque
- paper-osdi26-heer
- paper-osdi26-hu-guanzhou
- paper-osdi26-hu-yuehao
- paper-osdi26-huang-jiacheng
- paper-osdi26-huang-wenxuan
- paper-osdi26-huang-yuchen
- paper-osdi26-lamprou
- paper-osdi26-lao
- paper-osdi26-li-shihang
- paper-osdi26-li-zecheng
- paper-osdi26-li-zekai
- paper-osdi26-liargkovas
- paper-osdi26-liu-yicheng
- paper-osdi26-manakkal
- paper-osdi26-mao-ziming-uep
- paper-osdi26-mao-ziming-writeguards
- paper-osdi26-ni
- paper-osdi26-pardeshi
- paper-osdi26-qin
- paper-osdi26-srivatsan
- paper-osdi26-teguia
- paper-osdi26-wang-jiawei
- paper-osdi26-wu-haonan
- paper-osdi26-xie-yizheng
- paper-osdi26-yao
- paper-osdi26-yin
- paper-osdi26-zhang-xuankai
- paper-osdi26-zhong