深度调研(Probe):MoE 专家权重与 KV 缓存的联合分层管理

阅读提示

  • **混合专家模型(Mixture of Experts,MoE)**只为每个词元激活少数专家,但全部专家权重仍要存放;**键值缓存(key-value cache,KV cache)**随上下文和并发增长。两者共同争用高带宽内存(high-bandwidth memory,HBM)。
  • **预填充(prefill)**一次处理输入,适合大矩阵计算;**解码(decode)**逐词元生成,常受权重或缓存读取带宽限制。
  • 本文把“联合管理”限定为:同一控制器观察专家和 KV 的容量、访问、传输与服务等级目标(service-level objective,SLO),再决定下一单位 HBM、主存或链路预算给谁。两个独立旋钮并存不算联合管理。

一页结论

  • 33 篇内部工作形成五条路线:专家异构执行、专家预测与放置、KV 分层传输、KV 内容缩减、共享资源与执行结构。组件已丰富,统一决策仍缺失。
  • 2024 年前后的主问题是“怎样让单类对象离开 HBM”;2025–2026 年转向按阶段选择执行位置、为主存 KV 重写数据路径、以及让权重和 KV 共用物理显存。
  • 最广的缺陷是局部预算:8/8 篇专家异构执行工作没有联合 KV 策略,12/12 篇 KV 分层或缩减工作没有联合专家策略。
  • “输入输出可以被计算隐藏”与“缓存命中就值得加载”都依赖条件;专家失配与 KV 失配同时发生时会争用同一链路,两个隐藏窗口不能相加。
  • proposal 前首先需要同请求、同时间轴的专家与 KV 访问轨迹,以及 HBM 二维预算扫描;否则无法证明复杂联合控制器优于两个简单控制器。

范围与证据

本调研纳入 33 篇仓库内工作,均有完整 wiki 论文页;另纳入 3 项外部产业或最新论文线索。范围包括会改变专家或 KV 存放、访问窗口、共享容量或传输资源的系统,不包括只优化训练优化器状态、纯专家通信或纯模型精度的工作。外部线索未启用 --ingest-missing,不进入原始论文层与 wiki 层。

研究版图

研究路线核心问题代表工作当前边界
专家异构执行专家不驻留 HBM 时在哪里执行、何时搬运MOE-INFINITY-arXiv24KTransformers-SOSP25Wang-LocalMoEInference-OSDI26大多把 KV 当固定占用,依赖低并发或特定主机
专家预测与放置怎样预知热点并复制、迁移或聚合专家Libra-ICLR26CRAFT-MLSys26LayeredPrefill-MLSys26路由预测不观察同一请求的 KV 压力
KV 分层传输怎样从主存、SSD 或远端层及时取回 KVLMCache-arXiv25Strata-OSDI26DirectKV-OSDI26只管理 KV,链路常被当作可独占资源
KV 内容缩减怎样少保存或少搬 KVFlexiCache-MLSys26MoE-nD-arXiv26IceCache-arXiv26质量契约不同,不能都视作精确缓存
共享资源与执行结构怎样在更高层重分显存、批次和传输Prism-OSDI26MorphServe-MLSys26fabric-lib-MLSys26尚无词元级专家与请求级 KV 的共同代价模型

分类依据是控制器直接回答的问题。MoE-Lightning-ASPLOS25 虽同时处理专家权重和 KV,主要角色仍是部署前异构执行搜索;Prism-OSDI26 真正共享物理页,却管理模型级权重而非路由专家。缺口因此不是少一个组件,而是缺把两种访问语义映射到同一预算的闭环。

时间脉络

总体阶段

分页管理单类状态 → 利用稀疏访问做异构卸载 → 建立多层 KV 存储 → 按阶段与硬件重写数据路径 → 共享物理显存,但尚未统一专家与 KV 策略

专家异构执行

KV 分层与数据路径

  • 2023 — vLLM-SOSP23:分页让 KV 成为可分配块,但 CPU 交换仍主要是显存不足后的被动机制。
  • 2024–2025 — CacheGen-SIGCOMM24LMCache-arXiv25:KV 成为可压缩、可远端复用的持久对象,多层中间件出现。
  • 2026 — DirectKV-OSDI26Strata-OSDI26ECHO-OSDI26:主存直读、传输布局重排和最终精确召回把“数据存在”与“按时可用”分开。

共享资源

  • 2026 — DeepSeek-V4-arXiv26:模型侧同时压缩专家和长上下文 KV,改变卸载容量基线。
  • 2026 — Prism-OSDI26:权重和 KV 在同一弹性物理页池中跨模型调节,但仍没有路由专家与请求 KV 的联合失配模型。

各类工作的演化

专家异构执行

共同目标:完整权重放不进 HBM 时,只搬运或执行当前需要的专家。

演化与分歧MOE-INFINITY-arXiv24OD-MoE-arXiv25 用预测与缓存减装载;KTransformers-SOSP25CoX-MoE-DAC26ContextAwareMoE-CXLNDP-arXiv25 在 CPU 或近数据设备执行;FluxMoE-arXiv26Wang-LocalMoEInference-OSDI26 在长预填充时流式送往 GPU。MoE-Lightning-ASPLOS25 进一步联合搜索 CPU 注意力和 KV 位置,但没有在线共同仲裁。

共同边界:8/8 篇都没有让 KV 命中、上下文长度与专家失配共同决定下一次搬运。

相关工作FluxMoE-arXiv26MOE-INFINITY-arXiv24KTransformers-SOSP25MoE-Lightning-ASPLOS25Wang-LocalMoEInference-OSDI26OD-MoE-arXiv25CoX-MoE-DAC26ContextAwareMoE-CXLNDP-arXiv25

专家预测与放置

共同目标:利用路由的时间或层间局部性提前预取、复制或聚合专家。

演化与分歧LatencyOptimal-MoELB-INET4AI25 把迁移代价加入负载均衡;Libra-ICLR26 预测下一层;CRAFT-MLSys26 按层分配副本;LayeredPrefill-MLSys26 通过层分组提高复用。

共同边界:4/4 篇主要评价专家命中或吞吐,未观察同一请求的 KV 读取时刻;路由稳定不等于 KV 热点稳定。

相关工作Libra-ICLR26LatencyOptimal-MoELB-INET4AI25CRAFT-MLSys26LayeredPrefill-MLSys26

KV 分层传输

共同目标:扩大可复用上下文容量,并让慢层加载不阻塞 TTFT 或解码。

演化与分歧LMCache-arXiv25 提供多层对象;CacheGen-SIGCOMM24 减少网络字节;CacheBlend-EuroSys25 在加载与部分重算间折中;SuperInfer-MLSys26DirectKV-OSDI26 利用高带宽主机互连;Strata-OSDI26 解决碎片布局与就绪时间;ECHO-OSDI26 提供稀疏注意力的最终精确召回。

共同边界:7/7 篇都不管理专家权重,其重叠收益不能与专家装载收益相加。

相关工作LMCache-arXiv25CacheGen-SIGCOMM24CacheBlend-EuroSys25SuperInfer-MLSys26DirectKV-OSDI26Strata-OSDI26ECHO-OSDI26

KV 内容缩减

共同目标:减少需驻留或传输的 KV,而不只是改变位置。

演化与分歧Kitty-MLSys26 量化通道,FlexiCache-MLSys26 区分注意力头,SkipKV-MLSys26 删除语义冗余,MoE-nD-arXiv26 按层选择压缩,IceCache-arXiv26 用语义聚类改善选择。

共同边界:5/5 篇都没有把质量风险与专家失配延迟放入同一个 SLO 决策。

相关工作FlexiCache-MLSys26Kitty-MLSys26SkipKV-MLSys26MoE-nD-arXiv26IceCache-arXiv26

共享资源与执行结构

共同目标:在单对象策略之上重组显存、批次、传输或执行边界。

演化与分歧vLLM-SOSP23 建立分页基础,Prism-OSDI26 让模型权重与 KV 共用物理页,MorphServe-MLSys26 降低权重精度扩大 KV,DeepSeek-V4-arXiv26 从模型结构降低两者容量。其余工作改善传输、动态执行、中间张量、全局批处理或注意力解聚。

共同边界:9 篇中只有 Prism-OSDI26MorphServe-MLSys26 显式在权重与 KV 间调整容量;二者都不利用词元级专家路由,也未覆盖 SSD 上两类对象的竞争。

相关工作vLLM-SOSP23Prism-OSDI26MorphServe-MLSys26DeepSeek-V4-arXiv26fabric-lib-MLSys26EventTensor-MLSys26MoEBlaze-MLSys26BatchLLM-MLSys26DistCA-MLSys26

跨工作共同缺陷

共同缺陷覆盖范围为什么是系统性问题已有缓解与剩余缺口
两类对象各自局部预算专家执行 8/8、KV 分层与缩减 12/12,跨 4 条路线多留专家减少每词元失配,多留 KV 扩大上下文与批次;两者共用 HBM 和链路Prism-OSDI26共享容量但不观察路由;MoE-Lightning-ASPLOS25联合静态搜索但缺在线闭环
重叠窗口被重复计算涉及异步装载的 15 篇中 12 篇两类失配同时发生时共用 PCIe、主存控制器或 SSD 队列,两个“可隐藏”区间不能相加Strata-OSDI26把加载纳入调度;仍无双失配实验
访问预测只看一种信号预测或重要性驱动的 11/11 篇路由热度与 KV 重要性按不同尺度变化,单信号无法决定共享资源优先级专家与 KV 各有预测器,尚无统一轨迹和误差归因
慢层被简化成容量和带宽使用 CPU、SSD、CXL 或远端层的 16 篇中 13 篇小 I/O、队列长尾、NUMA 和固定内存会改变失配代价Strata-OSDI26DirectKV-OSDI26处理部分路径;SSD 共同布局仍空白
精确性与退化缺少共同契约有近似或多回退路径的 10 篇中 9 篇专家延后、KV 量化、淘汰和重算产生不同误差,只看吞吐无法判断安全性ECHO-OSDI26保证最终精确召回;其余缺逐请求质量和回退日志

计数来自本调研的路线与证据卡审计,分母只包含缺陷适用的工作。

关键争议

CPU 执行专家,还是只保存专家

KTransformers-SOSP25CoX-MoE-DAC26 支持 CPU 执行;FluxMoE-arXiv26Wang-LocalMoEInference-OSDI26 在长预填充中把权重送往 GPU。条件化解释是:低并发解码适合 CPU 带宽型矩阵向量乘,长预填充适合 GPU 大矩阵乘。需要按输入长度、批次、主存带宽与 PCIe 代际画交叉曲线。

KV 命中后加载,还是重算

LMCache-arXiv25 支持长前缀加载;CacheBlend-EuroSys25 表明非前缀块需部分重算;Strata-OSDI26 表明命中数据也可能因碎片 I/O 未就绪。专家装载会继续推高加载成本,所以命中不是充分条件。

模型侧压缩会缩小还是扩大联合管理价值

DeepSeek-V4-arXiv26Kitty-MLSys26MoE-nD-arXiv26 降低单对象容量,看似削弱卸载需求;但系统可能用节省空间扩大上下文和并发,再次耗尽 HBM。必须在相同质量与业务负载下测总需求反弹。

产业实践与学术缺口

  • NVIDIA Dynamo KVBM 已覆盖 GPU、主存、磁盘与对象存储 KV 层级,却不管理 MoE 专家;官方对层级容量的防抖建议说明慢层并非透明。
  • vLLM 增量式专家卸载 RFC 提出 CPU 固定内存、固定 GPU 专家缓存与异步预取,但专家缓存仍与 KV 预算分开。
  • Tutti 用 GPU 原生对象和 GPU io_uring 改造 SSD KV 路径,说明控制路径本身会成为瓶颈;对象仍只有 KV。
  • 本地 MoE 运行时已有专家驻留旋钮,Dynamo、LMCache、FlexKV 已有 KV 层级旋钮。两个旋钮并存早于一个统一控制器,公开资料却缺同机双失配轨迹。

候选空白

  1. 专家与 KV 的联合边际收益曲线:下一 GiB HBM 给谁更能减少 SLO 违约尚无人系统测量。
  2. 双失配带宽仲裁:同一步专家与 KV 同时失配时,缺少在搬运、CPU 执行、重算和降级之间选择的共同队列。
  3. 路由—注意力联合轨迹格式:尚无公开轨迹把每层专家、KV 块、传输与请求 SLO 对齐到同一时间轴。
  4. SSD 上两类对象的共同布局:专家页只读且模型级复用,KV 页追加写、请求级复用并会失效;共同 I/O、写放大与垃圾回收未被研究。
  5. 类型化回退与质量边界:精确加载、CPU 执行、专家延后、KV 解压与重算需要不同正确性标签。
  6. 模型结构变化下的策略迁移:不同 MoE 的专家数、激活数、KV 布局与精度差异尚无可移植代价模型。

关键未知与测量

  1. 下一 GiB HBM 的边际收益是否稳定:扫描专家缓存预算×KV 预算,覆盖短对话、长检索、多轮工具和长推理;记录吞吐、TTFT、TPOT、P99、两类失配率与字节。若最优分区频繁翻转,静态预算器被推翻。
  2. 两类失配是否时间相关:同步记录每请求、层与解码步的专家、KV 块和后端队列,计算共同突发概率。若近似独立且不争资源,两个简单控制器可能足够。
  3. 双失配时哪种动作最优:比较先专家、先 KV、CPU 执行、重算与压缩加载,输出按硬件和阶段分层的交叉曲线。
  4. 联合预测是否有信息增益:在同等模型大小与开销下比较路由信号、注意力信号和联合信号;用误取字节、停顿和 P99,而非只用准确率。
  5. 设备效应是否翻转优先级:在主存、NVMe、GPU 直接存储与远端内存重放同一轨迹,扫描 I/O 大小、队列深度和并发干扰。
  6. 联合回退能否审计质量:逐请求保存回退原因并与精确基线比较输出和任务分数;若漂移无法归因,先限制为精确路径。

覆盖缺口

  • vLLM 专家卸载仍以 RFC 和实现讨论为主,缺稳定版本、生产轨迹与同预算 KV 实验。
  • Tutti 等 2026 年 SSD KV 工作仅为外部线索,未启用 --ingest-missing
  • 闭源平台很少公开两类失配同步轨迹,联合竞争判断主要来自跨论文机制推断。
  • 新模型改变专家和 KV 格式,但跨模型、跨硬件的统一质量与成本数据仍不足。

附录:逐篇证据卡

以下卡片按主要路线分组。“完整论文页”表示已复核 wiki 页中的关键观察、隐含假设、批判性分析与局限。

专家异构执行

FluxMoE-arXiv26

  • 路线与角色:专家异构执行;转折。
  • 证据等级:完整论文页。
  • 做了什么:以 PagedTensor 分页专家并重叠加载与计算。
  • 没做什么:未联合 KV,也未实测真实预填充—解码分离。
  • 关键观察:冷专家占 HBM 会挤压 KV 和批次。
  • 隐含假设:访问窗口可预测,加载可被计算覆盖。
  • 可攻击点 / 脆弱点:长 KV 搬运会缩短隐藏窗口。

MOE-INFINITY-arXiv24

  • 路线与角色:专家异构执行;奠基。
  • 证据等级:完整论文页。
  • 做了什么:用请求级激活图、预取与主存专家缓存服务超大 MoE。
  • 没做什么:未联合 KV,主要是单用户单请求。
  • 关键观察:单请求内专家激活有局部性。
  • 隐含假设:近期激活图可代表后续,主存容得下权重。
  • 可攻击点 / 脆弱点:并发会混合上下文并增加抖动。

KTransformers-SOSP25

  • 路线与角色:专家异构执行;转折。
  • 证据等级:完整论文页。
  • 做了什么:GPU 处理注意力,CPU 用 AMX 或 AVX 执行多数专家。
  • 没做什么:无联合 KV 预算,面向低并发本地部署。
  • 关键观察:预填充与解码的专家算术强度不同。
  • 隐含假设:CPU 指令和主存带宽足够。
  • 可攻击点 / 脆弱点:长预填充更适合 GPU;专家延后非逐位精确。

MoE-Lightning-ASPLOS25

  • 路线与角色:专家异构执行;转折。
  • 证据等级:完整论文页。
  • 做了什么:联合搜索 CPU 注意力、GPU 专家、权重传输和 KV 位置。
  • 没做什么:缺在线适应与多租户尾延迟。
  • 关键观察:CPU 注意力免去 KV 往返,但长上下文受主存带宽限制。
  • 隐含假设:屋顶线模型能保持策略排序。
  • 可攻击点 / 脆弱点:路由、长度与 CPU 争用会使离线最优失效。

Wang-LocalMoEInference-OSDI26

  • 路线与角色:专家异构执行;转折。
  • 证据等级:完整论文页。
  • 做了什么:长预填充流式上 GPU,低并发解码在 CPU 执行专家。
  • 没做什么:不覆盖云端尾延迟或 KV 慢层。
  • 关键观察:约 4K 以上输入才足以覆盖权重传输。
  • 隐含假设:大主存保留权威权重,阶段交叉点稳定。
  • 可攻击点 / 脆弱点:普通主机、更多并发和长 KV 会改变交叉点。

OD-MoE-arXiv25

  • 路线与角色:专家异构执行;扩展。
  • 证据等级:完整论文页。
  • 做了什么:用影子模型多层预测专家并从边缘节点加载。
  • 没做什么:不管理 KV 或统一 NVMe 队列。
  • 关键观察:提前预测可弱化长期专家缓存需求。
  • 隐含假设:路由召回稳定,预测开销可摊销。
  • 可攻击点 / 脆弱点:域漂移和误取会放大链路流量。

CoX-MoE-DAC26

  • 路线与角色:专家异构执行;扩展。
  • 证据等级:完整论文页。
  • 做了什么:CPU—GPU 协同执行并合并专家批次。
  • 没做什么:不覆盖 NVMe 或联合 KV。
  • 关键观察:合并专家工作可更好利用 CPU 矩阵能力。
  • 隐含假设:常用专家的静态 GPU 放置有效。
  • 可攻击点 / 脆弱点:分布漂移会使热点失效。

ContextAwareMoE-CXLNDP-arXiv25

  • 路线与角色:专家异构执行;硬件扩展。
  • 证据等级:完整论文页。
  • 做了什么:按预填充激活放置专家,让 CXL 近数据处理执行冷专家。
  • 没做什么:不管理 KV 对 CXL 与主存的竞争。
  • 关键观察:移动激活可能比搬整份专家便宜。
  • 隐含假设:预填充能预测解码,专用硬件可用。
  • 可攻击点 / 脆弱点:路由变化与 KV 共用 CXL 带宽会削弱收益。

专家预测与放置

Libra-ICLR26

  • 路线与角色:专家预测与放置;转折。
  • 证据等级:完整论文页。
  • 做了什么:从相邻层隐状态预测下一层路由。
  • 没做什么:不卸载专家或 KV,主要聚焦预填充。
  • 关键观察:相邻层路由具有相关性。
  • 隐含假设:预测命中足以覆盖调度成本。
  • 可攻击点 / 脆弱点:输入域和批次变化可能破坏相关性。

LatencyOptimal-MoELB-INET4AI25

  • 路线与角色:专家预测与放置;扩展。
  • 证据等级:完整论文页。
  • 做了什么:把专家迁移代价纳入负载均衡。
  • 没做什么:不观察 KV 容量或链路争用。
  • 关键观察:均衡收益必须跨多步摊销迁移。
  • 隐含假设:历史需求能估计未来热点。
  • 可攻击点 / 脆弱点:短突发和 KV 同搬会使迁移不划算。

CRAFT-MLSys26

  • 路线与角色:专家预测与放置;扩展。
  • 证据等级:完整论文页。
  • 做了什么:按层估计专家副本收益并分配显存。
  • 没做什么:不把 KV 纳入预算。
  • 关键观察:不同层复制专家的边际收益差异大。
  • 隐含假设:离线收益代表部署负载。
  • 可攻击点 / 脆弱点:路由和上下文变化会改变显存机会成本。

LayeredPrefill-MLSys26

  • 路线与角色:专家预测与放置;调度转折。
  • 证据等级:完整论文页。
  • 做了什么:按层组调度预填充以减少重复装载。
  • 没做什么:不处理解码专家缓存或 KV 慢层。
  • 关键观察:按请求推进会反复载入同层专家。
  • 隐含假设:足够多请求可聚合且不破坏 SLO。
  • 可攻击点 / 脆弱点:低负载和严格单请求延迟减少机会。

KV 分层传输

LMCache-arXiv25

  • 路线与角色:KV 分层传输;奠基。
  • 证据等级:完整论文页。
  • 做了什么:提供 GPU、主存、SSD 和远端层的 KV 对象与连接器。
  • 没做什么:不管理专家,自适应策略和故障仍开放。
  • 关键观察:跨请求复用可把重复预填充转成加载。
  • 隐含假设:加载低于重算,元数据可靠。
  • 可攻击点 / 脆弱点:短前缀、慢后端和隔离会翻转收益。

CacheGen-SIGCOMM24

  • 路线与角色:KV 分层传输;压缩转折。
  • 证据等级:完整论文页。
  • 做了什么:把 KV 编码为可按带宽调整的压缩比特流。
  • 没做什么:不决定驻留、驱逐或专家放置。
  • 关键观察:层间与通道统计可降低传输字节。
  • 隐含假设:压缩配置对模型版本稳定。
  • 可攻击点 / 脆弱点:版本漂移、解码开销与长尾未充分覆盖。

CacheBlend-EuroSys25

  • 路线与角色:KV 分层传输;反例。
  • 证据等级:完整论文页。
  • 做了什么:为非前缀检索块选择性重算以修复跨块注意力。
  • 没做什么:无通用多层存储或专家管理。
  • 关键观察:命中不保证可直接精确复用。
  • 隐含假设:少量重算可被加载隐藏。
  • 可攻击点 / 脆弱点:密集跨块推理会放大重算和等待。

SuperInfer-MLSys26

  • 路线与角色:KV 分层传输;硬件转折。
  • 证据等级:完整论文页。
  • 做了什么:在 Grace–Hopper 上主动轮转 HBM 与主存中的 KV。
  • 没做什么:不管理专家,未验证普通 PCIe 或 NVMe。
  • 关键观察:大块双向传输可让主存卸载成为常态。
  • 隐含假设:NVLink-C2C 带宽充足且近似独占。
  • 可攻击点 / 脆弱点:专家装载或多 GPU 会吞掉余量。

DirectKV-OSDI26

  • 路线与角色:KV 分层传输;数据路径转折。
  • 证据等级:完整论文页。
  • 做了什么:融合注意力内核直接读取 CPU 常驻 KV。
  • 没做什么:不负责策略、专家或普通 PCIe 平台。
  • 关键观察:朴素零拷贝会重复读远端 KV。
  • 隐含假设:Hopper 与 NVLink-C2C 可用,主存带宽充足。
  • 可攻击点 / 脆弱点:多租户与专家流量会使直读变慢。

Strata-OSDI26

  • 路线与角色:KV 分层传输;系统转折。
  • 证据等级:完整论文页。
  • 做了什么:分离逻辑页与传输布局,并按 KV 就绪时间组批。
  • 没做什么:不管理专家,未完整覆盖 SSD 寿命和故障。
  • 关键观察:小页提升命中,却使链路带宽利用低。
  • 隐含假设:布局转换和加载代价可估计。
  • 可攻击点 / 脆弱点:压缩布局和专家争用会破坏估计。

ECHO-OSDI26

  • 路线与角色:KV 分层传输;稀疏注意力转折。
  • 证据等级:完整论文页。
  • 做了什么:为主存 KV 提供计算图兼容管理和最终精确召回。
  • 没做什么:只测特定稀疏模型与大主存,不管理专家。
  • 关键观察:预取可近似,最终选择仍可精确。
  • 隐含假设:索引边界稳定,主存和 PCIe 充足。
  • 可攻击点 / 脆弱点:端到端预取增益有限,多租户未测。

KV 内容缩减

FlexiCache-MLSys26

  • 路线与角色:KV 内容缩减;扩展。
  • 证据等级:完整论文页。
  • 做了什么:利用注意力头时间稳定性分级保存 KV。
  • 没做什么:不管理专家或共同带宽。
  • 关键观察:不同头的重要性与稳定性不同。
  • 隐含假设:头级特征对请求稳定。
  • 可攻击点 / 脆弱点:任务切换可能改变稳定性。

Kitty-MLSys26

  • 路线与角色:KV 内容缩减;量化扩展。
  • 证据等级:完整论文页。
  • 做了什么:用低比特 KV 和敏感通道增强降低容量。
  • 没做什么:不决定放置或专家预算。
  • 关键观察:少数通道对精度更敏感。
  • 隐含假设:敏感通道可稳定识别。
  • 可攻击点 / 脆弱点:长推理与解码成本可能改变结论。

SkipKV-MLSys26

  • 路线与角色:KV 内容缩减;语义淘汰扩展。
  • 证据等级:完整论文页。
  • 做了什么:按句级冗余跳过或驱逐推理轨迹 KV。
  • 没做什么:不处理精确多层 I/O 或专家缓存。
  • 关键观察:推理链含重复和非执行性内容。
  • 隐含假设:冗余可在线判断且删除不伤结果。
  • 可攻击点 / 脆弱点:删除不可逆,难与其他近似共同归因。

MoE-nD-arXiv26

  • 路线与角色:KV 内容缩减;多轴转折。
  • 证据等级:完整论文页。
  • 做了什么:按层选择淘汰与 K/V 量化组合。
  • 没做什么:不管理专家,策略主要离线求解。
  • 关键观察:不同层对压缩方式敏感度不同。
  • 隐含假设:离线质量代理可迁移。
  • 可攻击点 / 脆弱点:任务漂移和专家压力会改变预算。

IceCache-arXiv26

  • 路线与角色:KV 内容缩减;语义布局扩展。
  • 证据等级:完整论文页。
  • 做了什么:聚类语义相关词元并结合分页选择。
  • 没做什么:不管理专家或通用 SSD 生命周期。
  • 关键观察:语义相关性不同于时间连续性。
  • 隐含假设:聚类可摊销且代表注意力需求。
  • 可攻击点 / 脆弱点:查询变化会导致误选和额外搬运。

共享资源与执行结构

vLLM-SOSP23

  • 路线与角色:共享资源;奠基。
  • 证据等级:完整论文页。
  • 做了什么:分页、按需分配和写时复制 GPU KV。
  • 没做什么:CPU 交换是被动机制,不管理专家。
  • 关键观察:连续预分配显存利用率低。
  • 隐含假设:固定块是合适管理粒度。
  • 可攻击点 / 脆弱点:块与慢层 I/O 及语义粒度不匹配。

Prism-OSDI26

  • 路线与角色:共享资源;物理页转折。
  • 证据等级:完整论文页。
  • 做了什么:让多模型权重和 KV 在统一 GPU 页池中伸缩。
  • 没做什么:不观察词元级路由或 SSD 共同层。
  • 关键观察:活跃模型频繁变化,静态分区与整模切换都浪费。
  • 隐含假设:短期负载可测,页重映射便宜。
  • 可攻击点 / 脆弱点:同步突发、预测误差和故障未充分评估。

MorphServe-MLSys26

  • 路线与角色:共享资源;精度弹性扩展。
  • 证据等级:完整论文页。
  • 做了什么:流量峰值时降低部分权重精度,为 KV 释放 HBM。
  • 没做什么:不是 MoE 专家卸载,KV 仍主要驻留 GPU。
  • 关键观察:短时质量退让可换并发。
  • 隐含假设:精度切换快且退化可控。
  • 可攻击点 / 脆弱点:与 KV 近似同时发生会叠加质量风险。

DeepSeek-V4-arXiv26

  • 路线与角色:共享资源;模型侧转折。
  • 证据等级:完整论文页。
  • 做了什么:以低精度专家和压缩注意力降低两类容量。
  • 没做什么:无通用联合卸载策略。
  • 关键观察:模型结构可改变系统容量常数。
  • 隐含假设:专用布局与精度有高效内核。
  • 可攻击点 / 脆弱点:模型特化难外推,需求反弹可能吃满 HBM。

fabric-lib-MLSys26

  • 路线与角色:共享资源;传输原语扩展。
  • 证据等级:完整论文页。
  • 做了什么:为 KV、权重与专家分发提供可靠无序点对点传输。
  • 没做什么:不决定搬什么,也不覆盖本地 SSD 竞争。
  • 关键观察:动态非均匀状态不适合固定集合通信。
  • 隐含假设:上层提供正确对象和生命周期。
  • 可攻击点 / 脆弱点:取消、内存注册与故障仍留给上层。

EventTensor-MLSys26

  • 路线与角色:共享资源;执行抽象扩展。
  • 证据等级:完整论文页。
  • 做了什么:以事件张量表达数据依赖的 MoE 动态巨型内核。
  • 没做什么:不管理慢层或专家—KV 容量。
  • 关键观察:部分 MoE 开销来自 GPU 内同步和发射。
  • 隐含假设:事件依赖可由编译器有效生成。
  • 可攻击点 / 脆弱点:外部 I/O 尚未进入事件抽象。

MoEBlaze-MLSys26

  • 路线与角色:共享资源;中间状态反例。
  • 证据等级:完整论文页。
  • 做了什么:避免训练中按专家物化路由缓冲。
  • 没做什么:不处理推理 KV 或权重卸载。
  • 关键观察:MoE 内存墙还来自中间状态。
  • 隐含假设:融合执行保持正确高效。
  • 可攻击点 / 脆弱点:对推理联合预算仅为间接证据。

BatchLLM-MLSys26

  • 路线与角色:共享资源;离线调度扩展。
  • 证据等级:完整论文页。
  • 做了什么:用全局前缀树和内存中心批处理最大化 KV 复用。
  • 没做什么:不处理在线专家失配和交互 SLO。
  • 关键观察:全批可见时全局计划优于局部淘汰。
  • 隐含假设:请求集合可提前获知。
  • 可攻击点 / 脆弱点:在线到达和 MoE 路由破坏全局可见性。

DistCA-MLSys26

  • 路线与角色:共享资源;解聚扩展。
  • 证据等级:完整论文页。
  • 做了什么:训练中把无参数注意力拆到独立服务池。
  • 没做什么:不是推理 KV 或专家卸载系统。
  • 关键观察:注意力与有参数层可分配不同资源。
  • 隐含假设:词元任务可动态重批,状态传输可承受。
  • 可攻击点 / 脆弱点:逐步解码和尾延迟可能不适用。

外部证据

产业实现:NVIDIA Dynamo KVBM

  • 路线与角色:KV 分层传输;产业实现。
  • 证据等级:官方文档。
  • 做了什么:提供主存、磁盘、对象存储 KV 层级与事件配置。
  • 没做什么:不管理 MoE 专家。
  • 关键观察:下层过小会持续卸载并抖动。
  • 隐含假设:KV 块事件足以驱动策略。
  • 可攻击点 / 脆弱点:专家仍由另一套记账管理。

产业提案:vLLM 增量式专家卸载 RFC

  • 路线与角色:专家异构执行;产业候选。
  • 证据等级:公开 RFC,非稳定论文结果。
  • 做了什么:提出 CPU 固定内存、GPU 专家缓存和异步加载。
  • 没做什么:无成熟生产评测或联合 KV 控制器。
  • 关键观察:动态专家缓存需进入引擎内存记账。
  • 隐含假设:跨层预测可把失配降到可隐藏范围。
  • 可攻击点 / 脆弱点:与 KV profiler 分离会造成错误预算。

外部论文:Tutti

  • 路线与角色:KV 分层传输;外部转折。
  • 证据等级:外部论文全文线索。
  • 做了什么:以 GPU 原生对象和 GPU 发起 I/O 改造 SSD KV 路径。
  • 没做什么:不管理专家权重。
  • 关键观察:碎片对象和 CPU 发起 I/O 无法吃满 SSD。
  • 隐含假设:GPU 控制路径与大对象可摊销。
  • 可攻击点 / 脆弱点:专家页共用 SSD 与 GPU 控制资源时收益未知。