深度调研(Probe):MoE 专家权重与 KV 缓存的联合分层管理
阅读提示
- **混合专家模型(Mixture of Experts,MoE)**只为每个词元激活少数专家,但全部专家权重仍要存放;**键值缓存(key-value cache,KV cache)**随上下文和并发增长。两者共同争用高带宽内存(high-bandwidth memory,HBM)。
- **预填充(prefill)**一次处理输入,适合大矩阵计算;**解码(decode)**逐词元生成,常受权重或缓存读取带宽限制。
- 本文把“联合管理”限定为:同一控制器观察专家和 KV 的容量、访问、传输与服务等级目标(service-level objective,SLO),再决定下一单位 HBM、主存或链路预算给谁。两个独立旋钮并存不算联合管理。
一页结论
- 33 篇内部工作形成五条路线:专家异构执行、专家预测与放置、KV 分层传输、KV 内容缩减、共享资源与执行结构。组件已丰富,统一决策仍缺失。
- 2024 年前后的主问题是“怎样让单类对象离开 HBM”;2025–2026 年转向按阶段选择执行位置、为主存 KV 重写数据路径、以及让权重和 KV 共用物理显存。
- 最广的缺陷是局部预算:8/8 篇专家异构执行工作没有联合 KV 策略,12/12 篇 KV 分层或缩减工作没有联合专家策略。
- “输入输出可以被计算隐藏”与“缓存命中就值得加载”都依赖条件;专家失配与 KV 失配同时发生时会争用同一链路,两个隐藏窗口不能相加。
- proposal 前首先需要同请求、同时间轴的专家与 KV 访问轨迹,以及 HBM 二维预算扫描;否则无法证明复杂联合控制器优于两个简单控制器。
范围与证据
本调研纳入 33 篇仓库内工作,均有完整 wiki 论文页;另纳入 3 项外部产业或最新论文线索。范围包括会改变专家或 KV 存放、访问窗口、共享容量或传输资源的系统,不包括只优化训练优化器状态、纯专家通信或纯模型精度的工作。外部线索未启用 --ingest-missing,不进入原始论文层与 wiki 层。
研究版图
| 研究路线 | 核心问题 | 代表工作 | 当前边界 |
|---|---|---|---|
| 专家异构执行 | 专家不驻留 HBM 时在哪里执行、何时搬运 | MOE-INFINITY-arXiv24、KTransformers-SOSP25、Wang-LocalMoEInference-OSDI26 | 大多把 KV 当固定占用,依赖低并发或特定主机 |
| 专家预测与放置 | 怎样预知热点并复制、迁移或聚合专家 | Libra-ICLR26、CRAFT-MLSys26、LayeredPrefill-MLSys26 | 路由预测不观察同一请求的 KV 压力 |
| KV 分层传输 | 怎样从主存、SSD 或远端层及时取回 KV | LMCache-arXiv25、Strata-OSDI26、DirectKV-OSDI26 | 只管理 KV,链路常被当作可独占资源 |
| KV 内容缩减 | 怎样少保存或少搬 KV | FlexiCache-MLSys26、MoE-nD-arXiv26、IceCache-arXiv26 | 质量契约不同,不能都视作精确缓存 |
| 共享资源与执行结构 | 怎样在更高层重分显存、批次和传输 | Prism-OSDI26、MorphServe-MLSys26、fabric-lib-MLSys26 | 尚无词元级专家与请求级 KV 的共同代价模型 |
分类依据是控制器直接回答的问题。MoE-Lightning-ASPLOS25 虽同时处理专家权重和 KV,主要角色仍是部署前异构执行搜索;Prism-OSDI26 真正共享物理页,却管理模型级权重而非路由专家。缺口因此不是少一个组件,而是缺把两种访问语义映射到同一预算的闭环。
时间脉络
总体阶段
分页管理单类状态 → 利用稀疏访问做异构卸载 → 建立多层 KV 存储 → 按阶段与硬件重写数据路径 → 共享物理显存,但尚未统一专家与 KV 策略
专家异构执行
- 2024 — MOE-INFINITY-arXiv24:从逐层卸载转向按请求激活图缓存专家,证明稀疏路由可指导主存专家缓存。
- 2025 — KTransformers-SOSP25、MoE-Lightning-ASPLOS25:前者让 CPU 执行多数专家,后者联合搜索 CPU 注意力、GPU 专家和权重传输;问题转为按阶段选择执行位置。
- 2026 — FluxMoE-arXiv26、Wang-LocalMoEInference-OSDI26:专家被分页或流式装入 GPU,长预填充与低并发解码走不同路径,固定的“CPU 算专家”不再成立。
KV 分层与数据路径
- 2023 — vLLM-SOSP23:分页让 KV 成为可分配块,但 CPU 交换仍主要是显存不足后的被动机制。
- 2024–2025 — CacheGen-SIGCOMM24、LMCache-arXiv25:KV 成为可压缩、可远端复用的持久对象,多层中间件出现。
- 2026 — DirectKV-OSDI26、Strata-OSDI26、ECHO-OSDI26:主存直读、传输布局重排和最终精确召回把“数据存在”与“按时可用”分开。
共享资源
- 2026 — DeepSeek-V4-arXiv26:模型侧同时压缩专家和长上下文 KV,改变卸载容量基线。
- 2026 — Prism-OSDI26:权重和 KV 在同一弹性物理页池中跨模型调节,但仍没有路由专家与请求 KV 的联合失配模型。
各类工作的演化
专家异构执行
共同目标:完整权重放不进 HBM 时,只搬运或执行当前需要的专家。
演化与分歧:MOE-INFINITY-arXiv24 和 OD-MoE-arXiv25 用预测与缓存减装载;KTransformers-SOSP25、CoX-MoE-DAC26 与 ContextAwareMoE-CXLNDP-arXiv25 在 CPU 或近数据设备执行;FluxMoE-arXiv26、Wang-LocalMoEInference-OSDI26 在长预填充时流式送往 GPU。MoE-Lightning-ASPLOS25 进一步联合搜索 CPU 注意力和 KV 位置,但没有在线共同仲裁。
共同边界:8/8 篇都没有让 KV 命中、上下文长度与专家失配共同决定下一次搬运。
相关工作:FluxMoE-arXiv26、MOE-INFINITY-arXiv24、KTransformers-SOSP25、MoE-Lightning-ASPLOS25、Wang-LocalMoEInference-OSDI26、OD-MoE-arXiv25、CoX-MoE-DAC26、ContextAwareMoE-CXLNDP-arXiv25
专家预测与放置
共同目标:利用路由的时间或层间局部性提前预取、复制或聚合专家。
演化与分歧:LatencyOptimal-MoELB-INET4AI25 把迁移代价加入负载均衡;Libra-ICLR26 预测下一层;CRAFT-MLSys26 按层分配副本;LayeredPrefill-MLSys26 通过层分组提高复用。
共同边界:4/4 篇主要评价专家命中或吞吐,未观察同一请求的 KV 读取时刻;路由稳定不等于 KV 热点稳定。
相关工作:Libra-ICLR26、LatencyOptimal-MoELB-INET4AI25、CRAFT-MLSys26、LayeredPrefill-MLSys26
KV 分层传输
共同目标:扩大可复用上下文容量,并让慢层加载不阻塞 TTFT 或解码。
演化与分歧:LMCache-arXiv25 提供多层对象;CacheGen-SIGCOMM24 减少网络字节;CacheBlend-EuroSys25 在加载与部分重算间折中;SuperInfer-MLSys26、DirectKV-OSDI26 利用高带宽主机互连;Strata-OSDI26 解决碎片布局与就绪时间;ECHO-OSDI26 提供稀疏注意力的最终精确召回。
共同边界:7/7 篇都不管理专家权重,其重叠收益不能与专家装载收益相加。
相关工作:LMCache-arXiv25、CacheGen-SIGCOMM24、CacheBlend-EuroSys25、SuperInfer-MLSys26、DirectKV-OSDI26、Strata-OSDI26、ECHO-OSDI26
KV 内容缩减
共同目标:减少需驻留或传输的 KV,而不只是改变位置。
演化与分歧:Kitty-MLSys26 量化通道,FlexiCache-MLSys26 区分注意力头,SkipKV-MLSys26 删除语义冗余,MoE-nD-arXiv26 按层选择压缩,IceCache-arXiv26 用语义聚类改善选择。
共同边界:5/5 篇都没有把质量风险与专家失配延迟放入同一个 SLO 决策。
相关工作:FlexiCache-MLSys26、Kitty-MLSys26、SkipKV-MLSys26、MoE-nD-arXiv26、IceCache-arXiv26
共享资源与执行结构
共同目标:在单对象策略之上重组显存、批次、传输或执行边界。
演化与分歧:vLLM-SOSP23 建立分页基础,Prism-OSDI26 让模型权重与 KV 共用物理页,MorphServe-MLSys26 降低权重精度扩大 KV,DeepSeek-V4-arXiv26 从模型结构降低两者容量。其余工作改善传输、动态执行、中间张量、全局批处理或注意力解聚。
共同边界:9 篇中只有 Prism-OSDI26 与 MorphServe-MLSys26 显式在权重与 KV 间调整容量;二者都不利用词元级专家路由,也未覆盖 SSD 上两类对象的竞争。
相关工作:vLLM-SOSP23、Prism-OSDI26、MorphServe-MLSys26、DeepSeek-V4-arXiv26、fabric-lib-MLSys26、EventTensor-MLSys26、MoEBlaze-MLSys26、BatchLLM-MLSys26、DistCA-MLSys26
跨工作共同缺陷
| 共同缺陷 | 覆盖范围 | 为什么是系统性问题 | 已有缓解与剩余缺口 |
|---|---|---|---|
| 两类对象各自局部预算 | 专家执行 8/8、KV 分层与缩减 12/12,跨 4 条路线 | 多留专家减少每词元失配,多留 KV 扩大上下文与批次;两者共用 HBM 和链路 | Prism-OSDI26共享容量但不观察路由;MoE-Lightning-ASPLOS25联合静态搜索但缺在线闭环 |
| 重叠窗口被重复计算 | 涉及异步装载的 15 篇中 12 篇 | 两类失配同时发生时共用 PCIe、主存控制器或 SSD 队列,两个“可隐藏”区间不能相加 | Strata-OSDI26把加载纳入调度;仍无双失配实验 |
| 访问预测只看一种信号 | 预测或重要性驱动的 11/11 篇 | 路由热度与 KV 重要性按不同尺度变化,单信号无法决定共享资源优先级 | 专家与 KV 各有预测器,尚无统一轨迹和误差归因 |
| 慢层被简化成容量和带宽 | 使用 CPU、SSD、CXL 或远端层的 16 篇中 13 篇 | 小 I/O、队列长尾、NUMA 和固定内存会改变失配代价 | Strata-OSDI26、DirectKV-OSDI26处理部分路径;SSD 共同布局仍空白 |
| 精确性与退化缺少共同契约 | 有近似或多回退路径的 10 篇中 9 篇 | 专家延后、KV 量化、淘汰和重算产生不同误差,只看吞吐无法判断安全性 | ECHO-OSDI26保证最终精确召回;其余缺逐请求质量和回退日志 |
计数来自本调研的路线与证据卡审计,分母只包含缺陷适用的工作。
关键争议
CPU 执行专家,还是只保存专家
KTransformers-SOSP25、CoX-MoE-DAC26 支持 CPU 执行;FluxMoE-arXiv26、Wang-LocalMoEInference-OSDI26 在长预填充中把权重送往 GPU。条件化解释是:低并发解码适合 CPU 带宽型矩阵向量乘,长预填充适合 GPU 大矩阵乘。需要按输入长度、批次、主存带宽与 PCIe 代际画交叉曲线。
KV 命中后加载,还是重算
LMCache-arXiv25 支持长前缀加载;CacheBlend-EuroSys25 表明非前缀块需部分重算;Strata-OSDI26 表明命中数据也可能因碎片 I/O 未就绪。专家装载会继续推高加载成本,所以命中不是充分条件。
模型侧压缩会缩小还是扩大联合管理价值
DeepSeek-V4-arXiv26、Kitty-MLSys26 与 MoE-nD-arXiv26 降低单对象容量,看似削弱卸载需求;但系统可能用节省空间扩大上下文和并发,再次耗尽 HBM。必须在相同质量与业务负载下测总需求反弹。
产业实践与学术缺口
- NVIDIA Dynamo KVBM 已覆盖 GPU、主存、磁盘与对象存储 KV 层级,却不管理 MoE 专家;官方对层级容量的防抖建议说明慢层并非透明。
- vLLM 增量式专家卸载 RFC 提出 CPU 固定内存、固定 GPU 专家缓存与异步预取,但专家缓存仍与 KV 预算分开。
- Tutti 用 GPU 原生对象和 GPU
io_uring改造 SSD KV 路径,说明控制路径本身会成为瓶颈;对象仍只有 KV。 - 本地 MoE 运行时已有专家驻留旋钮,Dynamo、LMCache、FlexKV 已有 KV 层级旋钮。两个旋钮并存早于一个统一控制器,公开资料却缺同机双失配轨迹。
候选空白
- 专家与 KV 的联合边际收益曲线:下一 GiB HBM 给谁更能减少 SLO 违约尚无人系统测量。
- 双失配带宽仲裁:同一步专家与 KV 同时失配时,缺少在搬运、CPU 执行、重算和降级之间选择的共同队列。
- 路由—注意力联合轨迹格式:尚无公开轨迹把每层专家、KV 块、传输与请求 SLO 对齐到同一时间轴。
- SSD 上两类对象的共同布局:专家页只读且模型级复用,KV 页追加写、请求级复用并会失效;共同 I/O、写放大与垃圾回收未被研究。
- 类型化回退与质量边界:精确加载、CPU 执行、专家延后、KV 解压与重算需要不同正确性标签。
- 模型结构变化下的策略迁移:不同 MoE 的专家数、激活数、KV 布局与精度差异尚无可移植代价模型。
关键未知与测量
- 下一 GiB HBM 的边际收益是否稳定:扫描专家缓存预算×KV 预算,覆盖短对话、长检索、多轮工具和长推理;记录吞吐、TTFT、TPOT、P99、两类失配率与字节。若最优分区频繁翻转,静态预算器被推翻。
- 两类失配是否时间相关:同步记录每请求、层与解码步的专家、KV 块和后端队列,计算共同突发概率。若近似独立且不争资源,两个简单控制器可能足够。
- 双失配时哪种动作最优:比较先专家、先 KV、CPU 执行、重算与压缩加载,输出按硬件和阶段分层的交叉曲线。
- 联合预测是否有信息增益:在同等模型大小与开销下比较路由信号、注意力信号和联合信号;用误取字节、停顿和 P99,而非只用准确率。
- 设备效应是否翻转优先级:在主存、NVMe、GPU 直接存储与远端内存重放同一轨迹,扫描 I/O 大小、队列深度和并发干扰。
- 联合回退能否审计质量:逐请求保存回退原因并与精确基线比较输出和任务分数;若漂移无法归因,先限制为精确路径。
覆盖缺口
- vLLM 专家卸载仍以 RFC 和实现讨论为主,缺稳定版本、生产轨迹与同预算 KV 实验。
- Tutti 等 2026 年 SSD KV 工作仅为外部线索,未启用
--ingest-missing。 - 闭源平台很少公开两类失配同步轨迹,联合竞争判断主要来自跨论文机制推断。
- 新模型改变专家和 KV 格式,但跨模型、跨硬件的统一质量与成本数据仍不足。
附录:逐篇证据卡
以下卡片按主要路线分组。“完整论文页”表示已复核 wiki 页中的关键观察、隐含假设、批判性分析与局限。
专家异构执行
FluxMoE-arXiv26
- 路线与角色:专家异构执行;转折。
- 证据等级:完整论文页。
- 做了什么:以 PagedTensor 分页专家并重叠加载与计算。
- 没做什么:未联合 KV,也未实测真实预填充—解码分离。
- 关键观察:冷专家占 HBM 会挤压 KV 和批次。
- 隐含假设:访问窗口可预测,加载可被计算覆盖。
- 可攻击点 / 脆弱点:长 KV 搬运会缩短隐藏窗口。
MOE-INFINITY-arXiv24
- 路线与角色:专家异构执行;奠基。
- 证据等级:完整论文页。
- 做了什么:用请求级激活图、预取与主存专家缓存服务超大 MoE。
- 没做什么:未联合 KV,主要是单用户单请求。
- 关键观察:单请求内专家激活有局部性。
- 隐含假设:近期激活图可代表后续,主存容得下权重。
- 可攻击点 / 脆弱点:并发会混合上下文并增加抖动。
KTransformers-SOSP25
- 路线与角色:专家异构执行;转折。
- 证据等级:完整论文页。
- 做了什么:GPU 处理注意力,CPU 用 AMX 或 AVX 执行多数专家。
- 没做什么:无联合 KV 预算,面向低并发本地部署。
- 关键观察:预填充与解码的专家算术强度不同。
- 隐含假设:CPU 指令和主存带宽足够。
- 可攻击点 / 脆弱点:长预填充更适合 GPU;专家延后非逐位精确。
MoE-Lightning-ASPLOS25
- 路线与角色:专家异构执行;转折。
- 证据等级:完整论文页。
- 做了什么:联合搜索 CPU 注意力、GPU 专家、权重传输和 KV 位置。
- 没做什么:缺在线适应与多租户尾延迟。
- 关键观察:CPU 注意力免去 KV 往返,但长上下文受主存带宽限制。
- 隐含假设:屋顶线模型能保持策略排序。
- 可攻击点 / 脆弱点:路由、长度与 CPU 争用会使离线最优失效。
Wang-LocalMoEInference-OSDI26
- 路线与角色:专家异构执行;转折。
- 证据等级:完整论文页。
- 做了什么:长预填充流式上 GPU,低并发解码在 CPU 执行专家。
- 没做什么:不覆盖云端尾延迟或 KV 慢层。
- 关键观察:约 4K 以上输入才足以覆盖权重传输。
- 隐含假设:大主存保留权威权重,阶段交叉点稳定。
- 可攻击点 / 脆弱点:普通主机、更多并发和长 KV 会改变交叉点。
OD-MoE-arXiv25
- 路线与角色:专家异构执行;扩展。
- 证据等级:完整论文页。
- 做了什么:用影子模型多层预测专家并从边缘节点加载。
- 没做什么:不管理 KV 或统一 NVMe 队列。
- 关键观察:提前预测可弱化长期专家缓存需求。
- 隐含假设:路由召回稳定,预测开销可摊销。
- 可攻击点 / 脆弱点:域漂移和误取会放大链路流量。
CoX-MoE-DAC26
- 路线与角色:专家异构执行;扩展。
- 证据等级:完整论文页。
- 做了什么:CPU—GPU 协同执行并合并专家批次。
- 没做什么:不覆盖 NVMe 或联合 KV。
- 关键观察:合并专家工作可更好利用 CPU 矩阵能力。
- 隐含假设:常用专家的静态 GPU 放置有效。
- 可攻击点 / 脆弱点:分布漂移会使热点失效。
ContextAwareMoE-CXLNDP-arXiv25
- 路线与角色:专家异构执行;硬件扩展。
- 证据等级:完整论文页。
- 做了什么:按预填充激活放置专家,让 CXL 近数据处理执行冷专家。
- 没做什么:不管理 KV 对 CXL 与主存的竞争。
- 关键观察:移动激活可能比搬整份专家便宜。
- 隐含假设:预填充能预测解码,专用硬件可用。
- 可攻击点 / 脆弱点:路由变化与 KV 共用 CXL 带宽会削弱收益。
专家预测与放置
Libra-ICLR26
- 路线与角色:专家预测与放置;转折。
- 证据等级:完整论文页。
- 做了什么:从相邻层隐状态预测下一层路由。
- 没做什么:不卸载专家或 KV,主要聚焦预填充。
- 关键观察:相邻层路由具有相关性。
- 隐含假设:预测命中足以覆盖调度成本。
- 可攻击点 / 脆弱点:输入域和批次变化可能破坏相关性。
LatencyOptimal-MoELB-INET4AI25
- 路线与角色:专家预测与放置;扩展。
- 证据等级:完整论文页。
- 做了什么:把专家迁移代价纳入负载均衡。
- 没做什么:不观察 KV 容量或链路争用。
- 关键观察:均衡收益必须跨多步摊销迁移。
- 隐含假设:历史需求能估计未来热点。
- 可攻击点 / 脆弱点:短突发和 KV 同搬会使迁移不划算。
CRAFT-MLSys26
- 路线与角色:专家预测与放置;扩展。
- 证据等级:完整论文页。
- 做了什么:按层估计专家副本收益并分配显存。
- 没做什么:不把 KV 纳入预算。
- 关键观察:不同层复制专家的边际收益差异大。
- 隐含假设:离线收益代表部署负载。
- 可攻击点 / 脆弱点:路由和上下文变化会改变显存机会成本。
LayeredPrefill-MLSys26
- 路线与角色:专家预测与放置;调度转折。
- 证据等级:完整论文页。
- 做了什么:按层组调度预填充以减少重复装载。
- 没做什么:不处理解码专家缓存或 KV 慢层。
- 关键观察:按请求推进会反复载入同层专家。
- 隐含假设:足够多请求可聚合且不破坏 SLO。
- 可攻击点 / 脆弱点:低负载和严格单请求延迟减少机会。
KV 分层传输
LMCache-arXiv25
- 路线与角色:KV 分层传输;奠基。
- 证据等级:完整论文页。
- 做了什么:提供 GPU、主存、SSD 和远端层的 KV 对象与连接器。
- 没做什么:不管理专家,自适应策略和故障仍开放。
- 关键观察:跨请求复用可把重复预填充转成加载。
- 隐含假设:加载低于重算,元数据可靠。
- 可攻击点 / 脆弱点:短前缀、慢后端和隔离会翻转收益。
CacheGen-SIGCOMM24
- 路线与角色:KV 分层传输;压缩转折。
- 证据等级:完整论文页。
- 做了什么:把 KV 编码为可按带宽调整的压缩比特流。
- 没做什么:不决定驻留、驱逐或专家放置。
- 关键观察:层间与通道统计可降低传输字节。
- 隐含假设:压缩配置对模型版本稳定。
- 可攻击点 / 脆弱点:版本漂移、解码开销与长尾未充分覆盖。
CacheBlend-EuroSys25
- 路线与角色:KV 分层传输;反例。
- 证据等级:完整论文页。
- 做了什么:为非前缀检索块选择性重算以修复跨块注意力。
- 没做什么:无通用多层存储或专家管理。
- 关键观察:命中不保证可直接精确复用。
- 隐含假设:少量重算可被加载隐藏。
- 可攻击点 / 脆弱点:密集跨块推理会放大重算和等待。
SuperInfer-MLSys26
- 路线与角色:KV 分层传输;硬件转折。
- 证据等级:完整论文页。
- 做了什么:在 Grace–Hopper 上主动轮转 HBM 与主存中的 KV。
- 没做什么:不管理专家,未验证普通 PCIe 或 NVMe。
- 关键观察:大块双向传输可让主存卸载成为常态。
- 隐含假设:NVLink-C2C 带宽充足且近似独占。
- 可攻击点 / 脆弱点:专家装载或多 GPU 会吞掉余量。
DirectKV-OSDI26
- 路线与角色:KV 分层传输;数据路径转折。
- 证据等级:完整论文页。
- 做了什么:融合注意力内核直接读取 CPU 常驻 KV。
- 没做什么:不负责策略、专家或普通 PCIe 平台。
- 关键观察:朴素零拷贝会重复读远端 KV。
- 隐含假设:Hopper 与 NVLink-C2C 可用,主存带宽充足。
- 可攻击点 / 脆弱点:多租户与专家流量会使直读变慢。
Strata-OSDI26
- 路线与角色:KV 分层传输;系统转折。
- 证据等级:完整论文页。
- 做了什么:分离逻辑页与传输布局,并按 KV 就绪时间组批。
- 没做什么:不管理专家,未完整覆盖 SSD 寿命和故障。
- 关键观察:小页提升命中,却使链路带宽利用低。
- 隐含假设:布局转换和加载代价可估计。
- 可攻击点 / 脆弱点:压缩布局和专家争用会破坏估计。
ECHO-OSDI26
- 路线与角色:KV 分层传输;稀疏注意力转折。
- 证据等级:完整论文页。
- 做了什么:为主存 KV 提供计算图兼容管理和最终精确召回。
- 没做什么:只测特定稀疏模型与大主存,不管理专家。
- 关键观察:预取可近似,最终选择仍可精确。
- 隐含假设:索引边界稳定,主存和 PCIe 充足。
- 可攻击点 / 脆弱点:端到端预取增益有限,多租户未测。
KV 内容缩减
FlexiCache-MLSys26
- 路线与角色:KV 内容缩减;扩展。
- 证据等级:完整论文页。
- 做了什么:利用注意力头时间稳定性分级保存 KV。
- 没做什么:不管理专家或共同带宽。
- 关键观察:不同头的重要性与稳定性不同。
- 隐含假设:头级特征对请求稳定。
- 可攻击点 / 脆弱点:任务切换可能改变稳定性。
Kitty-MLSys26
- 路线与角色:KV 内容缩减;量化扩展。
- 证据等级:完整论文页。
- 做了什么:用低比特 KV 和敏感通道增强降低容量。
- 没做什么:不决定放置或专家预算。
- 关键观察:少数通道对精度更敏感。
- 隐含假设:敏感通道可稳定识别。
- 可攻击点 / 脆弱点:长推理与解码成本可能改变结论。
SkipKV-MLSys26
- 路线与角色:KV 内容缩减;语义淘汰扩展。
- 证据等级:完整论文页。
- 做了什么:按句级冗余跳过或驱逐推理轨迹 KV。
- 没做什么:不处理精确多层 I/O 或专家缓存。
- 关键观察:推理链含重复和非执行性内容。
- 隐含假设:冗余可在线判断且删除不伤结果。
- 可攻击点 / 脆弱点:删除不可逆,难与其他近似共同归因。
MoE-nD-arXiv26
- 路线与角色:KV 内容缩减;多轴转折。
- 证据等级:完整论文页。
- 做了什么:按层选择淘汰与 K/V 量化组合。
- 没做什么:不管理专家,策略主要离线求解。
- 关键观察:不同层对压缩方式敏感度不同。
- 隐含假设:离线质量代理可迁移。
- 可攻击点 / 脆弱点:任务漂移和专家压力会改变预算。
IceCache-arXiv26
- 路线与角色:KV 内容缩减;语义布局扩展。
- 证据等级:完整论文页。
- 做了什么:聚类语义相关词元并结合分页选择。
- 没做什么:不管理专家或通用 SSD 生命周期。
- 关键观察:语义相关性不同于时间连续性。
- 隐含假设:聚类可摊销且代表注意力需求。
- 可攻击点 / 脆弱点:查询变化会导致误选和额外搬运。
共享资源与执行结构
vLLM-SOSP23
- 路线与角色:共享资源;奠基。
- 证据等级:完整论文页。
- 做了什么:分页、按需分配和写时复制 GPU KV。
- 没做什么:CPU 交换是被动机制,不管理专家。
- 关键观察:连续预分配显存利用率低。
- 隐含假设:固定块是合适管理粒度。
- 可攻击点 / 脆弱点:块与慢层 I/O 及语义粒度不匹配。
Prism-OSDI26
- 路线与角色:共享资源;物理页转折。
- 证据等级:完整论文页。
- 做了什么:让多模型权重和 KV 在统一 GPU 页池中伸缩。
- 没做什么:不观察词元级路由或 SSD 共同层。
- 关键观察:活跃模型频繁变化,静态分区与整模切换都浪费。
- 隐含假设:短期负载可测,页重映射便宜。
- 可攻击点 / 脆弱点:同步突发、预测误差和故障未充分评估。
MorphServe-MLSys26
- 路线与角色:共享资源;精度弹性扩展。
- 证据等级:完整论文页。
- 做了什么:流量峰值时降低部分权重精度,为 KV 释放 HBM。
- 没做什么:不是 MoE 专家卸载,KV 仍主要驻留 GPU。
- 关键观察:短时质量退让可换并发。
- 隐含假设:精度切换快且退化可控。
- 可攻击点 / 脆弱点:与 KV 近似同时发生会叠加质量风险。
DeepSeek-V4-arXiv26
- 路线与角色:共享资源;模型侧转折。
- 证据等级:完整论文页。
- 做了什么:以低精度专家和压缩注意力降低两类容量。
- 没做什么:无通用联合卸载策略。
- 关键观察:模型结构可改变系统容量常数。
- 隐含假设:专用布局与精度有高效内核。
- 可攻击点 / 脆弱点:模型特化难外推,需求反弹可能吃满 HBM。
fabric-lib-MLSys26
- 路线与角色:共享资源;传输原语扩展。
- 证据等级:完整论文页。
- 做了什么:为 KV、权重与专家分发提供可靠无序点对点传输。
- 没做什么:不决定搬什么,也不覆盖本地 SSD 竞争。
- 关键观察:动态非均匀状态不适合固定集合通信。
- 隐含假设:上层提供正确对象和生命周期。
- 可攻击点 / 脆弱点:取消、内存注册与故障仍留给上层。
EventTensor-MLSys26
- 路线与角色:共享资源;执行抽象扩展。
- 证据等级:完整论文页。
- 做了什么:以事件张量表达数据依赖的 MoE 动态巨型内核。
- 没做什么:不管理慢层或专家—KV 容量。
- 关键观察:部分 MoE 开销来自 GPU 内同步和发射。
- 隐含假设:事件依赖可由编译器有效生成。
- 可攻击点 / 脆弱点:外部 I/O 尚未进入事件抽象。
MoEBlaze-MLSys26
- 路线与角色:共享资源;中间状态反例。
- 证据等级:完整论文页。
- 做了什么:避免训练中按专家物化路由缓冲。
- 没做什么:不处理推理 KV 或权重卸载。
- 关键观察:MoE 内存墙还来自中间状态。
- 隐含假设:融合执行保持正确高效。
- 可攻击点 / 脆弱点:对推理联合预算仅为间接证据。
BatchLLM-MLSys26
- 路线与角色:共享资源;离线调度扩展。
- 证据等级:完整论文页。
- 做了什么:用全局前缀树和内存中心批处理最大化 KV 复用。
- 没做什么:不处理在线专家失配和交互 SLO。
- 关键观察:全批可见时全局计划优于局部淘汰。
- 隐含假设:请求集合可提前获知。
- 可攻击点 / 脆弱点:在线到达和 MoE 路由破坏全局可见性。
DistCA-MLSys26
- 路线与角色:共享资源;解聚扩展。
- 证据等级:完整论文页。
- 做了什么:训练中把无参数注意力拆到独立服务池。
- 没做什么:不是推理 KV 或专家卸载系统。
- 关键观察:注意力与有参数层可分配不同资源。
- 隐含假设:词元任务可动态重批,状态传输可承受。
- 可攻击点 / 脆弱点:逐步解码和尾延迟可能不适用。
外部证据
产业实现:NVIDIA Dynamo KVBM
- 路线与角色:KV 分层传输;产业实现。
- 证据等级:官方文档。
- 做了什么:提供主存、磁盘、对象存储 KV 层级与事件配置。
- 没做什么:不管理 MoE 专家。
- 关键观察:下层过小会持续卸载并抖动。
- 隐含假设:KV 块事件足以驱动策略。
- 可攻击点 / 脆弱点:专家仍由另一套记账管理。
产业提案:vLLM 增量式专家卸载 RFC
- 路线与角色:专家异构执行;产业候选。
- 证据等级:公开 RFC,非稳定论文结果。
- 做了什么:提出 CPU 固定内存、GPU 专家缓存和异步加载。
- 没做什么:无成熟生产评测或联合 KV 控制器。
- 关键观察:动态专家缓存需进入引擎内存记账。
- 隐含假设:跨层预测可把失配降到可隐藏范围。
- 可攻击点 / 脆弱点:与 KV profiler 分离会造成错误预算。
外部论文:Tutti
- 路线与角色:KV 分层传输;外部转折。
- 证据等级:外部论文全文线索。
- 做了什么:以 GPU 原生对象和 GPU 发起 I/O 改造 SSD KV 路径。
- 没做什么:不管理专家权重。
- 关键观察:碎片对象和 CPU 发起 I/O 无法吃满 SSD。
- 隐含假设:GPU 控制路径与大对象可摊销。
- 可攻击点 / 脆弱点:专家页共用 SSD 与 GPU 控制资源时收益未知。