深度调研(Probe):异构小集群上的多模型智能体服务
阅读提示
- 状态驻留(state residency):决定模型权重、键值缓存(key-value cache,KV cache)和混合专家模型(mixture of experts,MoE)的专家权重留在图形处理器(graphics processing unit,GPU)、主机内存还是固态硬盘。
- 模型切换延迟:一次智能体交接到另一模型后,从发出请求到新模型可开始服务所增加的等待;它包含权重恢复、缓存恢复、执行引擎重配置和排队。
- 热目录与冷目录:热目录只有少量频繁使用且会轮流变热的模型;冷目录包含大量极少调用的长尾模型。两者需要不同的共享策略。
- 首个词元时间(time to first token,TTFT)与每输出词元时间(time per output token,TPOT):前者衡量开始响应的等待,后者衡量连续生成速度。
- 服务等级目标(service-level objective,SLO):系统承诺满足的延迟、吞吐或可用性边界;本主题重点是交互式尾延迟,而非只看平均吞吐。
- 多层存储:GPU 高带宽内存(high-bandwidth memory,HBM)、主机动态随机存取存储器和固态硬盘组成容量更大但访问更慢的层级。
一页结论
- 现有工作形成六条路线:长尾模型池化、键值状态分层、单模型弹性、异构放置、混合专家权重卸载,以及智能体程序编排。每条路线都优化了一个局部对象,却没有统一回答“下一次模型交接前应保留哪类状态”。
- 2025 年的主线是把多模型共享和键值缓存从单引擎内部提升到跨模型或跨存储层;2026 年转向混合专家模型、异构设备和模型架构共同设计,但评测仍主要来自同构大集群或单用户设备。
- 最显著的共同缺陷是:18/18 篇核心工作都没有覆盖“约 10–20 张异构 GPU、少量热模型、多个有状态智能体会话”这一组合;18/18 都没有统一管理权重、键值状态和专家权重;15/18 没有把模型切换尾延迟作为独立指标。
- 关键争议不是“卸载是否有效”,而是何时应保留状态、何时重算,以及跨 GPU 传隐藏状态能否在只有 PCIe 的异构小集群中被隐藏。
- 提案前最需要取得真实智能体调用轨迹,并在同一硬件上测出权重恢复、键值状态恢复、专家缺页和重算的交叉点;没有这些数据,统一调度器只是在替未知工作负载优化。
范围与证据
本调研关注约 10–20 张异构 GPU 服务 5–8 个常用模型、约 10 名研发人员的智能体工作流。模型会在同一会话中交接,因而权重、键值状态和专家缓存会同时存活。纳入的 18 篇 wiki 论文全部有全文证据;它们来自 AI-Infra、Agent-Systems、LLM-Inference、KV-Cache 和 MoE 的第一层关联页。训练调度、联邦模型组装和模型架构论文只在能揭示异构放置或状态切换机制时作为边界证据。
外部检索补充了 2026 年的 Coral、多模型卸载与抢占实测 和 NVIDIA Dynamo KV Block Manager。它们没有进入 probed_papers,也没有触发下载或新建 wiki 页。
研究版图
| 研究路线 | 核心问题 | 代表工作 | 当前边界 |
|---|---|---|---|
| 长尾模型池化 | 如何让大量低频模型共享有限 GPU | Aegaeon-SOSP25、Weaver-ATC25、CrossPool-arXiv26 | 依赖模型热度偏斜,未覆盖少量模型轮流变热 |
| 键值状态分层 | 键值状态应保留、迁移还是重算 | LMCache-arXiv25、Jenga-SOSP25、DeepSeek-V4-arXiv26 | 不管理模型权重,版本与所有权契约仍弱 |
| 单模型弹性 | 压力变化时如何改变精度、层数或共置方式 | HELIOS-MLSys26、MorphServe-MLSys26、LLMStation-ATC25 | 默认一个基础模型或同构 GPU,切换不是主对象 |
| 异构放置 | 模型、任务和执行阶段应放在哪类 GPU | BOUTE-MLSys26、HetRL-MLSys26、AssyLLM-ATC25 | 多为离线规划、训练或边端组装,缺在线有状态服务 |
| 混合专家驻留 | 专家权重如何与键值状态争用 HBM | MOE-INFINITY-arXiv24、KTransformers-SOSP25、FluxMoE-arXiv26、MoE-Serving-Tax-MLSys26 | 大多按单模型局部性设计,跨模型干扰未知 |
| 智能体程序编排 | 如何利用会话依赖、工具等待和多模型流水 | Pie-SOSP25、FlashAgents-MLSys26 | 假定底层模型已就绪,不决定状态驻留 |
分类依据是系统首先试图控制的对象,而不是论文所属会议或模型类型。六条路线在目标场景中会同时发生:编排器决定下一次调用,放置器选择设备,状态管理器决定保留什么,弹性机制再处理瞬时压力。当前系统之间缺少的正是这四层共享的状态与代价契约。
时间脉络
总体阶段
单模型或单用户卸载 → 长尾多模型共享 → 键值状态成为跨层数据 → 模型与部署共同规划 → 权重、键值状态和专家权重开始争用同一预算
长尾模型池化
- 2025 — Aegaeon-SOSP25:从请求级部署转向词元级抢占与扩缩容,证明长请求中途也能回收 GPU,但场景是数十至数百个长尾模型。
- 2025 — Weaver-ATC25:不再整体切换模型,而把热模型的注意力与键值状态放到冷模型 GPU,优化单位从模型变成算子。
- 2026 — CrossPool-arXiv26:进一步把混合专家模型的注意力和前馈权重拆成两个 GPU 池,首次直接利用跨模型键值峰值不同步,但仍不进入主机或固态硬盘层。
键值状态分层
- 2025 — LMCache-arXiv25:将键值状态提升为跨 GPU、主机、固态硬盘和远端存储的一等数据对象,改变了“缓存只能属于单引擎”的边界。
- 2025 — Jenga-SOSP25:说明不同注意力机制需要逐层布局,统一分页并不总是正确;状态管理开始感知模型内部结构。
- 2026 — DeepSeek-V4-arXiv26:模型架构直接产生压缩块、滑动窗口和磁盘前缀等异构键值状态,表明运行时不能再假定所有模型共享同一种缓存格式。
单模型弹性与异构放置
- 2025 — LLMStation-ATC25:利用服务解码与参数高效微调的资源互补共置任务,但要求共享基础模型。
- 2026 — MorphServe-MLSys26:把层量化和键值预算变成在线可切换旋钮,弹性从实例数量扩展到模型内部表示。
- 2026 — BOUTE-MLSys26:联合优化模型路由阈值、GPU 类型与并行度,说明“选模型”和“放模型”不能分开决定。
- 2026 — Coral:外部工作把多模型与 20 种异构 GPU 配置联合求解,但仍以云成本和吞吐需求为中心,没有会话状态驻留。
混合专家驻留
- 2024 — MOE-INFINITY-arXiv24:在个人设备上利用请求内专家局部性,把冷专家放到固态硬盘,确立单用户专家缓存路线。
- 2025 — KTransformers-SOSP25:让 GPU 负责注意力和热专家、CPU 执行多数专家,转折点是从“缓存未命中”变成异构协同执行。
- 2026 — FluxMoE-arXiv26:用分页张量在 HBM 中移动专家窗口,并把释放空间交给键值状态,首次显式处理两类状态的容量竞争。
- 2026 — MoE-Serving-Tax-MLSys26:通过测量指出解码阶段常由权重放大主导,修正了“稀疏激活自然节省服务成本”的直觉。
智能体程序编排
- 2025 — Pie-SOSP25:把嵌入、前向、采样和键值操作暴露为应用可编排动作,使智能体不再被单次补全接口约束。
- 2026 — FlashAgents-MLSys26:利用多智能体依赖中的空闲窗口重叠预填充,说明调用图可指导执行;但没有把调用图用于权重或缓存预取。
各类工作的演化
长尾模型池化
共同目标:在模型目录远大于 GPU 数量时,回收低频模型闲置的算力与显存。
演化与分歧:Aegaeon 以词元级抢占改变实例数量;Weaver 固定热冷角色并远端执行注意力;CrossPool 为冷混合专家模型建立权重池和键值池。三者依次把共享粒度从实例缩小到算子和状态类型。
共同边界:三篇都依赖明显的热度偏斜。5–8 个模型都频繁参与智能体工作流时,冷 GPU 不再稳定存在,跨模型峰值也可能近似相加。
相关工作:Aegaeon-SOSP25、Weaver-ATC25、CrossPool-arXiv26
键值状态分层
共同目标:避免长上下文和重复前缀把 HBM 变成唯一容量瓶颈。
演化与分歧:LMCache 提供跨层存取接口;Jenga 依据逐层注意力结构分配缓存;DeepSeek-V4 从模型侧压缩和持久化不同键值状态。前者强调通用中间件,后两者强调布局必须感知模型结构。
共同边界:三篇都把模型权重视为外部条件。多模型切换时,缓存命中可能没有价值,因为新模型的权重尚未就绪;缓存版本与模型、分词器、量化和位置语义也缺统一失效契约。
相关工作:LMCache-arXiv25、Jenga-SOSP25、DeepSeek-V4-arXiv26
单模型弹性
共同目标:在负载变化时通过改变模型表示或共置方式,延后显存不足和 SLO 违约。
演化与分歧:LLMStation 利用解码与微调的资源互补;HELIOS 部分加载具有提前退出头的模型;MorphServe 在运行时切换层量化并调整键值预算。它们分别依赖共享基础模型、专门训练的提前退出结构和离线敏感度。
共同边界:这些旋钮的切换成本和质量边界都按单模型测量。多个模型同时改变表示时,编译缓存、量化副本和显存碎片会形成新的全局状态。
相关工作:LLMStation-ATC25、HELIOS-MLSys26、MorphServe-MLSys26
异构放置与模型组装
共同目标:利用不同设备在容量、算力、价格和带宽上的差异。
演化与分歧:BOUTE 联合路由和离线部署;HetRL 为多模型强化学习流程搜索异构任务放置;AssyLLM 在边端设备按内存预算交换预训练块。三者证明孤立的单模型放置不足,但服务状态和用户会话不是其优化对象。
共同边界:离线剖析默认硬件和负载在重规划周期内稳定;频繁模型交接会让装载成本、PCIe 拓扑和残留状态改变下一步最优解。
相关工作:BOUTE-MLSys26、HetRL-MLSys26、AssyLLM-ATC25
混合专家权重卸载
共同目标:利用每个词元只激活少量专家的结构,在有限 HBM 中服务总参数量很大的模型。
演化与分歧:MOE-INFINITY 依赖单请求局部性做固态硬盘缓存;KTransformers 让 CPU 直接执行大部分专家;FluxMoE 在 GPU 中滑动分页窗口;MoE-Serving-Tax 不提出调度器,而是测量专家小批次、通信和权重放大的真实代价。
共同边界:缓存与热度预测主要在单模型内成立。两个混合专家模型交错时,专家命中率、磁盘队列和 PCIe 带宽会相互污染。
相关工作:MOE-INFINITY-arXiv24、KTransformers-SOSP25、FluxMoE-arXiv26、MoE-Serving-Tax-MLSys26
智能体程序编排
共同目标:利用多步工具调用和多模型依赖中的并行机会,避免把智能体程序降成相互独立的补全请求。
演化与分歧:Pie 提供应用级推理操作接口;FlashAgents 从调用图发现流式预填充重叠。前者更可编程,后者更专注性能。
共同边界:两者都假定目标模型已经可执行。调用图虽能预测下一模型,却尚未驱动权重、键值状态或专家页预取。
相关工作:Pie-SOSP25、FlashAgents-MLSys26
跨工作共同缺陷
| 共同缺陷 | 覆盖范围 | 为什么是系统性问题 | 已有缓解与剩余缺口 |
|---|---|---|---|
| 缺少三类状态的统一预算 | 18/18 篇;六条路线 | 权重、键值状态和专家权重争用同一 HBM 与 PCIe,但各控制器只观察自己的命中率或 SLO | CrossPool 与 FluxMoE 各联合两类状态;仍没有跨模型、跨层级的统一所有权与仲裁 |
| 目标场景证据缺失 | 18/18 篇未覆盖“异构小集群、少量热模型、有状态智能体会话”的完整组合 | 长尾云流量、单用户本地推理和训练流程会产生完全不同的同时活跃集合 | BOUTE、HetRL 和 AssyLLM 覆盖异构的一部分;Pie、FlashAgents 覆盖智能体调用的一部分,二者没有交叉 |
| 模型切换不是一等指标 | 15/18 篇未独立报告模型交接的 P95/P99 延迟 | TTFT 会把排队、权重装载和缓存恢复混在一起,无法解释状态策略为何成功或失败 | Aegaeon 报告抢占扩缩成本,AssyLLM 报告块交换,LMCache 测缓存搬运;均不是完整模型交接 |
| 静态热度或离线剖析容易失效 | 11/18 篇直接依赖固定热冷角色、离线敏感度或稳定代价模型 | 研发人员按编码、审查和推理阶段切模型,小时级漂移会反转放置与保留决策 | Aegaeon 和 MorphServe 提供在线调整;缺少带切换成本与迟滞的跨状态重规划 |
| 异构互连证据不足 | 12/18 篇只测同构 GPU、单设备或不含服务关键路径 | NVLink 上可隐藏的逐层传输,在 PCIe、跨 NUMA 或不同算力 GPU 上可能暴露为尾延迟 | KTransformers 与 AssyLLM 证明异构执行可行;外部 Coral 覆盖 GPU 类型,但不管理会话状态 |
关键争议
保留状态还是重新计算
LMCache 与 DeepSeek-V4 倾向持久化长前缀;短输入和低复用时,读取、校验和布局转换可能比重新预填充更慢。争议应由上下文长度、复用距离、链路带宽和新模型是否已驻留共同条件化,不能只给全局命中率。
GPU 内分解还是跨存储层卸载
CrossPool 通过全 GPU 双池避免慢层访问;MOE-INFINITY、KTransformers 和 LMCache 以主机或固态硬盘换容量。前者受总 HBM 硬上限约束,后者受切换尾延迟和双重缺页约束。小集群的正确答案可能是只对部分模型和部分状态卸载,而非二选一。
热冷角色是否足够稳定
Aegaeon、Weaver 和 CrossPool 的生产动机来自长尾目录;目标场景的模型少但会随任务阶段轮流变热。若热度稳定,池化可直接回收闲置资源;若热度转移快于重配置周期,频繁搬运会比静态预留更差。
跨 GPU 传隐藏状态能否被隐藏
CrossPool 与 Weaver 在同构高速互连上证明算子分解可行;异构 PCIe 集群中,弱卡的计算时间和链路拓扑可能同时扩大流水气泡。这个争议不能用总带宽回答,必须测逐层暴露延迟和 P99 阻塞。
产业实践与学术缺口
- NVIDIA Dynamo 已把键值感知路由、解聚服务、自动扩缩和多引擎适配组合成生产框架;其 KV Block Manager 覆盖主机、远端和固态硬盘层,但公开文档仍把模型权重与专家驻留交给引擎或部署器。
- vLLM 与 SGLang 已形成事实上的单模型执行底座;多模型通常依靠多个实例、模型路由器或外部编排,因此缺少集群级状态账本。
- DwarfStar 展示面向单用户编码智能体的磁盘键值检查点和专家流式装载,证明“会话恢复”有实际价值;它没有多租户、异构集群和全局 SLO。
- Coral 以及多模型卸载与抢占实测开始直接研究异构多模型服务。前者联合求解模型副本与服务策略,后者发现抢占常由模型状态重载而非键值搬运主导;两者仍未利用智能体调用图和会话所有权。
- 工业系统公开的通常是吞吐、成本或 TTFT 改善,较少公开模型切换矩阵、缓存版本失效、租户公平和故障恢复。这使小团队难以判断复杂控制面的运维成本是否值得。
候选空白
- 跨权重、键值状态与专家权重的统一驻留账本。 该空白来自“缺少三类状态统一预算”。现有系统没有统一记录对象大小、恢复成本、可重算性、版本、所有者和下一次使用概率。
- 把模型交接作为显式 SLO。 该空白来自模型切换指标缺失。现有 TTFT 无法区分模型已热、仅键值命中或整套状态冷启动。
- 由智能体调用图驱动的状态预取。 Pie 与 FlashAgents 已知道程序依赖,状态系统却仍按历史命中率预测;尚缺把下一模型及会话阶段转成预取期限和取消条件的接口。
- 异构互连下的部分分解。 CrossPool 和 Weaver 默认高速同构互连;尚缺根据 GPU 对、层类型和实时拥塞决定只分解部分层或部分请求的策略。
- 热目录的降级式准入。 冷目录系统可以下线极冷模型;热目录更需要把模型从完整驻留降为量化权重、主机权重或磁盘快照,同时保留可预测的恢复边界。
- 状态策略的故障与版本语义。 模型、分词器、量化格式和运行时升级后,哪些缓存与专家页可以复用、半搬运对象如何恢复,现有论文缺少共同状态机。
关键未知与测量
- 模型目录究竟有多热? 记录两周
(用户, 会话, 模型, 输入/输出词元, 时间),测同时活跃模型数、切换矩阵和热度半衰期;若大多数时间只有一个模型活跃,联合调度价值会被推翻。 - 不同状态的恢复交叉点在哪里? 在每种 GPU 和链路上分别测权重从主机或固态硬盘恢复、键值读取、专家缺页和重新计算的 P50/P95;扫上下文长度和量化格式,找出保留优于重算的边界。
- 状态优先级是否应按会话而非模型计算? 重放同一模型频率但不同会话结构的轨迹,比较最近最少使用、模型热度和会话下一跳预测;指标为切换 P99、SLO 违约和无效搬运字节。
- PCIe 异构性会否击穿算子分解? 在 NVLink 同构、同节点 PCIe 和跨 NUMA 三种拓扑上测逐层隐藏状态传输的暴露比例;若分解后 P99 始终高于整体迁移,部分分解假设不成立。
- 键值与专家同时缺页时谁先服务? 构造两个混合专家模型交错且上下文增长的轨迹,测共享 PCIe/固态硬盘队列下的命中率、首词元时间和每词元时间;比较独立控制器与联合队列。
- 在线重规划多久一次才划算? 注入分钟级和小时级热度漂移,扫重规划周期与迟滞阈值;报告规划时间、搬运字节、反转次数和净 SLO 收益。
- 小团队真正接受什么延迟? 将阻塞式工具调用、交互式编码和后台研究分开访谈并测量,得到每类任务的 P95/P99 TTFT、TPOT 和切换预算;若任务可容忍秒级切换,复杂 GPU 内分解可能没有必要。
覆盖缺口
- 外部 Coral 和多模型卸载实测只有外链证据,尚无 wiki 论文页;本次未启用
--ingest-missing。 - 没有公开的“5–8 个模型、10 名研发人员、跨模型有状态会话”轨迹;现有生产数据来自大模型市场,目标工作负载仍属待测假设。
- DwarfStar 是持续演化的实体页而非同行评审论文,其磁盘键值和专家流式结论只能作为实现线索。
- NVIDIA Dynamo 的公开文档能证明接口和支持矩阵,不能证明统一状态策略在小集群上的收益。
- 18 篇核心工作虽均有全文页,但 CrossPool、HELIOS、BOUTE、FluxMoE、MoE-Serving-Tax 与 AssyLLM 的 wiki 复核状态仍为
needs-review;关键数字在形成 proposal 前应回原始 Markdown 或 PDF 再核一次。
附录:逐篇证据卡
长尾模型池化
Aegaeon-SOSP25
- 路线与角色:长尾模型池化;奠基。
- 证据等级:complete/full-text。
- 做了什么:以词元级抢占、组件复用和键值交换实现模型市场的快速扩缩容。
- 没做什么:未覆盖少量热模型、异构 GPU 和跨引擎通用实现。
- 关键观察:94.1% 模型仅承载 1.35% 请求,朴素抢占却会因状态交换耗时数十秒。
- 隐含假设:市场热度长期偏斜,且逐词元 SLO 能代表用户体验。
- 可攻击点 / 脆弱点:用热目录轨迹重放后,抢占频率和模型状态重载可能抵消池化收益。
Weaver-ATC25
- 路线与角色:长尾模型池化;算子级扩展。
- 证据等级:complete/full-text。
- 做了什么:把热模型的注意力和键值状态卸载到低负载模型 GPU,扩大热模型批量。
- 没做什么:未实现集群级热度重配、跨节点和异构 GPU 放置,也不迁移权重。
- 关键观察:OpenRouter 前 5% 模型占 74.8% 词元,冷模型在 1 QPS 时显存利用率仅 43%。
- 隐含假设:热冷角色稳定,远端注意力通信能被同节点高速互连承受。
- 可攻击点 / 脆弱点:模型轮流变热或只有 PCIe 时,远端键值会与本地请求争用显存和队列。
CrossPool-arXiv26
- 路线与角色:长尾模型池化;状态分解转折。
- 证据等级:needs-review/full-text。
- 做了什么:把冷混合专家模型的注意力与键值状态放入共享池,把前馈权重放入另一 GPU 池。
- 没做什么:权重不离开 GPU;未覆盖异构互连、热目录和智能体交接。
- 关键观察:低请求率时多个冷模型的键值峰值不同步,合并需求小于各自峰值之和。
- 隐含假设:五张同构 A100 的 NVLink 足以隐藏逐层隐藏状态传输。
- 可攻击点 / 脆弱点:少量热模型会让键值需求近似相加,PCIe 与算力不匹配会扩大流水气泡。
键值状态分层
LMCache-arXiv25
- 路线与角色:键值状态分层;中间件奠基。
- 证据等级:complete/full-text。
- 做了什么:提供跨 GPU、主机、固态硬盘和远端存储的键值状态查找、固定与搬运接口。
- 没做什么:不管理模型权重或专家,也不决定跨模型交接。
- 关键观察:企业持久键值数据可达数十 TB,小块输入输出无法打满存储带宽。
- 隐含假设:前缀复用和长上下文足以摊销查找、传输与格式转换。
- 可攻击点 / 脆弱点:短轮次、低复用或模型未驻留时,读取缓存可能慢于重新预填充。
Jenga-SOSP25
- 路线与角色:键值状态分层;模型结构感知扩展。
- 证据等级:complete/full-text。
- 做了什么:按层管理不同注意力机制的缓存布局和前缀复用。
- 没做什么:不处理多模型权重切换和异构 GPU 集群。
- 关键观察:统一的逐层分页在异构注意力模型上可造成 2.16 倍吞吐损失。
- 隐含假设:层属性静态可知,单模型规划足以决定缓存布局。
- 可攻击点 / 脆弱点:多个模型拥有不同布局时,共享池会增加碎片、转换和版本失效成本。
DeepSeek-V4-arXiv26
- 路线与角色:键值状态分层;模型侧转折。
- 证据等级:complete/full-text。
- 做了什么:通过压缩注意力、滑动窗口和磁盘前缀形成多种键值状态,并为长程智能体保留推理轨迹。
- 没做什么:不提供跨模型、跨 GPU 的统一运行时驻留调度器。
- 关键观察:1M 上下文迫使模型架构与磁盘缓存共同设计,单一键值格式不再足够。
- 隐含假设:专用压缩布局和运行时集成成本能被长上下文收益摊销。
- 可攻击点 / 脆弱点:多模型混部时,不同缓存格式会增加适配、失效和数据搬运成本。
单模型弹性
HELIOS-MLSys26
- 路线与角色:单模型弹性;部分加载扩展。
- 证据等级:needs-review/full-text。
- 做了什么:利用多个提前退出模型的互补退出分布,按需部分加载层以释放显存。
- 没做什么:不适用于没有提前退出头的普通模型,也未测异构 GPU 和切换尾延迟。
- 关键观察:单个提前退出模型仍需保留最坏路径,多模型互补才产生显存收益。
- 隐含假设:在线质量守卫可靠,工作负载在重规划间隔内稳定。
- 可攻击点 / 脆弱点:补层和候选剖析会在 P99 上形成尖峰,标准前沿模型无法直接采用。
MorphServe-MLSys26
- 路线与角色:单模型弹性;在线表示转折。
- 证据等级:complete/full-text。
- 做了什么:在运行时切换层量化并调整键值预算,以减少突发负载下的 SLO 违约。
- 没做什么:只研究单模型和同构 GPU,不处理多模型状态冲突。
- 关键观察:固定量化在压力变化时要么浪费显存,要么永久牺牲质量。
- 隐含假设:离线层敏感度能迁移到在线负载,变形成本可被收益摊销。
- 可攻击点 / 脆弱点:多个模型同时变形会争用带宽,弱 GPU 上的切换成本可能超过缓解收益。
LLMStation-ATC25
- 路线与角色:单模型弹性;共置扩展。
- 证据等级:complete/full-text。
- 做了什么:在迭代粒度共置参数高效微调与服务,利用计算和内存瓶颈互补。
- 没做什么:要求共享基础模型,不是多个基础模型的状态池。
- 关键观察:解码偏内存受限,微调偏计算受限,二者可在服务余量内互补。
- 隐含假设:服务有足够 SLO 余量,适配器共享基础权重。
- 可攻击点 / 脆弱点:多基础模型智能体栈没有权重共享,切换会破坏互补关系。
异构放置与模型组装
BOUTE-MLSys26
- 路线与角色:异构放置;联合规划转折。
- 证据等级:needs-review/full-text。
- 做了什么:以多目标贝叶斯优化联合选择模型路由阈值、GPU 类型、数量和张量并行度。
- 没做什么:主要评测两个模型的离线规划,不管理会话键值和模型恢复。
- 关键观察:路由会改变负载,部署会改变路由收益,分开优化可使 P95 相差超过 10%。
- 隐含假设:离线剖析代表在线,云价格和工作负载在规划周期内稳定。
- 可攻击点 / 脆弱点:5–8 模型的调用图会扩大搜索空间,小时级偏好漂移会使静态计划过期。
HetRL-MLSys26
- 路线与角色:异构放置;多模型工作流边界证据。
- 证据等级:complete/full-text。
- 做了什么:在异构 GPU 上联合规划四模型、六任务的强化学习训练流程。
- 没做什么:研究训练而非在线服务,没有键值状态和模型切换 SLO。
- 关键观察:把单模型异构调度直接扩展到多模型流程会使搜索慢 1000–10000 倍。
- 隐含假设:静态代价模型和离线计划可代表长时间训练。
- 可攻击点 / 脆弱点:在线服务的状态与到达随机性会让训练式静态规划更难迁移。
AssyLLM-ATC25
- 路线与角色:异构放置;边端状态交换对照。
- 证据等级:needs-review/full-text。
- 做了什么:在内存受限客户端交换和组装异构预训练块,并用流水化降低输入输出开销。
- 没做什么:面向联邦微调和短问答,不是生成式多模型在线服务。
- 关键观察:五模型块池可达 42.2 GB,混合精度和预交换是低内存设备参与的前提。
- 隐含假设:块兼容性与离线敏感度可跨轮次稳定,少量适配器足以修复语义差异。
- 可攻击点 / 脆弱点:开放式生成的跨块合法性、版本一致性和尾延迟尚未验证。
混合专家权重卸载
MOE-INFINITY-arXiv24
- 路线与角色:混合专家驻留;单用户卸载奠基。
- 证据等级:complete/full-text。
- 做了什么:利用单请求专家局部性,把冷专家放在固态硬盘并缓存热专家。
- 没做什么:明确不覆盖云端连续批处理和多用户并发。
- 关键观察:单请求只反复访问少量专家,稀疏缓存可显著改善每输出词元时间。
- 隐含假设:个人设备的固态硬盘带宽和请求级局部性足够稳定。
- 可攻击点 / 脆弱点:多个模型和多个用户交错会扩大工作集并摧毁缓存命中率。
KTransformers-SOSP25
- 路线与角色:混合专家驻留;异构执行转折。
- 证据等级:complete/full-text。
- 做了什么:让 GPU 执行注意力和热专家,让支持 AMX 的 CPU 执行大部分专家。
- 没做什么:不是通用多模型服务,也未处理全局状态预算。
- 关键观察:低并发解码下专家矩阵向量乘法可由强 CPU 承担,从而避免频繁权重搬运。
- 隐含假设:CPU、内存带宽和 NUMA 拓扑足以支撑专家执行,注意力与键值状态应留在 GPU。
- 可攻击点 / 脆弱点:CPU 较弱或多模型争用主机带宽时,固定切分点会失效。
FluxMoE-arXiv26
- 路线与角色:混合专家驻留;权重与键值竞争转折。
- 证据等级:needs-review/full-text。
- 做了什么:以分页张量和滑动窗口管理专家权重,把释放的 HBM 分给键值状态。
- 没做什么:未研究多个模型共同分页和异构小集群。
- 关键观察:专家权重和键值状态争用同一 HBM,静态分区会浪费容量。
- 隐含假设:未来专家访问能由窗口覆盖,缺页代价可被流水隐藏。
- 可攻击点 / 脆弱点:跨模型交错会扩大专家工作集,使窗口预测和键值保留同时失效。
MoE-Serving-Tax-MLSys26
- 路线与角色:混合专家驻留;测量与反例。
- 证据等级:needs-review/full-text。
- 做了什么:以浮点运算量对齐的稠密模型为基线,分解混合专家服务的真实税负。
- 没做什么:不实现自动放置器,也不管理模型质量。
- 关键观察:解码税常由权重放大主导,可达稠密基线的 2–3 倍;极小批量又可能接近 1 倍。
- 隐含假设:三种代表架构和微基准分解能预测目标部署。
- 可攻击点 / 脆弱点:硬件、批量、路由偏斜和解聚方式变化后,税负必须重新标定。
智能体程序编排
Pie-SOSP25
- 路线与角色:智能体程序编排;可编程接口奠基。
- 证据等级:complete/full-text。
- 做了什么:以 WebAssembly 推理程序编排嵌入、前向、采样和键值操作,表达工具循环和树搜索。
- 没做什么:不解决集群级显存预算、模型权重放置或多层状态恢复。
- 关键观察:固定预填充—解码接口无法表达应用级键值分配、驱逐和控制流。
- 隐含假设:推理程序粒度足以覆盖主流智能体模式,额外调度开销可接受。
- 可攻击点 / 脆弱点:细粒度程序会切碎批处理,且没有底层状态调度器时无法缓解冷模型等待。
FlashAgents-MLSys26
- 路线与角色:智能体程序编排;调用图性能扩展。
- 证据等级:complete/full-text。
- 做了什么:在多智能体依赖中流式重叠预填充,并复用轮次内前缀。
- 没做什么:不管理跨存储层状态、模型冷启动和跨机模型交接。
- 关键观察:顺序依赖会留下 GPU 空闲,8B 到 32B 的异构模型链能扩大重叠窗口。
- 隐含假设:智能体共置且因果注意力允许增量预填充,目标模型已驻留。
- 可攻击点 / 脆弱点:跨节点和模型未就绪时,权重恢复会吞掉预填充重叠收益。
外部证据卡
异构多模型服务:Coral
- 路线与角色:异构放置;外部当前前沿。
- 证据等级:abstract-only。
- 做了什么:联合优化多个模型在异构云 GPU 上的资源分配和副本服务策略。
- 没做什么:摘要未显示其管理跨模型会话键值、专家状态或模型交接期限。
- 关键观察:六个模型和二十种 GPU 配置下,异构资源可改善成本与稀缺资源时的有效吞吐。
- 隐含假设:两阶段分解能在需求变化速度内完成在线求解,云成本是主要目标。
- 可攻击点 / 脆弱点:小集群中固定硬件、会话状态和切换尾延迟可能改变最优策略。
多模型调度实测:Towards Multi-Model LLM Schedulers
- 路线与角色:长尾模型池化;外部测量反例。
- 证据等级:abstract-only。
- 做了什么:测量不同模型和硬件上的部分 CPU–GPU 卸载与抢占成本。
- 没做什么:摘要未给出智能体调用图驱动或统一三状态调度器。
- 关键观察:卸载退化非线性且依赖模型;抢占开销常由模型状态重载而非键值传输主导。
- 隐含假设:选取的平台和模型能代表异构多模型部署。
- 可攻击点 / 脆弱点:需要用目标集群和真实会话重放复核交叉点,不能直接外推摘要结论。
NVIDIA 的键值状态管理组件:Dynamo KV Block Manager
- 路线与角色:键值状态分层;产业实现。
- 证据等级:官方产品文档。
- 做了什么:为推理框架提供跨主机、远端和固态硬盘的键值块生命周期与传输接口。
- 没做什么:公开支持矩阵没有统一管理模型权重、专家驻留和智能体会话交接。
- 关键观察:工业运行时需要把键值块的分配、注册、匹配和事件状态从单个引擎中拆出。
- 隐含假设:引擎适配器和数据传输层能保持块格式、版本与所有权一致。
- 可攻击点 / 脆弱点:文档证明接口存在,不证明小集群上的命中收益、尾延迟和故障恢复效果。