HandoffLease:用智能体调用图为异构小集群预约模型交接
当模型热度因智能体执行阶段而反转时,调用图若能在请求到达前发布有期限、版本和取消语义的交接租约,状态层就可能比历史热度策略更早准备真正阻塞执行的状态。
阅读提示
- 图形处理器(graphics processing unit,GPU):执行模型计算并保存热状态的加速设备。
- 模型交接(model handoff):同一有状态会话从一个模型转到另一个模型;本提案单独测量从交接意图产生到目标模型可开始执行的延迟。
- 交接租约(handoff lease):智能体运行时发布的可撤销提示,描述候选模型、最早可行动时间、必须就绪时间、状态版本和取消条件;它不是执行承诺。
- 准备迟到(preparation lateness):目标请求到达时仍需同步等待的状态恢复时间。
- 无效搬运:因分支取消、版本失效或目标变化而未被使用的预取字节。
- 键值缓存(key-value cache,KV cache):属于具体会话、模型和状态版本的注意力中间状态,不能与模型参数合并计数。
- 第 95 与第 99 百分位(P95/P99)延迟:分别表示 95% 与 99% 请求不超过的延迟,用来观察尾部慢请求。
- 服务等级目标(service-level objective,SLO):系统承诺满足的延迟或可用性边界。
- 外围组件互连高速总线(Peripheral Component Interconnect Express,PCIe):GPU 与主机或其他设备搬运状态的常见链路。
- 非统一内存访问(non-uniform memory access,NUMA):处理器访问不同内存域的延迟和带宽不相同;它会改变主机到 GPU 的恢复时间。
- vLLM 与 SGLang:两个开源大语言模型推理引擎,本提案用它们验证交接租约能否脱离单一实现工作。
基础或共享参数与混合专家模型(Mixture of Experts,MoE)的路由专家参数都是模型参数,但记账集合互斥;专家页不得再次计入基础参数。键值缓存是会话状态,单独记账和验证版本。
1. 为什么这是个好问题
1.1 问题与代表工作负载
目标场景是约 10–20 张异构 GPU 服务少量常用模型的研发集群。它目前没有公开生产轨迹支撑,因此本提案定位为先测量、后决定是否实现,不把实验脚手架冒充生产分布。
第一组公开代表场景采用 SWE-bench Verified 的真实代码仓库修复任务,并固定以下脚手架和模型角色:
- 定位与计划:Llama-3.1-8B-Instruct 阅读问题和检索结果,产出修改计划。
- 补丁生成:Qwen2.5-Coder-32B-Instruct 根据计划生成补丁。
- 测试审查:Mixtral-8x7B-Instruct 阅读测试结果,决定结束或返回补丁生成;最多三轮修复。
交接矩阵在抽取任务子集前固定,模型不得按单个样本动态更换:
| 当前阶段 | 条件 | 下一阶段 | 条件内转移概率 |
|---|---|---|---|
| 定位与计划 | 计划完成 | 补丁生成 | 1 |
| 补丁生成 | 补丁与测试完成 | 测试审查 | 1 |
| 测试审查 | 测试失败且未满三轮 | 补丁生成 | 1 |
| 测试审查 | 测试通过或已满三轮 | 结束 | 1 |
输入上下文分为 4K、16K、64K 词元,角色输出上限分别为 512、2K、1K 词元;并发会话为 1、2、4、8。自然提示在上一步确定下一角色时发布,同时用 0、100 毫秒、500 毫秒、2 秒和 10 秒的受控提前量重放,以分离调用图准确性与可行动时间。
第二组使用相同调用图的打乱轨迹:保持全局模型频率、长度和到达率不变,只破坏会话阶段顺序。它用于检验收益究竟来自调用图,还是目标模型原本就热。若公开基准不能产生足够的跨模型交接,项目只输出负面测量,不修改任务来人为制造优势。
1.2 社区认识及其适用边界
Aegaeon-SOSP25、Weaver-ATC25 等工作证明长尾模型市场可依据历史到达和稳定热冷角色回收资源,但没有声称覆盖智能体阶段变化。本提案的攻击对象限定为更窄的外推:把长尾目录中的历史热度规律直接用于模型少、阶段会反转的智能体工作流。
漂移强度在实验前登记为相邻阶段模型分布的总变差距离,取 0、0.25、0.5 和 0.75;分别注入一步突变,以及跨 10 次和 100 次交接的渐变。每个漂移档位保持完整轨迹的模型边际频率相同,避免把“某模型请求更多”误写成“历史策略不适应阶段”。若历史热度在这些条件下与租约等价,主攻击被推翻。
1.3 核心赌注的证据链
核心证据只使用 complete/full-text 工作。Pie-SOSP25 证明智能体控制流可以暴露为推理操作;FlashAgents-MLSys26 证明调用依赖能产生执行重叠窗口;LMCache-arXiv25 证明状态可在 GPU、主存、固态硬盘与远端之间异步搬运;Aegaeon-SOSP25 证明状态恢复会进入多模型抢占关键路径。它们共同支持“调用图提示值得测量”,不证明 HandoffLease 一定有效。
Coral 和外部多模型卸载测量只有外链证据,不承担核心攻击。CrossPool、FluxMoE 等 needs-review/full-text 工作只界定相邻方向。新颖性仍为中等:公开材料显示调用图与状态层之间缺少共同契约,但不足以声称工业系统没有等价内部机制。
1.4 可证伪假设与决策阈值
主假设:在预登记的阶段漂移下,交接租约比历史热度更早且更准确地指向阻塞状态。
- 适用条件:固定脚手架的跨模型会话、提示能在请求前发布、目标状态不完全驻留、共享 PCIe 或 NUMA 链路存在可测余量。
- 成立时:租约策略相对最近最少使用、模型频率预测和无预取降低 P95/P99 准备迟到,同时满足无效搬运与非租约请求隔离边界。
- 不成立时:提示提前量短于恢复时间、阶段漂移不损伤历史策略、取消造成的搬运耗尽余量,或简单全量预取等价。
- 最小有意义效果(minimum effect size,MES):先由任务访谈和无预取轨迹确定每类任务的交接 SLO;MES 是使至少一个预登记任务类别从交接 SLO 违约变为满足所需的最小 P99 准备迟到下降,不预填任意百分比。
- 功效来源:用独立预实验轨迹做按会话分块的自举模拟,选择能以双侧显著性水平 0.05、功效 0.8 检出 MES 的会话数;正式实验不复用预实验样本。
- 质量等效性:同一模型与确定性解码配置下,租约和无租约基线必须产生逐词元相同的输出;任一差异视为正确性失败。强单模型对照不要求逐词元相同,但其任务成功率的 95% 置信区间下界不得低于专家组合基线的下界;否则“减少交接”不能计为系统收益。
可行动交接定义为报价的 P95 完成时间不晚于 need_by,且准备动作同时满足链路、主存和非租约 SLO 预算。其最低占比不预设常数:在轨迹模拟器中从整体 MES 反推能使 P99 越过 MES 的最小占比,并以 95% 置信区间下界超过该占比作为继续条件。
2. 研究路线与证据边界
2.1 智能体调用图与执行重叠
Pie-SOSP25 说明固定预填充—解码接口不足以表达工具循环;FlashAgents-MLSys26 利用顺序依赖重叠上游解码和下游增量预填充。短输出和高并发会缩小窗口。本提案沿用“控制流提供提前窗口”的观察,但不把它扩大成生产工作负载结论。
2.2 状态分层与多模型池化
LMCache-arXiv25 提供跨 GPU、主存、固态硬盘和远端存储的键值状态接口,并指出短上下文时读取可能慢于重新预填充。Jenga-SOSP25 表明不同注意力结构需要不同键值布局。Aegaeon-SOSP25 和 Weaver-ATC25 利用市场热度进行池化,却不消费会话调用图。
HandoffLease 不重新实现数据面。它让运行时发布期限与取消语义,让引擎分别对基础参数、路由专家参数和键值缓存报价。第一版只把基础参数和键值缓存作为必须端到端实现的状态类型;专家页是可选扩展,不能用它掩盖前两类验证不足。
2.3 模型能力变化的双向压力
评测至少覆盖三个架构与规模不同的模型族:Llama-3.1-8B-Instruct、Qwen2.5-Coder-32B-Instruct 和 Mixtral-8x7B-Instruct;另以 Llama-3.3-70B-Instruct 作为强单模型合并角色的对照。每个配置使用同一 SWE-bench Verified 任务子集和质量门槛。
必须同时检验两个相反趋势:更强单模型可能合并计划、补丁和审查角色,减少交接次数;它也可能因参数和会话状态更大而增加冷恢复代价。报告“每个成功任务的交接次数、总恢复字节、准备迟到和任务成功率”,而不是只按模型代际比较吞吐。若强模型减少的交接足以抵消更大恢复状态,HandoffLease 的适用范围应收窄,不能声称模型进步会放大问题。
2.4 覆盖缺口与新颖性置信度
当前没有目标规模的公开生产轨迹,这是首要缺口。实现前必须补做一次全文检索,检索意图是寻找“智能体运行时向服务层提供提示”“带期限的模型预取”和“推测式模型装载”三类等价契约:
"agent runtime" serving hint model prefetch
deadline-aware model prefetch handoff
speculative model loading agent workflow若发现等价契约,贡献降为公开基准上的异构小集群测量与跨引擎语义验证,不保留新抽象主张。
3. 核心研究问题
研究问题 1:测量阶段漂移与可行动窗口
记录租约发布时间、not_before、need_by、目标请求到达、候选集合、最终目标、状态版本、各类状态缺口和实际恢复时间。真实基准轨迹与保持模型边际频率的打乱轨迹对照;按预登记总变差距离和突变速度分层报告。
在每种 GPU、PCIe/NUMA 路径上分别测基础参数和键值缓存的恢复时间分布;键值缓存另测重新预填充。若调用图没有提高可行动交接占比,或在阶段漂移下不优于历史预测,主假设被推翻。
研究问题 2:最小实现无关租约语义
租约接口不暴露页表、缓存格式或引擎队列,最小语义为:
offer(session, candidates, not_before, need_by, state_version, cancel_token)
quote(lease, object_class, bytes, source, destination)
accept(lease, bounded_plan)
cancel(lease)
commit(lease, request, expected_version)
expire(lease)offer是可撤销提示,不承诺候选一定被调用。quote给出 P95 完成时间、链路字节和驻留字节,不改变可见状态。accept只在预算内预约准备;commit必须验证模型、分词器、量化格式、键值布局和会话版本后才能让请求读取。cancel与expire必须停止未提交工作并幂等回收本租约新增引用;其他请求共享的页不得被回收。
以下任一情况均视为租约失败:在 need_by 后仍未就绪;准备了错误版本;取消后仍占用预算;租约搬运使非租约请求越过 P99 SLO;半搬运对象变为可见;引擎重启后重复提交或引用泄漏。失败必须回退到普通同步装载或重新预填充,不能返回未经验证的状态。
研究问题 3:由余量和 SLO 推导无效搬运上限
先在无租约负载上测基线非租约请求 P99 的置信上界 U_base,用户给定 SLO 为 S_nonlease。可用隔离余量为 D = S_nonlease - U_base;若 D ≤ 0,系统没有推测搬运资格。逐级增加后台搬运带宽,找到使非租约 P99 置信上界仍不超过 S_nonlease 的最大安全速率 B_safe。
主存余量 M_safe 由基线 P99 驻留峰值、不可回收运行时内存和实测碎片保护区从物理容量中扣除。对持续 T 的租约窗口,无效搬运硬上限为:
W_invalid = min(B_safe × T, M_safe)该上限同时受每租约和全局窗口约束;没有链路或主存余量时拒绝租约。正式结果还需证明非租约 P99 与无租约基线等效:等效边界取剩余 SLO 余量 D,用按会话分块自举得到 95% 置信区间,区间越界即判隔离失败。
研究问题 4:跨引擎与跨状态证明抽象成立
必须在 vLLM 与 SGLang 两个引擎上实现同一租约测试套件,并至少覆盖:
- 基础参数:从主存到 GPU 的整层或整模型准备,验证取消、版本和带宽隔离。
- 键值缓存:读取与重新预填充二选一,验证会话命名空间、布局版本和共享页引用。
通过条件不是“两个适配器能编译”,而是同一黑盒契约测试无需了解引擎内部页表即可通过,且两类状态都满足失败回退和 SLO 隔离。专家页只有在上述四个组合全部通过后才加入,作为第三类状态扩展。
4. 可行性
4.1 工程范围、复用边界与软件栈
原型由基准脚手架、租约协调器、vLLM/SGLang 适配器和轨迹重放器组成。键值数据面复用 LMCache-arXiv25 式接口;参数准备先做主存到 GPU,不发明新缓存格式、专家内核或全局最优放置器。最小平台为 4 张异构 PCIe GPU,并增加同构对照;模拟器通过后再扩展到 10–20 张卡。
基线为无预取、最近最少使用、模型频率预测、见提示即全量预取和知道未来下一跳的离线预言机。所有策略使用相同状态字节、链路隔离和任务质量门槛。
4.2 时间线、资源预算与继续/终止门槛
| 阶段 | 时间 | 产物 | 继续条件 |
|---|---|---|---|
| 公开基准与用户预算 | 3 周 | 固定脚手架、任务类别 SLO、预实验轨迹 | 基准产生跨模型交接,调用图提示早于部分请求 |
| 漂移与恢复测量 | 3 周 | 预登记漂移矩阵、两类状态恢复曲线 | 可行动交接占比的置信下界超过由 MES 反推的门槛 |
| 租约模拟器 | 3 周 | 五种基线、取消与隔离预算 | P99 准备迟到达到 MES,非租约 P99 通过等效检验 |
| 双引擎原型 | 6 周 | 两引擎乘两状态的黑盒契约测试 | 正确性、回退与 SLO 隔离全部通过 |
| 模型能力与规模评测 | 4 周 | 三模型族、强模型合并角色、异构/同构对照 | 结论能解释交接次数与恢复状态的相反趋势 |
若公开基准不存在可行动窗口、历史策略在预登记漂移下等价、D ≤ 0,或双引擎抽象需要泄漏引擎内部语义,停止完整系统实现。
5. 投稿策略
5.1 按测量结果分级的投稿梯度
| 结果强度 | 可声称贡献 | 去向 |
|---|---|---|
| 公开基准与补充轨迹上成立,租约跨两引擎两状态,且在漂移、取消和强模型对照下保持收益 | 新的智能体运行时—状态层契约、机制解释和完整系统 | OSDI/SOSP |
| 主假设成立,但兼容面或工作负载覆盖较窄 | 期限感知交接策略、异构小集群原型和条件化边界 | MLSys |
| 只得到阶段漂移、恢复交叉点或负面结果 | 公开测量、轨迹与基准脚手架 | 系统测量短文或研讨会(workshop) |
| 历史策略等价、强模型消除交接或没有 SLO 余量 | 不包装为成熟系统 | 终止并保留测量记录 |
5.2 最强结果下的论文叙事
长尾目录中的历史热度不能无条件外推到阶段会反转的智能体工作流。调用图已经包含下一次模型交接的因果信息,交接租约把它转成期限、版本和取消语义;状态层再按实测恢复时间、链路余量与非租约 SLO 决定接受或拒绝。端到端结果必须证明降低的是准备迟到,且没有用无效搬运、任务质量或其他请求尾延迟换取收益。
6. 转向方案
- 主假设验证:完成双引擎两状态抽象,再决定是否扩展专家页。
- 只有提前窗口、没有历史策略优势:删除调用图优越性主张,转为期限感知恢复交叉点测量。
- 提示准确但窗口过短:记录负面结果;不改变智能体语义来制造窗口。
- 强模型显著减少交接:把适用范围限定为多模型质量或成本仍优于单强模型的部署。
- 发现等价工业机制:贡献降为公开契约复现、基准和跨引擎正确性评测。
- 真实生产轨迹不可得:仅声称公开基准上的机制结果,不使用“生产”或“真实部署”叙事。
品味评估
独立批评者第二轮评审为 5/5 通过:SWE-bench Verified 提供可复现的真实仓库任务,且稿件明确三角色交接是合成部署而非生产轨迹;阶段漂移反例具有预登记强度和保持边际频率的对照;交接租约改变运行时与状态层的控制边界,而非只调预取参数;三种模型族及强单模型对照覆盖模型能力变化;期限、版本、取消与安全失败组成可跨引擎验证的新抽象。
四项硬门槛均通过:核心攻击只使用 complete/full-text 证据,覆盖缺口与中等新颖性一致,资源和效果阈值均由服务等级目标、系统余量或统计功效推导,因果链保持为“阶段漂移—调用图提示—租约准备—准备迟到与无效搬运”。主要残余风险是三角色脚手架尚非公开生产轨迹;若公开基准没有产生足够交接,或强模型消除了多模型需求,项目必须按转向方案降级或终止。
本提案基于 wiki/proposals/probes/hetero-small-cluster-multi-model-agent.md 的研究版图与证据分析。