ReasoningKV:用目标、时域与可逆性约束长推理 KV 动作

核心赌注:一个只对目标 A 有准入证据的代理,不应直接授权错误代价更高且不可逆的动作 B;运行时显式检查代理目标、预测时域和动作可逆性,可能比各动作独立调参更安全地组合长推理缓存策略。

阅读提示

  • 思维链(chain of thought,CoT):最终答案前生成的中间推理词元。
  • 键值缓存(key-value cache,KV cache):注意力层为已经处理的词元保存的键和值。
  • 图形处理器(graphics processing unit,GPU):执行模型计算并保存热缓存的加速设备。
  • 最高 k 项(top-k)选择:按分数取最高的 k 个位置;原生稀疏模型可只读取该集合。
  • 第 99 百分位(P99)延迟:99% 请求不超过的延迟,用来观察尾部慢请求。
  • 每输出词元时间(time per output token,TPOT):连续生成阶段平均每个词元所需时间。
  • 服务等级目标(service-level objective,SLO):部署方承诺满足的延迟或可用性边界。
  • 最小有意义效应(minimum meaningful effect,MES):小于该幅度的变化即使统计显著,也不足以改变部署决策。
  • 质量等效:候选策略相对无缓存修改基线的任务质量下降不超过预登记非劣界限;它不等于逐词元相同。
  • 可逆动作:保留权威副本的 GPU—主存卸载、预取或可验证重算。不可逆动作包括永久删除权威副本,以及没有全精度后备的降精度。

本文不假定存在三个通用代理目标,也不声称社区相信一个分数可以控制全部动作。研究问题被收窄为:已有系统为某个明确目标使用代理时,把该代理迁移到另一种不可逆动作是否安全。

1. 为什么这是个好问题

1.1 公开代表工作负载

评测固定三类公开任务:

  1. 数学长推理AIME 2024。竞赛题常需要保存早期假设、中间量并在最终检验中重新使用;是否发生晚期回看由页面反事实测量确认,不根据题目类型预设。
  2. 代码智能体SWE-bench Verified。代理需在代码仓库、问题描述、检索结果、补丁和测试失败之间循环;早期定位或错误日志可能在后续修补时再次使用。该基准可能趋于饱和,但仍适合公开复现缓存轨迹,不用于声称前沿代码能力。
  3. 工具长任务-bench。多轮用户、政策与应用程序接口调用形成显式工具状态;后续动作可能依赖早期用户约束或工具返回。

只纳入自然生成输出达到 4K、16K 或 32K 词元桶的轨迹,并保留未达到 4K 的短输出对照;不通过提示强迫模型填充思维链。晚期回看定义为某页面在产生后跨越至少四分之一输出长度,随后其受控扰动仍改变隐藏状态、原生稀疏选择或任务答案。若某类基准没有足够长输出或晚期回看,它不能支撑该类工作负载主张。

1.2 窄攻击:代理目标 A 能否迁移到不可逆动作 B

完整证据支持三个具体边界,而不是“统一分数”社区共识:

  • PASTA-ICLR24 证明注意力权重可被操控以改变行为;它不证明当前注意力权重(目标 A:当前步骤的可控性或贡献)可以安全授权永久删除 KV(动作 B)
  • ECHO-OSDI26 用原生稀疏选择器的 top-k 结果决定从主存补拉哪些页面,并保留完整权威历史;它不证明选择器下一步访问(目标 A)可以安全授权删除主存权威副本(动作 B)
  • LMCache-arXiv25Strata-OSDI26 根据命中、就绪时间和搬运成本决定状态放置;它们不证明按时可用或近期复用(目标 A)可以安全授权无后备降精度或永久驱逐(动作 B)

MoE-nD-arXiv26 提供完整全文证据,说明驱逐比例与键值精度需要按层联合校准;它支持“不可逆近似需要独立质量约束”,但不证明请求内长推理代理迁移。DiffKV-SOSP25SkipKV-MLSys26needs-review/full-text 工作只界定邻域,外部摘要只作为检索线索。

1.3 核心赌注的证据链

证据链为:PASTA 显示注意力代理具有干预效应但未建立答案因果忠实性;ECHO 通过保留主存权威副本把选择错误限制为性能损失;LMCache 与 Strata 说明可恢复放置还必须考虑就绪时间;MoE-nD 说明驱逐与精度的质量代价不能从单一轴外推。因此,代理能否授权动作取决于它预测什么、预测多远,以及动作失败后能否恢复。

这条证据只支撑上述窄迁移风险。它不支持“所有重要性论文都误用代理”,也不支持三种代理目标的固定分类一定完备。

1.4 可证伪假设与阈值

主假设:针对目标 A 校准的代理在授权不可逆动作 B 时,会出现可测的非劣性失败,而同一代理用于可逆动作时主要造成性能损失。

  • 成立时:在相同代理、页面预算和轨迹上,永久删除或无后备降精度越过质量非劣界限,而保留权威副本的卸载通过质量检验但可能增加 TPOT/P99。
  • 不成立时:同一低成本代理跨模型与任务安全授权不可逆动作,或者每动作独立策略已经在不共享契约的情况下避免全部冲突。
  • 反证含义:若跨目标迁移安全,则停止设计通用动作契约,转为记录该代理的适用边界。

阈值不使用预填百分比:

  • 质量非劣界限 ΔQ:由运维方按各基准的任务成功指标给出最大可接受下降;无修改策略的独立重复运行用于估计方差,再以按任务分层的功效模拟选择能在单侧显著性水平 0.05、功效 0.8 下检出 ΔQ 的样本量。若完整公开基准仍达不到该功效,不得声称质量等效。
  • 容量 MES ΔC:在无修改基线的 SLO 并发拐点,测量多接纳一个完整请求所需的 KV 字节;候选策略至少释放 ΔC,否则容量变化没有可行动意义。
  • TPOT 门槛 ΔT:由线上或目标部署的 TPOT SLO 减去基线 TPOT 的 95% 置信上界得到剩余余量;余量非正时不得引入恢复或评分开销。
  • P99 门槛 ΔP:同理由 P99 SLO 减去基线 P99 的 95% 置信上界得到;正式比较使用按请求分块自举,并要求候选置信上界不超过 SLO。
  • 逐请求错误安全率 δ_safe:由运维方把任务质量错误预算中可归因于缓存动作的部分分配给本系统;正式结论要求错误安全判定率的单侧 95% 置信上界不超过 δ_safe。没有部署错误预算时,只报告 0.1%、1% 和 5% 的敏感性区间,不声称生产安全保证。

系统贡献成立还要求在质量非劣下释放至少 ΔC,且 TPOT 与 P99 同时通过门槛;只降低平均字节不算成功。

2. 研究路线与证据边界

2.1 可逆放置与不可逆近似

LMCache-arXiv25Strata-OSDI26 主要解决“状态放在哪里、何时能到达”;ECHO-OSDI26 进一步展示保留权威主存副本可把错误预测变成补拉。它们为可逆动作提供完整证据。

MoE-nD-arXiv26 完整证明逐层联合选择驱逐与精度能改善有限基准上的平均质量—容量前沿,但没有请求内阶段风险保证。DiffKV 与 SkipKV 尚为待复核全文,只能说明数值压缩和句子删除是相邻不可逆动作,不能支撑核心攻击。

2.2 原生稀疏访问不等于答案安全

ECHO 的精确 top-k 召回保证执行原生稀疏模型定义的访问,不保证选择器未访问的状态与最终答案无关。因此,选择器结果可授权“本步不驻留 GPU”,不能自动授权“删除主存权威副本”。稠密模型则在数学上读取全历史,物理访问本身不能作为有用性标签。

2.3 模型能力变化的双向压力

至少覆盖三种架构与规模:Qwen3-8B、Phi-4-reasoning-plus-14B、DeepSeek-R1-Distill-Llama-70B。每个模型运行三类任务的固定子集,并按自然输出长度分桶。

必须同时检验两种相反趋势:更强模型可能用更短 CoT 完成数学和代码任务,降低 KV 压力;更强模型也可能在 SWE-bench 和 -bench 中执行更多有效工具步骤、维护更长智能体状态,使晚期回看与缓存增长加剧。报告每个成功任务的输出词元、工具步骤、峰值 KV、晚期回看比例和任务质量。若强模型持续缩短轨迹且不增加状态,本提案的模型代际独立性必须收窄。

2.4 覆盖缺口与新颖性置信度

23 篇内部证据中只有 11 篇为 complete/full-text;核心攻击仅由其中的 PASTA、ECHO、LMCache、Strata 与 MoE-nD 支撑。12 篇 needs-review/full-text 和 Crystal-KV、LongFlow 等外部摘要不承担新颖性或社区共识判断。

公开逐步缓存轨迹几乎不存在,AIME、SWE-bench Verified 与 -bench 也不是为 KV 研究设计。它们只提供可复现任务;长输出和晚期回看代表性必须由本项目测量,而不是由基准名称保证。

3. 核心研究问题

研究问题 1:建立跨目标迁移矩阵

对每个页面记录代理来源、原目标、预测时域、动作和结果。至少评测:当前注意力代理→永久删除、稀疏选择器→删除权威副本、近期复用代理→无后备降精度;同一代理还要驱动保留权威副本的卸载作为可逆对照。

标签包括当前步骤反事实影响、未来 H 步内的再次影响,以及动作后最终任务变化。在线策略不得使用未来标签;它们只用于判断迁移是否安全。若三种具体迁移都通过非劣检验,主假设被推翻。

研究问题 2:定义目标—时域—可逆性契约

评分器返回最小证书:

evidence(page, target, horizon, confidence, provenance, calibrated_on)

动作返回最小清单:

action(kind, reversibility, authority_copy, recovery_p95, quality_budget)

运行时只在证书目标覆盖动作所需性质、horizon 覆盖动作生效期,且恢复时间满足 SLO 时授权。例如,下一步 top-k 证据可决定 GPU 驻留,但不能删除权威副本;H 步复用预测可决定卸载层级,永久删除则需要答案级验证或可验证重算。

研究问题 3:证明契约相对每动作独立策略不可替代

最强基线不是统一分数,而是每动作独立最优策略:卸载器、降精度器和驱逐器分别用自己的验证集调参,再由固定优先级组合。契约策略使用相同三个策略和预算,只在动作交界处检查证书。

契约必要性需同时满足:

  1. 至少发现两类组合冲突,其中每个独立策略单独运行都通过自身质量或 SLO 验收,组合后却因时域、权威副本或恢复带宽冲突而失败。
  2. 契约在不查看各策略内部特征的情况下拒绝冲突,并在质量非劣下达到 ΔCΔTΔP 门槛。
  3. 把契约检查改写为各策略私有规则时,需要复制同一目标、时域和可逆性元数据;若无需共享元数据即可达到等效结果,契约抽象被判定可替代。

可能冲突实例包括:卸载器依据近期低复用把页面放到主存,驱逐器随后删除主存权威副本;降精度器消耗了重算所需的全精度后备,预取器仍按可恢复状态报价;两个策略分别满足局部带宽预算,却共同使恢复流量越过 P99 SLO。

研究问题 4:实现与正确性

vLLM 块表和调度路径加入证书与动作清单,使用 LMCache 或等价后端保存权威副本。第一版只实现 GPU 驻留、主存卸载、无后备降精度和永久删除,不同时加入固态硬盘、远端节点或语义索引。

每个页面绑定模型权重、分词器、适配器、位置编码、聊天模板和推理片段版本。证书过期、版本不匹配、恢复失败或 SLO 余量不足时拒绝动作。确定性解码下,可逆动作恢复后的输出必须逐词元等同无修改基线;不可逆动作按任务质量非劣和逐请求错误安全率共同验收。

4. 可行性

4.1 工程范围与复用边界

最小实现包含跨目标离线标注器、契约检查器、GPU—主存两级页面后端和可重放版本日志。复用 vLLM 块表、LMCache 传输和连续批处理,不训练新基础模型,也不改变生成策略。

答案反事实标注成本高,因此先按句子和页面分层抽样,对候选关键页面精确重放。若标签方差过大,增加独立采样,不用注意力分数替代答案贡献。在线评分器只有在离线证据显示可预测后才实现,其成本计入 TPOT。

4.2 时间线与继续门槛

阶段时间可验收产物继续条件
公开负载与基线方差第 1–3 周三模型、三任务的长度、晚期回看和方差报告至少两类任务产生足够长输出和晚期回看
跨目标迁移回放第 4–7 周三个具体 A→B 迁移及可逆对照至少一种不可逆迁移越过质量非劣界限
独立策略组合第 8–10 周三个单独验收策略及组合冲突至少两类冲突证明共享契约有必要
两级运行时第 11–14 周GPU—主存原型、版本拒绝和恢复路径质量、容量、TPOT、P99 全部达到预登记门槛
模型代际压力第 15–17 周三架构及强模型双向趋势结论能解释短 CoT 与长智能体状态的条件边界

若没有跨目标失败、独立策略组合没有冲突、容量不足一个请求,或 TPOT/P99 没有部署余量,停止完整系统实现并保留测量结果。

5. 投稿策略

5.1 按结果强度分级

  • 跨目标误用和组合冲突在至少三架构、两类长任务上成立,契约在质量非劣下改善容量与服务指标,形成 OSDI 级系统论文。
  • 误用测量成立但共享契约可被独立策略替代,发布代理迁移边界、轨迹与负面抽象结果,面向 MLSys。
  • 只有一个 A→B 实例失败,缩小为对应动作的测量短文,不声称通用 KV 生命周期抽象。
  • 强模型消除长输出或全部迁移安全,则终止系统提案并公开反证。

5.2 最强结果的叙事

问题不是社区缺少更好的“重要性”分数,而是系统把为一个目标校准的证据迁移到另一种高风险动作。ReasoningKV 让策略声明证据目标和时域,让动作声明可逆性和恢复边界;共享运行时只阻止未经证据授权的跨目标组合,不取代每个动作自己的策略。

6. 转向方案

  • 主假设验证且契约必要:完成两级运行时,再评估固态硬盘与多节点扩展。
  • 跨目标失败但契约可替代:保留测量贡献,删除新抽象主张。
  • 只有删除不安全:缩小为“权威副本优先”的 KV 驱逐研究。
  • 强模型缩短全部轨迹:限制为仍产生长工具状态的任务;若无此任务则终止。
  • 在线代理失败:发布离线轨迹,不用未来答案标签冒充可部署策略。

品味评估

独立批评者第二轮评审为 4/5 通过。工作负载真实性通过:AIME 2024、SWE-bench Verified 与 τ-bench 分别覆盖数学、真实仓库修复和多轮工具任务,并以自然长输出和晚期回看作为准入门槛。10 倍突破、模型代际独立性和抽象贡献通过:若独立合格的缓存动作组合后失效,而目标—时域—可逆性契约能通用阻止冲突,它改变的是缓存策略组合方式;三种模型族和强模型双向压力允许该主张被推翻。

反直觉性不通过:完整证据只表明现有代理没有获得跨目标授权,尚不能证明社区或生产系统正在普遍把代理 A 用于不可逆动作 B。因此本提案只把“独立策略组合后是否产生跨目标冲突”保留为待测反例,不把它包装成已知社区误区。四项硬门槛仍通过:核心引用均为 complete/full-text,覆盖缺口和中等新颖性一致,质量、容量、TPOT、P99 与逐请求错误安全率均有来源化门槛,主因果链没有混入旁支。

本提案基于 wiki/proposals/probes/thinking-model-kv-cache.md 的研究版图与证据分析。