SparseKVGuard:用在线页面审计约束稀疏注意力的漏召回风险
核心赌注:在相同固定页面预算和等效平均任务质量下,不同稀疏选择器仍会产生显著不同的关键漏召回尾部;若只额外读取固定比例的未选页面,在线审计应能在词元分叉前区分低风险与高风险决定,否则“风险守卫”不成立。
阅读提示
- **稀疏选择器(sparse selector)**决定本轮注意力读取哪些历史键值缓存(key-value cache,KV cache)页面。页面是存储与传输单位,可包含多个词元。
- **得分最高的 k 个项目(top-k)**表示只保留选择分数最高的固定数量项目;**累计概率阈值(top-p)**表示保留最少项目,直到累计注意力权重达到给定阈值。后者的预算可随请求变化。
- **归一化指数函数(softmax)**把查询与键的匹配分数转换为和为 1 的注意力权重。未选页面的权重总和只是当前注意力遗漏量,不自动等于词元或任务错误。
- 页面审计从未选页面总体中抽样,补算其注意力权重与值向量贡献,再决定接受、扩大选择集合或回退精确注意力。
- **图形处理器(graphics processing unit,GPU)**执行模型计算;**脑浮点 16 位格式(bfloat16,BF16)**是本实验固定的模型权重与缓存数值格式。
- PCI Express(PCIe)总线连接图形处理器与主存;页面抽查若产生离散的 PCIe 读取,可能吞掉稀疏计算节省。
- **输入输出(input/output,I/O)**表示图形处理器、主存与存储设备之间的数据移动。
- **第 50、第 95 与第 99 百分位延迟(P50/P95/P99)**分别表示 50%、95% 与 99% 请求或词元不超过的延迟,用来区分中位、较慢和最慢尾部。vLLM 是采用分页键值缓存与连续批处理的大模型服务引擎;SGLang 是面向结构化生成程序并提供前缀复用与服务调度的运行时。
- RULER 是控制长度与证据位置的合成长上下文测试;**多轮共引用(multi-round coreference,MRCR)**测试模型能否在多轮文本中找到被再次指代的信息。二者用于机制诊断,不替代真实代码与工具工作负载。
本提案只研究对既有稠密模型做推理时稀疏化的场景,精确稠密执行因而提供语义基线。原生稀疏模型只用于接口边界实验,不要求它与另一个稠密模型逐词元一致。
1. 为什么这是个好问题
1.1 问题与真实工作负载
长代码与多轮工具任务会把远距离、短而关键的状态留在键值缓存中。页面选择器可能在绝大多数样例上维持平均质量,却在少数请求中漏掉跨文件定义、先前工具返回或约束条件。平均任务分数无法告诉运行时当前请求是否安全,而固定页面预算也无法表达“这个请求需要多读一页”。
主要公开工作负载使用 LongCodeBench 的 LongCodeQA 与 LongSWE-Bench。它以真实代码仓库的理解和修复任务评测最长百万词元的代码上下文,代表代码助手需要跨文件读取、定位和修改的部署形态。补充工作负载使用 -bench 的零售与航空环境;它让智能体在多轮用户对话中调用领域应用程序接口(application programming interface,API)并遵守策略,代表工具返回持续写入会话状态的服务形态。RULER 与 MRCR 只用于控制证据位置、证据数和指代距离。
实验协议在取样前冻结:
| 维度 | 冻结配置 | 代表性与边界 |
|---|---|---|
| 长度 | LongCodeBench 分别截取或选择 32K、64K、128K 词元桶;代码问答最多生成 1K 词元,修复补丁最多生成 4K 词元 | 覆盖当前代码助手常见长窗口;不把百万词元接口长度冒充有效长度 |
| 多轮工具 | 先用精确稠密执行生成并冻结 -bench 对话、工具调用与返回,再重放相同历史;每个任务的模型输出累计上限为 4K 词元 | 隔离缓存选择风险,避免稀疏执行改变工具轨迹后无法配对;不代表真实到达轨迹 |
| 到达与并发 | 泊松到达率分别使精确稠密基线达到 30%、60%、85% 图形处理器忙碌度;并发上限与连续批次上限均为 16 | 扫描交互低载到接近饱和;明确这是受控服务重放,不声称来自生产日志 |
| 页面 | 每页 16 个词元,逐层、逐注意力头记录;敏感性实验使用 8、32、64 词元 | 对齐分页服务路径,并显式测量页面聚合对风险与读取放大的影响 |
| 硬件 | 单张 NVIDIA H100 PCIe 80GB、512GB 主存、PCIe 5.0 x16;模型与 KV 均用 BF16 | 先隔离 GPU—主存路径;固态硬盘、多节点与张量并行不属于核心验证 |
| 服务运行 | 每个负载点预热 5 分钟、测量 30 分钟;固定模型、分词器、随机种子、内核版本和请求顺序 | 保证稀疏、审计和稠密基线可配对复现 |
正式稀疏实验前设置两道可行性门槛。LongSWE-Bench 的仓库环境、依赖和原始测试必须能在冻结容器中复现,且精确稠密模型成功的任务数达到质量等效检验所需的功效样本量;否则该模型—任务组合不能支撑代码质量主张。-bench 的精确稠密智能体必须完成领域接口调用、通过任务判定,并产生足够的成功与失败配对样例以达到同一功效要求;否则只保留冻结轨迹的缓存机制分析,不报告任务质量等效。任何被排除任务都按失败阶段和长度公开,不能通过只保留稠密基线成功样例抬高守卫效果。
1.2 反直觉预测及其适用边界
本提案不声称社区普遍相信“固定预算对每个请求都安全”。Twilight 已证明注意力分布随层、头和请求变化,并用 top-p 实现自适应预算;Louver 进一步把选择改写为范围查询,对高于给定相似度阈值的键提供零漏召回保证。它们已经否定“只需一个全局 top-k”这一宽泛攻击对象。
本提案保留一个更窄、可推翻的预测:对固定预算选择器统一限制为 10% 页面后,即使两个选择器的平均任务质量与精确基线等效,它们的关键漏召回尾部仍会显著不同;在额外读取量固定为全量页面 5% 时,页面审计能在首个词元分叉前区分这类尾部。 Twilight 与 Louver 的预算随请求变化,不强行塞进 10% 固定预算比较;它们在独立校准集上调到与对照相同的平均读取页面比例和平均总字节,再报告逐请求读取比例与字节的 P50、P95 和 P99。若任一动态方法或简单分数裕量在相同平均读取量下达到相同错误安全判定率与尾延迟,SparseKVGuard 没有独立系统贡献。
这里的反直觉点不是“自适应总比固定好”,而是“相同平均质量和相同平均读取量并不定义相同的逐请求风险”。结论只适用于可回源未选页面、存在精确稠密语义且审计成本可计入服务关键路径的推理时稀疏化。
1.3 核心赌注的证据链
核心证据只使用已回源全文的工作。以下定位来自本提案对仓库 Markdown、PDF 或论文原页的直接复核;probe 中旧的 needs-review/full-text 标记没有随本文件改动,不能把旧标记本身当作准入升级。
| 工作与全文定位 | 可准入结论 | 不能外推的主张 |
|---|---|---|
| BLASST-MLSys26 的块跳过方法与在线 softmax 内核章节 | 块贡献可在注意力内核中估计 | 不证明低成本抽样能控制逐请求风险 |
| Twilight §3.2、§4.1、§5 与附录 F | top-k 会过选或欠选;分层 top-p 可自适应分配预算,同时存在估计开销与分组查询注意力适配边界 | 不提供逐请求任务失败保证,也不是固定 10% 预算方法 |
| Louver 图 1、§4、§5 的表 2 与图 7、附录 L | 漏掉关键键可形成误差尖峰;范围查询能保证给定阈值以上零漏召回 | 保证对象是阈值以上键,不是阈值以下聚合尾部或任务成功;索引仍有显存与集成成本 |
| SparseSpec-MLSys26 §4.1–§4.4、§5.6 | 稀疏草拟后做完整验证可保持目标模型输出,并能与调度和卸载协同 | 安全来自完整验证,不是固定少量额外读取的风险判定 |
| OPKV-MLSys26 图 2、§3.2–§3.4、§5.4 | 词元选择会造成页面读取放大;插件、聚合页面和热点复用可降低召回开销 | 未独立验证选择器质量,也未报告生产 P99 |
| SolidAttention-FAST26 §3–§6、§8.6 | 固定 1K 词元预算可与固态硬盘页面路径协同;背景 I/O 会明显放大尾延迟 | 单用户、批次为 1 的平均质量不能推出逐请求守卫有效 |
| ECHO-OSDI26 与 IceCache-arXiv26 的系统设计和成本分解 | 主存补拉与页面索引可实现,且管理或索引成本可能成为主要耗时 | 不证明任务级风险可由页面信号校准 |
因此,准入证据只支持“值得测量相同平均质量下的尾部风险”和“补拉路径可实现”。它不支持“现有系统都缺少风险机制”或“SparseKVGuard 是首个召回保证”。新颖性保持中等,并以 Louver、Twilight 和并发工作的复现结果为降级条件。
1.4 风险随机变量、保证范围与决策阈值
对固定请求 、解码步 、层 和注意力头 ,令全部页面集合为 ,选择器输出为 ,未选总体为 。对未选页面 :
- 是该页在 softmax 归一化前的权重质量;
- 是未选页面占完整 softmax 权重的比例;
- 是当前层头的注意力输出相对残差;
- 聚合当前解码步的全部层和注意力头;只要一处越界,整个审计窗口就视为高风险;
- 表示从当前步开始的后续 128 个词元内,稀疏输出是否首次偏离固定随机种子的精确稠密输出;
- 表示最终任务是否由精确基线的成功变成失败。
一个审计窗口同时覆盖当前步的所有 分层总体,而不是把每个层头各自判为安全。定向抽取选择边界与离散地址附近的页面后,再加入具有已知包含概率的均匀样本,以 Horvitz–Thompson 估计量按每页被抽中的概率加权,从而修正定向抽样偏差。
值向量范数上界不能在读取页面后才决定。主实现于 KV 页面生成时计算该页的最大值向量范数,把一个标量随页号、版本和校验和写入常驻元数据;审计在不读取页面内容时即可取得精确上界。元数据缺失、版本陈旧或校验失败时直接扩大集合或精确回退。按模型与层从离线校准集取得的保守上界只用于敏感性实验,不承担形式保证。
每个窗口使用对自适应抽样量和停止时刻仍有效的全局置信序列,同时界定全部层头的 。请求 的真实最大审计决定数 由冻结输出上限给出:LongCodeQA 为 1024,LongSWE-Bench 与 -bench 为 4096;其他基准使用其冻结生成上限,不再假设固定 128 个窗口。请求级风险预算为 ,第 个窗口使用 。于是仅在同时置信覆盖通过时声称
若实现无法对全部层头构造同时有效的置信序列,或实际决定数超过冻结上限,请求级陈述立即失效,只能分别报告逐决定保证及其经验覆盖率。该保证也不直接推出 或 。离线精确影子执行负责估计 的条件风险与校准曲线,并按模型、选择器、任务和长度分桶;关系不稳定时,线上接口只能声称控制注意力残差,不能包装成词元或任务安全保证。
阈值在实验前按以下规则冻结:
| 判定量 | 主阈值与来源 | 敏感性区间 |
|---|---|---|
| 平均质量等效 | LongCodeBench 单元测试通过率、-bench 任务成功率和 RULER 准确率使用配对双单侧等效检验(two one-sided tests,TOST);差异的双侧 90% 置信区间必须完全落入 个百分点,1 点取作最小有意义部署差异 | 0.25、0.5、1、2 个百分点 |
| 错误安全判定率 | 在精确影子标签为高风险时仍接受的比例,其单侧 95% 置信区间上界不超过 1%;来源是请求级 1% 风险预算 | 0.1%、0.5%、1%、2%、5% |
| 请求统计预算 | ;按各工作负载冻结的真实最大决定数分配到全层头审计窗口,并用任意时刻有效的全局置信序列控制自适应停止 | 取 0.1%、0.5%、1%、2% |
| 残差阈值 | 在独立校准集上选择“使 的单侧 95% 上界首次超过 1%”的最小 ,随后在测试集冻结 | 对所得阈值取 0.5、1、2 倍 |
| 页面预算 | 固定选择器取全量页面 10%;审计额外 5% 是本提案参考 Louver 的 10% 对照后预登记的设计阈值,不是社区标准。动态方法按相同平均读取页面与总字节校准,并另报 P50/P95/P99 | 固定基础 5%、10%、20%;审计 1%、2%、5%、10% |
| 服务成功 | 审计方案的 P99 每词元时间不比无审计稀疏基线上升 10%,且比精确稠密基线至少下降 20%;20% 是系统贡献的最小有意义效应 | 延迟回归 5%、10%、20%;相对稠密改善 10%、20%、30% |
所有质量等效比较使用配对 TOST、单侧显著性水平 0.05 和至少 80% 统计功效;二元任务以配对比例差的置信区间实施等效检验,连续指标用分层自举构造等效区间。只有置信区间完全落入预登记边界才算等效,普通差异检验“不显著”绝不算通过。若公开基准规模不足以检测 1 个百分点边界,就扩大样例或降低主张。错误安全判定率也必须有足够高风险影子样例使 1% 上界可识别;样例不足时只报告置信区间。
2. 研究路线与证据边界
2.1 从固定预算到召回保证
Twilight 已把 top-k 的固定数量改为 top-p 累计权重阈值;Louver 又把阈值以上键的召回变成无假阴性的范围查询。SparseKVGuard 不重做这两项贡献。它询问的是:阈值以下的许多页面是否会形成足以改变输出的聚合尾部,以及一个不扫描全量页面的运行时能否检测这种风险。
这一区分决定基线必须同时包含固定 top-k、Twilight 式 top-p、Louver 阈值召回和精确稠密执行。固定预算方法在同一 10% 页面上比较;Twilight 与 Louver 则在校准集上匹配平均读取页面比例和平均总字节,并报告 P50/P95/P99 读取分布,避免动态方法用更重尾部换取相同平均值。若 Louver 在全部目标工作负载上已经同时满足任务质量、读取预算与 P99,项目应停止,而不是把同一机制换名重做。
2.2 从可召回页面到可审计页面
OPKV-MLSys26、SolidAttention-FAST26、ECHO-OSDI26 与 IceCache-arXiv26 证明选中项需要映射到页面、主存或固态硬盘路径。它们也给出边界:词元选择可能造成页面读取放大,索引与以 Python 实现的串行控制路径可能成为瓶颈,固态硬盘争用会放大尾延迟。
本提案第一阶段只使用 GPU—主存两级,不把固态硬盘作为贡献。接口每轮提交候选页面、选择器类型、选择边界和风险预算;运行时返回接受、扩容或精确回退,并记录审计额外读取字节。只有 GPU—主存结果成立后,才把固态硬盘作为外部有效性实验。因此文档头部不保留 tiered-storage 标签。
2.3 跨模型与选择器的结构性检验
主实验使用三个模型和三个选择器族的交叉组合:
- Qwen2.5-Coder-7B-Instruct,覆盖代码模型与 LongCodeBench;
- Llama-3.1-8B-Instruct,覆盖通用长上下文与 RULER、MRCR;
- DeepSeek-R1-Distill-Llama-8B,覆盖长输出推理,并在冻结的 -bench 历史上检验阶段变化。
选择器包括 Quest 式页面 top-k、Twilight 式分层 top-p,以及 BLASST 式在线块阈值。只有模型与内核兼容的组合进入端到端实验,但三类选择语义都必须在精确影子工具中评测;缺失组合要明确报告,不能用三个同族模型替代。
模型代际独立性来自结构而非当前模型能力:只要推理时从有限预算中选择历史页面,注意力分布的集中或弥散、页面粒度放大和远距离证据的请求间差异仍存在。更强模型可能缩短部分推理,却也会处理更长代码库、更多工具返回和更复杂状态。相反,如果未来模型原生定义可精确验证的稀疏语义,或强模型在所有目标负载上让简单选择器达到相同尾部风险,本提案的稠密回退契约就失去必要性;这两项都作为反证,而不是用“模型代际独立”作未经检验的口号。
2.4 覆盖缺口与新颖性置信度
本提案已直接回源全文复核 Louver、Twilight、SparseSpec-MLSys26、OPKV-MLSys26 和 SolidAttention-FAST26;probe 中旧证据等级保持原样。全文证据显著收窄了空白:动态预算、阈值召回、精确验证和页面补拉都已有机制,尚未闭合的是它们与任务级尾部风险的统一校准。
仍有三项阻断缺口。第一,LongCodeBench 与 -bench 是公开应用基准,不是生产服务到达轨迹;泊松重放只能验证争用敏感性。第二,Louver 发布很新,其阈值预言机、更新成本和服务集成需要独立复现。第三,没有公开数据能证明注意力残差稳定预测任务失败。因而 novelty 保持 medium,最强主张只能是“风险作用域明确的运行时审计契约”,不能声称首个安全稀疏注意力系统。
3. 核心研究问题
研究问题 1:相同平均质量是否掩盖不同尾部风险?
对支持固定预算的选择器统一使用 10% 页面,对三个模型和三类任务做精确影子执行;只有配对 TOST 的置信区间完全落入 1 点等效区间,才比较错误安全尾部。Twilight 与 Louver 保留原生动态预算,在独立校准集上匹配固定对照的平均读取页面和总字节,并另报 P50/P95/P99。逐窗口记录 、、聚合 、、、页面离散度与实际读取字节;用保持模型、任务与长度分层的置换检验判断尾部差异。
若等效平均质量下不存在可复现的尾部差异,或差异只来自一个模型与一种任务,主假设被推翻。若差异存在但与任何在线可用信号无关,结果只构成失效测量。
研究问题 2:固定 5% 额外读取能否检测风险?
审计器在每个解码步把全部层头作为一个分层窗口:先定向抽取选择边界附近和地址离散区域,再以已知概率均匀抽样。每批样本更新任意停止时刻仍有效的全局置信序列,同时约束所有层头的最大残差 。全局上界低于 时接受;超过阈值时扩容;额外读取达到预登记的 5% 仍证据不足时精确回退。若实现只能为单个层头给出区间,实验必须降为逐决定保证。
基线包括无审计、分数裕量、均匀抽样、Twilight、Louver 与离线全知预言机。审计必须在相同总读取预算下优于简单基线;通过多读获得的优势不计为检测能力。
研究问题 3:端到端实现是否保留系统收益?
在 vLLM 的块表与连续批处理路径实现原型,并提供 SGLang 适配层验证接口可移植性。第一阶段只支持 GPU 与主存;审计请求按物理页合并并进入独立低优先级流。分别报告选择、审计、KV 读取、softmax、扩容、回退和调度时间。
若审计满足风险阈值但 P99 不满足服务成功标准,则保留测量贡献,停止扩展存储层。若只有接近全量读取才能控制风险,则停止系统主张。
研究问题 4:正确性与可重放边界
- 线上超时、置信证据不足、索引版本不一致、页面读取失败或值范数越界都触发扩容或精确回退。
- 每个决定记录模型、分词器、注意力实现、选择器版本、页面布局、抽样种子、风险预算和读取集合。
- 与稠密模型逐词元一致、任务答案保持和原生稀疏模型按自身语义执行是三种不同正确性,不合并报告。
- -bench 主实验重放冻结历史;另设闭环实验观察稀疏错误如何改变后续工具调用,但不把两种分布混算。
4. 可行性
4.1 工程范围、复用边界与软件栈
最小实现包括精确影子标注器、有限总体顺序审计器、块表批量补拉、三个选择器适配器和可重放风险日志。不训练基础模型,不自建近似最近邻索引,也不实现固态硬盘调度。Louver 作为外部完整基线复现,而非 SparseKVGuard 的内部组件。
最大方法风险是从样本估计输出残差需要稳定处理 softmax 分母和值向量尾部;最大系统风险是离散读取破坏批处理。前者以无偏抽样、置信序列和越界回退约束,后者以页面合并、低优先级流和 P99 停止条件约束。
4.2 时间线、资源预算与继续或终止门槛
| 阶段 | 时间 | 可客观验收的产物 | 继续或终止条件 |
|---|---|---|---|
| 基准冻结与影子标注 | 第 1–3 周 | 三模型、三选择器、配对的 轨迹 | 稠密可行性门槛未过,或等效平均质量下无稳定尾部差异则停止 |
| 审计统计 | 第 4–6 周 | 固定 5% 额外读取的校准曲线、置信覆盖与功效分析 | 错误安全判定率上界超过 1% 或覆盖不足则转测量 |
| GPU—主存原型 | 第 7–10 周 | vLLM 原型、SGLang 接口适配、故障回退 | P99 或同质量收益不达阈值则不扩展 |
| 服务重放 | 第 11–14 周 | 三负载率下吞吐、每词元时间、P99 与旁路干扰 | 结果决定完整系统或测量论文层级 |
硬件预算是一台满足冻结配置的单机。若只能获得不同互连或显存容量,必须重跑稠密与稀疏基线并把硬件变化作为分层变量,不能沿用 H100 阈值。
5. 投稿策略
5.1 按测量结果分级的投稿梯度
- 若尾部错位跨三个模型与三个选择器族成立,审计满足错误安全、固定读取和 P99 阈值,并在 vLLM 与 SGLang 接口上复现,则形成完整系统论文,面向 OSDI。
- 若风险测量成立,但 5% 审计读取无法在部分硬件或负载保留端到端收益,则聚焦可复现尾部、保证作用域和条件化成本,面向 MLSys。
- 若在线信号不能预测风险,但得到高质量精确影子轨迹,则形成测量型短文;不声称风险守卫成立。
- 若 Louver 或 Twilight 在同预算下全面等价或更优,则终止新系统,发布复现与边界结果。
5.2 各级结果对应的贡献与目标会议
最强结果贡献有限总体风险契约、在线页面审计与端到端实现;中等结果贡献相同平均质量下的尾部错位版图;负面结果只贡献基准协议、影子标签和现有自适应或阈值方法的适用边界。
5.3 最强结果下的论文叙事主线
自适应预算和阈值以上零漏召回已经存在,但它们没有把阈值以下聚合尾部连接到词元分叉与任务失败。SparseKVGuard 先证明相同平均质量与页面预算可隐藏不同尾部,再用固定额外读取给当前决定建立作用域明确的统计证据。端到端系统只有在风险与 P99 同时过线时成立。
6. 转向方案
- 主假设验证:完成 GPU—主存运行时与跨选择器接口;固态硬盘仅作为后续外部有效性扩展。
- 只有尾部错位成立:发布精确影子轨迹和固定预算反例,不把离线标签冒充在线守卫。
- 审计只能控制残差:将贡献降为注意力残差契约,明确不声称词元或任务安全。
- Louver 或 Twilight 已足够:停止实现,报告其在长代码与工具重放上的复现边界。
- 公开基准缺少高风险样例:报告统计功效不足并提出基准需求,不人工筛选有利样例。
品味评估
独立批评者的最终判断为 5/5:
| 维度 | 判断 | 依据与残余风险 |
|---|---|---|
| 工作负载真实性 | 通过 | LongCodeBench 与 -bench 分别代表真实仓库修复和多轮工具任务,并冻结服务重放协议;残余风险是泊松到达不等于生产轨迹,稠密基线能力不足会削弱质量结论 |
| 反直觉性 | 通过 | 可证伪预测限定为“固定预算和等效平均质量仍隐藏不同尾部”,不虚构全局 top-k 社区共识;动态预算强基线若等价即推翻贡献 |
| 突破幅度 | 通过 | 若成立,运行时从静态稀疏率转向有统计作用域的逐请求接受、扩容或回退;残余风险是 5% 审计上限可能仍不足或过贵 |
| 模型代际独立性 | 通过 | 三个模型和三个选择器族检验结构性页面选择风险,同时允许原生可验证稀疏模型推翻适用性 |
| 抽象贡献 | 通过 | 有限总体、全层头审计窗口、请求级风险预算和显式降级条件构成可移植契约;残余风险是无法构造全局置信序列时只能保留逐决定保证 |
仍未消除的最大风险是注意力残差未必稳定预测词元分叉或任务失败。最终论文必须把形式保证限制在残差层,并把后两者作为分层校准结果,不能用 5 / 5 品味判断替代实验证据。
本提案基于 wiki/proposals/probes/subquadratic-sparse-attention.md 的研究版图与证据分析。