摘要
受控留一探针显示:注意力大小与一个 token 对答案的因果贡献无关(Spearman rho = -0.004),动摇了主流基于注意力的 KV 驱逐方法的前提。TwinKV 是免训练的修复通道,可叠加在任意驱逐策略上:它找出被驱逐但键没有存活近重复的 token(孤儿)与保留但信息已在他处重复的 token(冗余供体),在不动原预算与打分规则的前提下互换。在 Qwen3-4B 上与四种近期策略组合,覆盖 LongBench、LooGLE、RULER 与 MMLU-Pro 无损对照、压缩比 0.3/0.5/0.7:两种策略下多数配置获益,第三种基本持平,第四种自适应基线已近性能上限、仅少数配置获益。
为什么重要
可叠加的后处理通道设计意味着服务团队不用重训、不用换策略,就能在现有驱逐配置上试 TwinKV——KV 缓存研究里少见的落地形态。「注意力不等于重要性」的零结果对手工调驱逐阈值的工程师也是一记提醒。
技术细节
| 探针 | 留一因果贡献探针:注意力大小与贡献的 Spearman rho = -0.004 |
|---|---|
| 方法 | 免训练、不用注意力分数的冗余信号;识别孤儿(被驱逐且无存活近重复)与冗余供体(被保留但信息已重复);在原预算与打分规则内互换 |
| 结果 | Qwen3-4B;LongBench / LooGLE / RULER + MMLU-Pro 无损对照;压缩比 0.3/0.5/0.7;与 4 种策略组合:2 种多数配置获益、1 种基本持平、1 种近上限自适应基线仅少数获益 |
| ArXiv | 2608.27128,2026-08-27 提交 |
标签
kv-cachelong-contextinferenceservingevictionresearch