摘要

《Random Attention》(arXiv 2609.03430,9 月 4 日周五 digest;UIUC 王恒、Jiawei Han 与 Salesforce AI Research)证明:在推理过程中,KV 缓存逐出的「选择信号」几乎没有贡献——保留提示、在每个注意力头内均匀随机逐出、完全不打分,就能在四个模型、六个推理任务上追平此前最强的逐出策略,在 vLLM 中部署时吞吐还高 32-43%。解释是:脆弱的部分是提示;推理轨迹靠冗余自我保护(文本重述 + 每个头各持一份副本),随机抽取总能留下足够副本。同 digest 的独立收敛证据:InertiaKV(2609.03515,EMNLP 2026 主会)表明激进压缩下,时间聚合使「近似保序」的打分器改动在逐出集合层面不可区分,并提出 Score-Free 解码(对完整上下文只打一次分并冻结排序:平均质量变化 +0.07,后续不再打分)。

为什么重要
KV 压缩研究有一大块都在做打分函数,而现在两个独立团队都报告:在激进预算下,打分的作用远小于假设——推理轨迹自带冗余,提示没有。实践结论:保住提示、其余随机化;除非能打赢这个便宜得多的基线,否则对打分类方法的增益要保持怀疑。vLLM 可部署的实现已公开。
技术细节
ArXiv 2609.03430,2026 年 9 月 4 日周五 digest 宣告
主张 保提示、每头内均匀随机逐出、零打分,在 4 模型 × 6 推理任务上追平此前最强逐出策略;vLLM 部署吞吐 +32-43%
解释 提示是脆弱成分;推理轨迹靠冗余自我保护(重述 + 每头副本)
收敛证据 InertiaKV(2609.03515,EMNLP 2026 主会):激进压缩下时间聚合使近似保序的打分器改动在逐出集合层面不可区分;Score-Free 解码只打一次分并冻结排序(平均质量 +0.07,免去后续打分)
代码 github.com/SalesforceAIResearch/Random-Attention
标签
kv-cacheevictionvllmreasoningnegative-resultserving