摘要
《Do New Attention Mechanisms Actually Fix Attention Sinks at Million-Token Context?》(arXiv 2609.08574,9 月 9 日周三 digest)构建 SinkProbe 诊断套件——sink 质量、巨型激活、按位置召回、近因差距——应用于四个只在 token 混合方式上不同的小模型,包括门控注意力(首 token 注意力从 46.7% 降到 4.8%)与 Kimi K3 的门控 + Kimi Delta Attention + Attention Residuals 组合(1M 窗口,比既往诊断范围超出八倍)。论文绘制各机制在哪里守得住、沉陷与位置召回病灶在极端距离上何处重现。
为什么重要
开源权重浪潮正在发布 262k-1M token 的混合注意力模型,serving 团队正围绕「注意力在这些长度上做什么」的假设设计前缀缓存与逐出。SinkProbe 把这些假设变成可测量:在投入缓存与内存预算之前,检查召回在标称窗口内是否真的均匀。
技术细节
| ArXiv | 2609.08574,2026 年 9 月 9 日周三 digest |
|---|---|
| 诊断 | sink 质量、巨型激活、按位置召回、近因差距 |
| 模型 | 四个仅 token 混合方式不同的小模型,含门控注意力与 Kimi K3 的门控+KDA+Attention Residuals(1M) |
标签
hybrid-attentionattention-sinkslong-contextdiagnosticsserving