摘要
CRISP(arXiv 2609.01925,9 月 3 日周四 digest;Adobe Research)是面向长上下文 prefill 的输入自适应稀疏注意力方法。它把基于 Jensen-Shannon 散度的头路由替换为结构化代理 C_struct(度量 Vertical-Slash 兼容位置的质量),去掉池化矩阵乘与 KL 散度开销;并用带 sink 感知的阈值替换累积覆盖阈值(理论上只累积 O(n) 背景噪声)。在两个模型家族的 InfiniteBench、RULER、LongBench 上,它是整体最强的稀疏方法:在检索密集型基准上追平或超过全注意力,恢复率较基线最高 +28.0 个百分点;在 512k token 处注意力加速最高 5.30 倍。已被 EMNLP 2026 主会接收。
为什么重要
prefill 的平方复杂度是长上下文 serving 的墙,而 RAG 类负载恰是 CRISP 声称对全注意力无质量损失的检索密集型场景。对自托管长上下文模型的团队,这是请求最贵阶段的即插即用加速候选。
技术细节
| ArXiv | 2609.01925,2026 年 9 月 3 日周四 digest 宣告 |
|---|---|
| 机构 | Adobe Research(一作 Huu Huy Nguyen,与 Franck Dernoncourt、Ryan Rossi 合作) |
| 机制 | C_struct 结构化代理替换基于 JSD 的头路由(去掉池化矩阵乘 + KL 开销);带 sink 感知阈值替换累积覆盖阈值(背景噪声只累积 O(n)) |
| 结果 | 两个模型家族上 InfiniteBench / RULER / LongBench 整体最强稀疏方法;检索密集基准追平或超过全注意力;恢复率最高 +28.0 个百分点;512k token 处注意力加速最高 5.30 倍 |
| 发表 | EMNLP 2026 主会 |
标签
long-contextsparse-attentionprefillservinginference-efficiency