摘要
Tail-Replay(arXiv 2608.30310,9 月 1 日周二 digest)为全注意力与线性注意力交替的混合 LLM 实现了 token 级前缀复用。全注意力的 KV 缓存可以按 token 寻址,但线性注意力的循环状态无法回滚到任意位置,因此现有混合模型前缀缓存只能存循环状态检查点、只在检查点对齐的位置复用。Tail-Replay 从最近的状态检查点重放序列尾部,使前缀复用可以在任意 token 边界发生,解除离散边界限制。同一期 digest 还有 DASC(2608.30386):利用 Gated DeltaNet 与 Kimi Delta Attention 中不同头、不同信道的「保持时标」差异,压缩混合模型的循环状态检查点。
为什么重要
开源权重前沿刚切换到混合架构(GLM-5.3-Flash、Qwen3.8-Flash-Next),而前缀缓存是 agentic serving 里最大的成本杠杆——但朴素的混合架构服务会把大部分缓存收益丢掉,因为循环状态回不去。这两篇论文正是 serving 栈在补课:自托管混合注意力模型的团队,在套用全注意力模型的缓存经济账之前,应该先盯住这类技术在 vLLM / SGLang 路线图上的落地。
技术细节
| ArXiv | 2608.30310(Tail-Replay),2026 年 9 月 1 日周二 digest 宣告 |
|---|---|
| 问题 | 混合 LLM 前缀缓存:全注意力 KV 可按 token 寻址;线性注意力循环状态不能回滚,现有方法靠存状态检查点,复用被限制在检查点对齐的边界 |
| 机制 | 从最近的已存循环状态重放序列尾部,使前缀复用可以到达任意 token 级边界 |
| 同批工作 | 同期相关:DASC(2608.30386)——利用逐头、逐信道的保持时标压缩混合循环状态检查点(Gated DeltaNet、Kimi Delta Attention);DAMP(2608.27513)——感知衰减的循环状态混合精度量化 |
| 相关性 | 直指混合注意力开源权重浪潮(GLM-5.3-Flash、Qwen3.8-Flash-Next)的服务成本 |
标签
prefix-cachingkv-cachehybrid-attentionlinear-attentionservinginference-efficiency