摘要
《What Attention Recalls and Recurrence Controls in Hybrid Language Models》(arXiv 2609.04434,9 月 7 日周一 digest)在注意力+递归混合模型上引入两个缓存层干预:split-prefill(prefill 后只保留 KV 缓存或只保留递归状态再生成)和 state-swap(单次前向中把一个上下文的 KV 缓存与另一个上下文的递归状态配对)。在 Qwen3.5 和 Falcon-H1 上两个通道按功能尖锐分化:精确检索只能经注意力存活(全精度准确率的 64-98%),经递归完全归零;而输出语言与人设正好相反(经递归以 70-80% 和 3-5 倍存活,仅 KV 时语言准确率掉到约 1%)。state-swap 给出因果确认:答案的取值来自 KV 侧,答案的语言来自递归侧。作者总结:注意力提供「说过什么」的查表;递归状态塑造「接下来说成什么样」。
为什么重要
这是对当前正以开源权重落地的混合架构(GLM-5.3-Flash、Qwen3.8-Flash-Next——趋势 #1)两个通道首次干净的因果分工拆解,而且正落在 serving 工程的设计点上:前缀缓存与状态检查点必须区别对待 KV 侧和递归状态——只有注意力承载精确回忆,只存递归状态的缓存会无声地丢失查表能力却保留风格与人设。做混合模型缓存或状态迁移的团队应分开测两个通道;本文提供了现成的干预协议。
技术细节
| 干预 | split-prefill:prefill 后只留 KV 缓存或只留递归状态再生成;state-swap:单次前向中把一个上下文的 KV 与另一上下文的递归状态配对 |
|---|---|
| 模型 | Qwen3.5、Falcon-H1 |
| 发现 | 精确检索只经注意力存活(全精度的 64-98%),经递归归零;语言/人设经递归存活(70-80%、3-5 倍),仅 KV 时语言准确率约 1%;state-swap:答案取值来自 KV 侧,语言来自递归侧 |
| 一句话 | 注意力 = 「说过什么」的查表;递归状态 = 「接下来说成什么样」 |
标签
hybrid-attentionlinear-attentioninterpretabilityprefix-cachingkv-cachecausal-analysis