摘要

MLA 把注意力打包进单一潜在 KV 流,抹掉了头级复用依赖的每头缓存边界。RedKnot-MLA 把每个不可变文档在规范位置 0 离线处理(认证的本地头贡献保留为 MLA-Off);服务时,查询侧 RoPE 重定位恢复请求位置,同时重算少量全局头与受保护的本地 token 行(MLA-On),在共享输出投影前合并——打包的潜在向量从不被拆开。在 DeepSeek-V4-Flash(37 个可复用层、56/8 本地/全局分割)上达到解析复用上限的 75.29%(Pro-0813 为 78.89%);热工件 TTFT 提升 2.02-3.84 倍,256K 下每个主要算子节省 78.7-79.5% 算力,质量波动小(聚合 F1 +3.24、EM +4.16;一个数据集 -2.81 F1)。约 2.0 倍 QPS 的数字被标注为初步结果而非存档结果。

为什么重要
标准前缀缓存在 MLA 模型(DeepSeek V4/V4.1 serving)上是盲的,而这恰是 RAG 与多 agent 工作负载复用文档的地方。RedKnot-MLA 把文档级复用带回这一架构家族——对任何用共享语料 serving DeepSeek 模型的团队都直接相关。
技术细节
ArXiv 2609.07008(9 月 9 日周三 digest,2026-09-10T00:00Z 宣告)
机制 规范位置 0 离线处理文档(MLA-Off,认证本地头贡献)+ 服务时查询侧 RoPE 重定位(MLA-On,少量全局头重算 + 受保护本地行);打包潜在向量从不拆分
结果 DeepSeek-V4-Flash:解析上限的 75.29%(Pro-0813 78.89%);热工件 TTFT 2.02-3.84 倍;256K 下每算子省 78.7-79.5% 算力;聚合 F1 +3.24 / EM +4.16,一个数据集 -2.81 F1;~2.0x QPS 为初步结果
代码 摘要未提及
标签
kv-cacheprefix-cachingmladeepseekserving