摘要

CacheBridge(arXiv 2609.00891,9 月 2 日周三 digest)解决请求在多个 LLM 之间流转时的共享前缀重算问题:在保留闭式仿射映射器在线部署接口的同时,协同设计架构索引的映射器支撑、注意力对齐的校准与有界映射器构造。它改进了 Full-Head Mapping——后者每个目标头都从所有源头映射,对架构差异敏感,映射器的存储与应用成本随层支持增长。同一窗口还有独立并行工作《A Universal Context-Reuse Layer for Cross-Model KV Sharing》(2608.30963,9 月 1 日周二 digest),研究跨规模、跨架构、跨注意力配置、跨 tokenizer、跨模型家族的 KV 转译。

为什么重要
多模型流水线(路由到小模型、草稿到校验、通用到专精)目前每次交接都要付一次完整 prefill,而这恰恰发生在路由本该省钱的地方,成了成本大头。两个独立团队在同一窗口发表跨模型 KV 迁移,说明「KV 缓存只能本模型用」这个假设开始松动;跑模型路由栈的团队应该像 2025 年盯 prompt caching 一样盯住这条线。
技术细节
ArXiv 2609.00891,2026 年 9 月 2 日周三 digest 宣告
机制 源到目标 KV 的闭式仿射映射器,可在线部署;架构索引的映射器支撑 + 注意力对齐校准 + 有界映射器构造
改进对象 Full-Head Mapping(每个目标头从所选层的所有源头映射):迁移质量对架构差异敏感;映射器存储与应用成本随层支持增长
并行工作 arXiv 2608.30963《A Universal Context-Reuse Layer for Cross-Model KV Sharing》(9 月 1 日周二 digest):跨规模 / 架构 / 注意力配置 / tokenizer / 家族的 KV 转译;同家族(Qwen2.5-7B → Qwen2.5-1.5B)与跨家族均做了评测
知识库脉络 延续 KV 复用线:ReCache(2608.19662,8/21,工具增强 agent 的组合不变复用)、TwinKV(2608.27128,8/29,逐出修复)
标签
kv-cachecross-modelprefillmodel-routingservinginference-efficiency