摘要
KVMem(arXiv 2609.04852,9 月 7 日周一 digest)是为长时运行 agent 设计的 KV 上下文虚拟化系统:溢出的工作区历史不再被压缩成摘要、也不再以文本形式重复检索(前者丢失细粒度执行证据,后者反复 prefill 已处理过的内容),而是作为分页 KV 状态保留在 GPU 显存、主机内存和 NVMe 之间。轻量的模型原生注意力空间索引选取相关历史块,按需物化一个受模型原生上下文窗口约束的、随查询变化的执行视图。在历史最长达一百万 token 的长上下文 agent 基准(LongMemEval、MemoryAgentBench、AgentLongBench)上,KVMem 的任务效用和推理效率总体优于压缩类方案——后者是上下文溢出的事实标准(论文含 Qwen3.8-27B 的 DeepSWE 长上下文测试)。
为什么重要
这解决的是长时运行 agent 最大的实践缺口:压缩有损、重复检索昂贵,而模型已经算好的 KV 被直接扔掉。把 KV 分页到主机内存/NVMe 并用注意力空间索引管理,是 agent 记忆领域一直缺的存储层级设计,而且单张消费级 GPU 就能跑。在做常驻工作区的团队(云代理、长 coding 会话)这里拿到的是保持全保真历史、又不用付无界上下文成本的设计模板。
技术细节
| 方案 | 溢出历史以分页 KV 状态存于 GPU 显存/主机内存/NVMe;模型原生注意力空间索引选取相关块;物化受原生上下文窗口约束、随查询变化的执行视图 |
|---|---|
| 基准 | LongMemEval、MemoryAgentBench、AgentLongBench;历史最长 100 万 token;另有 Qwen3.8-27B 的 DeepSWE 长上下文测试 |
| 对比 | 任务效用与推理效率总体优于压缩类方案(事实标准) |
标签
agent-memorykv-cachevirtualizationlong-contextservinglong-running-agents