摘要
论文提出,有效的 agent 记忆系统必须能追踪世界状态的变化:事实、约束和决策会在长交互中被不断修订,答案必须反映当前状态,而不是已被取代的旧状态。作者把这一能力定义为状态追踪(state tracking),并发布 StateMemBench:234 个多会话场景、两种对话长度区间。评测采用闭集评分(closed-pool grading,在固定候选中判定答案反映的是当前状态、被取代状态还是其他失败),从构造上把状态追踪失败与其他错误区分开。现有记忆系统、RAG 基线和长上下文基线表现都不理想。论文提出的 StateMem 是状态优先(state-first)的记忆方法,显式追踪取代关系和关系依赖;当前状态准确率较最强同 backbone 基线提升 1.8 倍(DeepSeek-V4-Flash 上 0.205 → 0.363),较最强记忆系统提升 1.6 倍(Qwen-3.5-9B 上 0.149 → 0.233)。作为轻量的单次调用封装,StateMem 可以套在六个现有记忆/检索后端上,把当前状态准确率提升 +32 至 +67 点;长度与成本匹配的对照显示,其中 +15 至 +32 点来自状态结构本身而非新增上下文。
为什么重要
目前最好的绝对准确率也只有 0.363,说明状态追踪是所有现役记忆架构都没解决的失败模式;闭集评分让这个问题在生产评测中变得可测量。对正在做 agent 记忆的团队来说,封装版的结果(六个后端提升 +32 至 +67 点,只需单次调用)今天就能用:显式追踪取代关系,而不是指望 recall 型 benchmark 能覆盖这一点。这也是本周第三篇(前两篇为 ev-20260820-02、ev-20260821-02)指向同一结论的论文:聚合或 recall 型评估,看不到 agent 负载真正依赖的能力。
技术细节
| Benchmark | StateMemBench:234 个多会话场景、两种对话长度区间、闭集评分(当前状态/被取代状态/失败) |
|---|---|
| 基线 | 现有记忆系统、RAG 基线、长上下文基线,表现都不理想 |
| StateMem | 状态优先(state-first)的记忆方法,显式追踪取代关系与关系依赖 |
| 结果 | 较最强同 backbone 基线提升 1.8 倍:当前状态准确率 0.205 → 0.363(DeepSeek-V4-Flash) · 较最强记忆系统提升 1.6 倍:0.149 → 0.233(Qwen-3.5-9B) · 套在 6 个记忆/检索后端上的单次调用封装:+32 至 +67 点 · 长度/成本匹配对照:+15 至 +32 点可归因于状态结构本身 |
| 与知识库的关系 | 与 ev-20260820-02(arXiv 2608.18578)同属被覆写值召回研究线;本周评估盲区集群的第三篇 |
标签
agent-memorymemorybenchmarkstate-trackingevaluationagentsresearch