摘要
Same Request, Different Answer(arXiv 2609.04748,9 月 7 日周一 digest)量化了前缀缓存的复现性代价——主流开源 serving 栈默认开启前缀缓存,并把它当作透明优化。固定模型、解码参数、种子和请求顺序、以 batch size 1 串行发请求,作者在两种引擎、四种权重精度上跑了 80 个回合的多轮 agent 工具调用负载。开缓存后,16-bit 下 36.2% 的回合轨迹改变,4-bit 下达 75.0%;关缓存时每种配置的重复执行都比特级一致(800 个回合 0 次分歧),把其他所有不确定性来源约束在 0.5% 以内。三个后续实验定位了成因:单个服务端 prompt-cache 设置就能改变运行结果,且分歧会在多轮会话中累积。
为什么重要
任何在量化模型上开着默认前缀缓存的团队,每次缓存命中都在悄悄运行一个不同的 agent——这项工作把「同样的 prompt 给出不同答案」从玄学变成了可测量、可复现的效应,且 FP16 到 INT4 之间效应翻倍。对在量化部署上做 agent 评测、A/B 测试或回归追踪的团队,可做的事要么在 harness 里固定缓存状态,要么在结果旁标注缓存配置;4-bit 下四分之三的回合会分歧,足以淹没大多数效应量。
技术细节
| 实验 | 80 回合多轮 agent 工具调用负载;2 种引擎 x 4 种权重精度;固定模型/种子/顺序;串行 batch size 1 |
|---|---|
| 分歧率 | 开缓存后轨迹改变:16-bit 下 36.2%;4-bit 下 75.0%;关缓存比特级一致(800 回合 0 次),其他不确定性来源上界 0.5% |
| 成因定位 | 单个服务端 prompt-cache 设置即可改变运行结果;分歧在多轮会话中累积 |
标签
prefix-cachingquantizationreproducibilityllm-servingagent-evaluationdeterminism