摘要

论文研究一个部署层面的问题:训练后量化是开源权重模型的默认部署方式,它会不会加剧前摄干扰(proactive interference)。前摄干扰指一个值被覆写的次数越多,模型越难回忆起它的最新版本,类似人类的工作记忆。作者用三种精度(FP16、INT8、INT4/NF4,走 bitsandbytes)在三个指令微调模型(Qwen2.5-7B-Instruct、Mistral-7B-Instruct-v0.3、Phi-3.5-mini-instruct)上跑固定检索任务。结果:INT4 在高干扰下显著拉低所有模型的准确率,Qwen2.5-7B 从 81.0% 跌到 68.3%;常被默认安全的 INT8 在三个模型中的两个上也有较小但真实的损失。消融实验把效应定位到被量化的 transformer 主干而非输出投影,且只在语义相近的干扰项下出现;same-key intrusion 错误从 21.5% 升到 24.6%(p = 4.8e-7),配对 McNemar 检验 p ≤ 2.6e-6。结论很直白:就算聚合 benchmark 看起来没变化,4-bit 量化也会悄悄拖累依赖长、可更新、语义密集上下文的应用。代码和数据已公开。

为什么重要
聚合 benchmark 看起来基本持平,但有一种能力在悄悄退化:在长而语义密集的上下文里记住被频繁更新值的最新版本,这正是 agent 负载依赖的。对用量化开源模型支撑 agent 工作区(记忆系统、可编辑文档、工具状态跟踪)的团队来说,这意味着 PI 类探针不再只是建议,而是量化上线前的必测项,不能只信标准 benchmark。整套方法成本低、可复现,代码和数据已公开。
技术细节
范围 FP16 vs INT8 vs INT4/NF4(bitsandbytes PTQ);Qwen2.5-7B-Instruct、Mistral-7B-Instruct-v0.3、Phi-3.5-mini-instruct
任务 带覆写累积的固定检索任务(前摄干扰范式)
结果 INT4 在全部 3 个模型上降低高干扰准确率(Qwen2.5-7B 81.0% → 68.3%) · INT8 在 3 个模型中的 2 个上有较小但真实的损失 · same-key intrusion 错误 21.5% → 24.6%(p = 4.8e-7)
统计 配对 McNemar 检验(p ≤ 2.6e-6);跨干扰水平混合效应回归
定位 问题出在被量化的 transformer 主干,不是输出投影;效应只出现在语义相近的干扰项下,数值对照组中方向反转
代码 github.com/ShayanShahrabi/compress-and-forget(代码与数据已发布)
与知识库的关系 量化与 agent 上下文的交叉问题;与 KV-cache 回滚一致性(ev-20260818-03)开启的「服务层隐藏行为变化」证据线互补
标签
quantizationbitsandbytesint4proactive-interferenceagentsmemoryreliabilityarxivresearch