摘要
这篇论文对 3 个 LLM 和 11 种压缩方法做了系统评估,考察的是聚合指标(perplexity、accuracy)容易掩盖的三个维度:知识保持、模型置信度、社会偏见。主要发现有三个。第一,压缩对常见知识(head knowledge,高频出现的常识内容)的损害明显大于长尾知识(tail knowledge)。第二,压缩后的模型对刚丢失的知识给出错误答案时往往依然很自信,校准在不知不觉中劣化。第三,聚合偏见分数看似稳定,背后却可能是各人口子群体刻板偏好方向相反的移动相互抵消。结论是压缩会带来聚合指标看不见的不对称行为变化,部署前必须做细粒度评估。
为什么重要
这是两天内第二篇指出「聚合指标掩盖压缩损害」的论文,前一天是 bitsandbytes 的前摄干扰退化研究(ev-20260820-02,8/20)。本篇覆盖更广(11 种压缩方法 × 3 个模型),还补上了置信度/校准与偏见子群体两个维度。两篇合起来意味着:部署压缩模型前做细粒度行为探针,不再只是建议,而是上线前的必测项。「答错了还很自信」这一点,对依赖模型自我评估做分支决策的 agent 流水线尤其危险。
技术细节
| 范围 | 3 个 LLM × 11 种压缩方法;知识保持、置信度、社会偏见 |
|---|---|
| 发现 | 常见知识(head knowledge)的相对保持率受损明显大于长尾知识(tail knowledge) · 压缩后的模型对刚丢失知识给出的错误答案仍保持高置信度 · 聚合偏见分数看似稳定,实则掩盖各子群体刻板偏好方向相反的移动 |
| 启示 | 部署前需要细粒度行为评估;只看聚合 perplexity/accuracy 不够 |
| 与知识库的关系 | 延续 ev-20260820-02(arXiv 2608.18578,2026-08-20)开辟的压缩 × 行为研究线;独立团队得出同一元结论 |
标签
compressionquantizationevaluationcalibrationbiasdeploymentresearch