摘要

一项实证研究:商用 LLM API 迁移时,聚合 benchmark 分数到底掩盖了什么。作者在 GPT-5.4 → GPT-5.6 Sol 产品序列上做了三次成对升级,用 900 个公开 benchmark 条目(研究生级知识、奥数、指令遵循),每条目每模型查询 50 次,在错误发现率(FDR)控制和实际显著性阈值下,把每条目判定为可靠改进、可靠回退、实际等价或不确定。结果是九个迁移-benchmark 组合里改进与回退并存:聚合净涨最高 7.3 个百分点的升级,仍含至多 8.3% 的可靠回退条目;聚合净跌的升级也含至多 10.7% 的可靠改进条目。指令遵循上,最近一次迁移在严格评分下回退 3.9 分,宽松评分下只剩 0.04 分——评分口径一松,回退就「消失」了。完整的逐条回复归档和逐条评分输出已公开。

为什么重要
对用商业 LLM API 的团队来说,厂商弃用旧模型就得被迫迁移。这篇论文把「总分看着没问题」变成了一句可复现的警告:净涨分的升级照样带着两位数百分比的可靠行为回退,评分口径一松,回退就没了。它的方法——逐条目重复采样、FDR 控制、实际显著性阈值,加上公开的归档——可以直接拿来当迁移验收门禁。对 API 使用方来说,这比又多一个 leaderboard 有用得多。
技术细节
范围 3 组成对升级,GPT-5.4 → GPT-5.6 Sol 产品序列
方法 900 条公开 benchmark 条目 × 每条每模型 50 次查询;FDR 控制 + 实际显著性阈值;标签置换空假设校准
结果 聚合净涨 +7.3pp 的升级仍含至多 8.3% 可靠回退条目 · 聚合净跌的升级也含至多 10.7% 可靠改进条目 · 指令遵循的严格/宽松评分差距:3.9 分回退在宽松评分下缩至 0.04 分
产物 发布完整的逐条回复归档与逐条评分输出
与知识库的关系 DeepSeek V4-Pro 定价/GA 事件(ev-20260813-02)开启的强制迁移时代的实用配套;方法可直接用作迁移验收门禁
标签
llm-apimodel-migrationevaluationbenchmarksregression-testinggpt-5reliabilityarxivresearch