摘要
领域专家重新评阅 GPT-5.6 Sol、Fable 5 与 Gemini 3.1 Pro 在六个物理 benchmark 上的结果,把模型错误、题目缺陷、参考答案错误与评分器错误分开。公开来源 benchmark 中,原本判错的 152 个审计案例里有 148 个其实是 benchmark 或 grader 问题。修复或排除缺陷后,GPT-5.6 Sol 在 HLE-Physics 的 mean@4 从 47.3% 升至 78.7%,CMT-Benchmark 从 61.0% 升至 87.2%;保留 CritPt 题目的修正 pass@4 达 94.4%。修正分数基于保留或修复后的子集,不能直接当作原排行榜的同口径替换。
为什么重要
对用科学 benchmark 做模型路由或判断能力缺口的团队,评分器与参考答案的质量已经足以主导测得误差。高风险评测必须加入专家裁定、等价答案处理和保留集口径说明。修复后的闭集题目接近饱和,也意味着下一代评测要转向开放式建模与实验判断。
技术细节
| Benchmark | HLE-Physics、CMT-Benchmark、CritPt、PHYBench、PRISM-Physics、UGPhysics |
|---|---|
| 模型 | GPT-5.6 Sol、Claude Fable 5、Gemini 3.1 Pro |
| 公开题源审计 | 原判错的 152 个案例中,148 个(97.37%)归因于 benchmark 或 grader 错误 |
| GPT-5.6 Sol | HLE-Physics mean@4 47.28%→78.66%;CMT 61.00%→87.24%;保留 CritPt mean@4 87.50%、pass@4 94.44% |
| 评测警告 | 修复或排除题目后,原始分数与修正分数往往不基于同一题集 |
| 可用性 | 论文与详细审计表已公开;未链接代码仓库 |
标签
benchmark-auditscientific-reasoningevaluationphysicsllm-as-a-judge