摘要

领域专家重新评阅 GPT-5.6 Sol、Fable 5 与 Gemini 3.1 Pro 在六个物理 benchmark 上的结果,把模型错误、题目缺陷、参考答案错误与评分器错误分开。公开来源 benchmark 中,原本判错的 152 个审计案例里有 148 个其实是 benchmark 或 grader 问题。修复或排除缺陷后,GPT-5.6 Sol 在 HLE-Physics 的 mean@4 从 47.3% 升至 78.7%,CMT-Benchmark 从 61.0% 升至 87.2%;保留 CritPt 题目的修正 pass@4 达 94.4%。修正分数基于保留或修复后的子集,不能直接当作原排行榜的同口径替换。

为什么重要
对用科学 benchmark 做模型路由或判断能力缺口的团队,评分器与参考答案的质量已经足以主导测得误差。高风险评测必须加入专家裁定、等价答案处理和保留集口径说明。修复后的闭集题目接近饱和,也意味着下一代评测要转向开放式建模与实验判断。
技术细节
Benchmark HLE-Physics、CMT-Benchmark、CritPt、PHYBench、PRISM-Physics、UGPhysics
模型 GPT-5.6 Sol、Claude Fable 5、Gemini 3.1 Pro
公开题源审计 原判错的 152 个案例中,148 个(97.37%)归因于 benchmark 或 grader 错误
GPT-5.6 Sol HLE-Physics mean@4 47.28%→78.66%;CMT 61.00%→87.24%;保留 CritPt mean@4 87.50%、pass@4 94.44%
评测警告 修复或排除题目后,原始分数与修正分数往往不基于同一题集
可用性 论文与详细审计表已公开;未链接代码仓库
标签
benchmark-auditscientific-reasoningevaluationphysicsllm-as-a-judge