摘要

《Where the Verifier Fails》(arXiv 2609.01354,9 月 2 日周三 digest,独立作者 Esther Xin)审计了 RLVR 与基准评测共同依赖的自动验证器,方法是对验证器做蜕变测试:生成构造上保证数学等价的答案改写,因此任何拒绝都是可证明的假阴性。覆盖四个广泛使用的验证器、307,420 条判定:同一验证器对相同输入的自验证率在 53.8% 到 95.2% 之间(相差 41.3 个百分点);同一库的两种配置在 49.9% 的样本对上判定不一致;在默认 LaTeX 配置下,空白与标点占「契约内失败」的 93.0%(尾随句号与换行为主);某个数值级联会按数量级阶跃式接受差一位数的错误答案——低于 10^4 时 0%、达到及以上 100%——根源是尺度不变的相对容差。代码、变换套件、契约矩阵与逐样本判定记录均已公开。

为什么重要
每条 RLVR 流水线、每个基准榜单都压在这些验证器上,而失效模式偏偏是最无聊的那几种:尾随句号、换行、容差规则。对跑 RLVR 的团队,在自己的奖励栈上复现这套审计的成本很低,却能在相信奖励曲线之前先排掉雷——验证器判错会同时扭曲训练信号和评测排名,而同一库两种配置对一半样本判定不一致,意味着验证器配置本身就是实验变量。
技术细节
ArXiv 2609.01354,2026 年 9 月 2 日周三 digest 宣告(9/1 提交)
方法 对验证器做蜕变测试:构造性等价的答案改写,任何拒绝都是可证明的假阴性
规模 4 个广泛使用的验证器,307,420 条判定
发现 自验证不一致率 53.8%-95.2%(相差 41.3 个百分点);同库两种配置 49.9% 样本对不一致;空白 + 标点占默认 LaTeX 配置契约内失败的 93.0%(尾随句号 / 换行为主);某数值级联按数量级阶跃接受差一位数的错误答案(低于 10^4 时 0%、达到及以上 100%),根源为尺度不变的相对容差
代码 github.com/ethxin0011/verifier-error-budget(代码、变换套件、契约矩阵、逐样本判定记录)
标签
rlvrverifierreward-signalevaluationmetamorphic-testing