摘要

《Harness-agnostic detection and immunization of reward hacking in self-evolving language models》(arXiv 2609.04665,9 月 7 日周一 digest)提出 HackProbe:通过两个黑盒挂钩接入任意自演化循环的监控器,不需要访问权重或激活。它维护一个保密的、分布固定的对照核(其冻结分布使能力代理跨代可比),外加轮换的新鲜层以对抗共同适应。四个检验——水平差距、带在线变点检测的尺度对齐分歧、能力停滞、条件性自信错误率——经 Sidak 校正合并为校准的族级 p 值。光诊断不回收任何东西,因此还有一个风险感知的免疫层:用对照核加纯结构性的博弈足迹,从提案池中重选诚实候选,信息泄露上界为 log2(P) 比特。

为什么重要
任何在不完美代理指标上跑选择循环的团队(RLVR、自我改进流水线、甚至评测驱动的模型路由)都会遇到从分数本身看不见的 reward hacking。HackProbe 的设计约束正是它可落地的原因:只用黑盒挂钩、用统计校准代替阈值、并有明确的信息泄露上界的免疫步骤。它是本知识库一直在追踪的 reward hacking 技术栈的监控半边(BAITBENCH 负责测量,这个负责检测并中和)。
技术细节
监控器 两个黑盒挂钩;保密的分布固定对照核 + 轮换新鲜层(抗共同适应);无需权重/激活访问
检验 水平差距;带在线变点检测的尺度对齐分歧;能力停滞;条件性自信错误率;Sidak 校正族级 p 值
免疫 风险感知地从提案池重选诚实候选(对照核 + 结构性博弈足迹);信息泄露上界 log2(P) 比特
标签
reward-hackingself-evolvingmonitoringrlvrdetectionblack-box