摘要

论文(arXiv 2608.22960)把 coding agent 的过程评估拆为 action、task、step 三层,并用 SCAE 实现 step 级因果归因——一个建立在 agent 执行结构因果模型上的重放式估计器,结合前缀条件识别、重放/干预式估计与对 judge 信息量的受控操纵。在 12 个仓库的 499 段文件定位轨迹上发现:下一步行动主要由执行历史驱动,而非代码图转移;全轨迹 LLM judge 存在系统性 collider bias——它们倾向于奖励语义相关性,而不是经过认证的因果贡献。

为什么重要
如果你的 agent 评估流水线在用 LLM judge 给整条轨迹打分,这条证据说明你测到的有一部分是「说得通」而不是「真有用」——拿这个数字卡上线有风险。基于重放与干预的 step 级归因跑起来更贵,但结论站得住,这在评估结果直接影响发布决策的场景里很关键。
技术细节
框架 过程评估三层:action、task、step;SCAE = 基于 agent 执行结构因果模型的重放式 step 级因果归因
方法 前缀条件识别;重放/干预式估计;对 judge 信息量的受控操纵
数据 499 段文件定位轨迹,12 个仓库
发现 下一步行动由执行历史而非代码图转移驱动;不确定性在 task 层结构化;全轨迹 judge 存在系统性 collider bias(语义相关性高于因果贡献)
代码 未放出
ArXiv 2608.22960,2026-08-24 提交
标签
agent-evaluationcoding-agentllm-judgecausal-inferenceevaluationresearch