摘要

ExecCritic(arXiv 2609.09133,9 月 9 日周三 digest)针对 coding agent 的「假信心」失效:测试与补丁同轨迹写出、错误彼此一致,执行反馈全绿但行为是错的。test-verify-revise 脚手架拆开角色:Test agent 独立生成仓库原生测试,fail-closed harness 审定并冻结,Repair agent 按执行反馈改源码且不许改测试。两个角色都用 Qwen-3.5-35B-A3B 骨干、分别做角色专属 RL;在 Learn-to-Test 与执行反馈基准上优于单轨迹 agent。

为什么重要
跑 agentic CI 的人对「同一轨迹写测试又写补丁」的失效都不陌生。不用 RL 也能采用脚手架模式:让测试生成与修复走不同上下文即可消除相关错误失效;fail-closed 冻结是一条策略配置。
技术细节
ArXiv 2609.09133,2026 年 9 月 9 日周三 digest
脚手架 Test agent -> fail-closed 审定/冻结 -> Repair agent(不许改测试)
训练 两角色 Qwen-3.5-35B-A3B,角色专属 RL 分别训练
标签
coding-agentstest-generationreinforcement-learningexecution-feedbackagentic-ci