摘要

FrogNano 是一个 4B 的 SWE agent,完全通过在约 1,500 个带合成任务的环境上做 RL 后训练得到;任务在每个检查点在线合成、按当前可学习性前沿校准,不依赖大模型蒸馏。结果是一个用自生成课程训出的、有竞争力的紧凑 coding agent。

为什么重要
这个配方把小 coding agent 训练对教师模型的依赖拿掉了:环境 + 可学习性前沿上的在线任务合成替代了蒸馏。对端侧/本地 coding agent,这是一条便宜的自生成训练回路。
技术细节
ArXiv 2609.07925(9 月 9 日周三 digest,2026-09-10T00:00Z 宣告)
方法 纯 RL 后训练;约 1,500 个环境;任务按检查点在线合成、对齐可学习性前沿;无大模型蒸馏
结果 有竞争力的紧凑(4B)SWE agent(细节见论文)
代码 摘要未提及
标签
coding-agentrl-trainingsynthetic-datasmall-models