摘要
FrogNano 是一个 4B 的 SWE agent,完全通过在约 1,500 个带合成任务的环境上做 RL 后训练得到;任务在每个检查点在线合成、按当前可学习性前沿校准,不依赖大模型蒸馏。结果是一个用自生成课程训出的、有竞争力的紧凑 coding agent。
为什么重要
这个配方把小 coding agent 训练对教师模型的依赖拿掉了:环境 + 可学习性前沿上的在线任务合成替代了蒸馏。对端侧/本地 coding agent,这是一条便宜的自生成训练回路。
技术细节
| ArXiv | 2609.07925(9 月 9 日周三 digest,2026-09-10T00:00Z 宣告) |
|---|---|
| 方法 | 纯 RL 后训练;约 1,500 个环境;任务按检查点在线合成、对齐可学习性前沿;无大模型蒸馏 |
| 结果 | 有竞争力的紧凑(4B)SWE agent(细节见论文) |
| 代码 | 摘要未提及 |
标签
coding-agentrl-trainingsynthetic-datasmall-models