摘要
ScienceIDE 把科学代码库封装成带版本的环境,并加入专家定义的案例、可执行任务和私有科学 verifier。同一套环境可用于监督微调、强化学习和评测。项目用通过验证的轨迹训练了 4B、9B 和 72B 三档 PhAI-IDE 模型。论文报告了留出科学代码修复任务及部分通用 coding、推理和知识 benchmark 的提升,并公开代码与模型产物。
为什么重要
对构建科研 agent 的团队来说,真正难的往往不是底座模型,而是环境和 verifier。ScienceIDE 给出了一套把成熟科学软件转成可执行学习经验的复用方法。建议先在一个测试完善的代码库上试验,不要把汇总 benchmark 提升直接当成跨领域科研能力。
技术细节
| 环境契约 | 带版本的代码库、运行环境、专家案例、验收标准和私有 verifier |
|---|---|
| 训练方式 | 基于已验证交互轨迹的监督微调与强化学习 |
| 模型 | PhAI-IDE-4B、PhAI-IDE-9B、PhAI-IDE-72B |
| 评测 | 留出科学代码修复任务,以及部分公开 coding、推理和知识 benchmark |
| 产物 | 公开代码仓库与模型链接 |
标签
ScienceIDEscientific-agentenvironmentverifierreinforcement-learning