摘要

ScienceIDE 把科学代码库封装成带版本的环境,并加入专家定义的案例、可执行任务和私有科学 verifier。同一套环境可用于监督微调、强化学习和评测。项目用通过验证的轨迹训练了 4B、9B 和 72B 三档 PhAI-IDE 模型。论文报告了留出科学代码修复任务及部分通用 coding、推理和知识 benchmark 的提升,并公开代码与模型产物。

为什么重要
对构建科研 agent 的团队来说,真正难的往往不是底座模型,而是环境和 verifier。ScienceIDE 给出了一套把成熟科学软件转成可执行学习经验的复用方法。建议先在一个测试完善的代码库上试验,不要把汇总 benchmark 提升直接当成跨领域科研能力。
技术细节
环境契约 带版本的代码库、运行环境、专家案例、验收标准和私有 verifier
训练方式 基于已验证交互轨迹的监督微调与强化学习
模型 PhAI-IDE-4B、PhAI-IDE-9B、PhAI-IDE-72B
评测 留出科学代码修复任务,以及部分公开 coding、推理和知识 benchmark
产物 公开代码仓库与模型链接
标签
ScienceIDEscientific-agentenvironmentverifierreinforcement-learning