摘要

ScienceBuddy 把研究者的请求、反馈和执行证据转成新任务与评测规则。内层循环在模型不变时修改 agent harness;外层循环再用改进后的 harness 强化模型。作者公开工作台与代码,并展示四类科研任务案例。现有证据仍是作者自测的小规模案例,不是独立生产力研究。

为什么重要
对构建科研 agent 的团队来说,它提供了一种具体做法:从日常交互中学习,同时把 harness 修改与模型更新拆成两个可观察循环。可先试验从轨迹生成评测规则的流程,再考虑递归训练。用户反馈可能带入局部偏好或错误,因此仍需人工复核和留出集评测。
技术细节
循环 内层在模型不变时演化 harness;外层用改进后的 harness 做强化学习
界面 对话、轨迹时间线、计算与结果面板
评测 覆盖四类科研任务的案例
可用性 公开产品站点与 GitHub 仓库
局限 作者自测案例;没有独立生产力或安全评估
标签
research-agentself-improvementharnessreinforcement-learningopen-source