摘要

这项配对研究固定模型,在每组 80 个私有仓库任务与训练截止后竞赛题上,对比 Claude Agent SDK、Codex SDK 与中立的 LangGraph/deepagents harness。792 次有效运行中,厂商原生 harness 没有呈现可确认的平均解题率优势:Opus 4.8 为 -1.25 分,GPT-5.5 为 +1.25 分,两组置信区间都跨过零。中立 harness 的工具调用约多一倍,按观测用量计算,每解出一题的成本高 1.2–1.6 倍。论文还纠正了自身早期对 cache token 的统计错误。

为什么重要
对在可移植 harness 与厂商原生 runtime 之间选型的团队,能力差异应在自己的任务上测,不能从品牌直接推断。即使解题率接近,成本与完成行为仍可能明显不同。由于任务集私有且经过筛选,Anthropic 的账单排序也未定,这份结果适合辅助决策,不适合作为通用排行榜。
技术细节
实验矩阵 Opus 4.8 上 Claude Agent SDK 对比 deepagents;GPT-5.5 上 Codex SDK 对比 deepagents
运行规模 计划 800 次,792 次有效评分;每组配对对比 80 个任务
解题率差 原生减中立:Opus 4.8 为 -1.25 分,95% CI [-10.0, +7.5];GPT-5.5 为 +1.25 分,95% CI [-4.4, +6.9]
成本 按观测用量,中立 harness 在 Opus 上每题成本为 1.3–1.6 倍,在 GPT-5.5 上为 1.2 倍;Anthropic 实际账单排序未定
公开内容 orchestrator、评分器、drift gate、重分析代码与派生统计;任务本身保持私有
方法警告 不同 SDK 的 cache-token 语义不同,早期统计曾把遥测高估 5–8 倍
标签
coding-agentagent-harnessevaluationcostprompt-cachingbenchmark-contamination