扫描窗口:2026-09-13 16:00:31Z 至 2026-09-14 16:02:27Z;检索回溯至 13:00:31Z。新增 9 个事件,更新 0 个,跳过 1 个重复发布。

今日摘要

  • Agent 的工具接口出现一组可操作结论:Bash 在两套企业任务上比 typed tools 高 4.8–24.5 分,OATS 则证明 clean skill 仍需要运行时后果控制。两者与过去一周的企业权限、capability contract 和 agent firewall 汇合,形成趋势 #7:宽执行能力与后果控制正在拆层。
  • 同模型配对实验没有测出 Claude Agent SDK 或 Codex SDK 相对中立 harness 的平均解题率优势;真正明显的差异是中立 harness 每道成功题成本高 1.2–1.6 倍。ParaRecover 同时把并行工具错误的定位与重规划拆成过程指标。
  • AI 基础设施研究集中在效率边界:AMD 发布大规模 ROCm kernel 训练数据;SAS、SQD 与固定状态 diffusion cache 分别从训练、decode 拆分和缓存复杂度切入。结果有吸引力,但后三者尚缺公开权重或独立复现。
  • 物理 benchmark 的专家审计发现,152 个争议案例中有 148 个来自题目或 grader 错误。修复后前沿模型在闭集任务上的分数大幅上升,说明专业 benchmark 上线前必须有人类专家复核。

模型

  • 本窗口没有发现符合门槛的新模型或正式 API 发布。SAS 与固定状态 diffusion cache 是值得跟踪的架构研究,但尚未提供可直接采用的模型权重。

Agent 与 AI 工程

  • Bash 工具接口(TRIAL):在 TheAgentCompany 上提高 21.8–24.5 分,在 APEX 上提高 4.8–7.4 分,同时少用 19–72% token。试验必须放在严格沙箱里,并与策略层分离。
  • Harness 配对评测(TRIAL):同一模型、同一任务的结果没有显示厂商原生 runtime 的平均成功率优势。选型应同时量成功率、缓存修正后的成本与可观测性。
  • OATS(TRIAL):在 66,192 个 skill 版本上建立 consequence taxonomy;实时 gate 在实验中拦下 23/23 次禁用动作,中位 hook 延迟 67.6 毫秒。
  • ParaRecover(TRIAL):10,626 个样本覆盖 14 类并行工具错误,适合用来测试 agent 能否定位失败分支并只重跑必要步骤。

开源

  • AMD 开放 AMDKernelVault 的 HIP、Triton 与 ROCm QA 数据及 Apache-2.0 代码,可用于训练和评测 kernel agent。
  • OATS 与 ParaRecover 都公开实现;SAS 公开代码但仓库暂未声明 license,生产使用前需核实授权。

研究

  • SAS(WATCH):在持续训练 OLMo3-7B 的实验中,以语言建模损失直接学习 token 选择,短任务总体分数接近 dense attention,长上下文结果略高。
  • SQD(WATCH):把 decode 按子二次注意力阶段拆分,8×B200 代理实验与 Rubin/LPX 建模显示能效提高 31–56%;端到端收益仍依赖未来硬件与系统实现。
  • 固定状态 diffusion cache(WATCH):3B 模型实验显示 256K 上下文的状态与延迟不再随序列线性增长,并改善超长检索;尚无公开代码或 checkpoint。
  • 物理 benchmark 专家审计(TRIAL):修正题目与 grader 后,GPT-5.6 在 HLE 子集从 47.3 升至 78.7。不要把原始 leaderboard 当作可靠能力边界。

开发者工具

  • Codex 仅发布无说明的 0.155.0-alpha.4,不计入事件。Gemini CLI 的 9 月 14 日 nightly 与前两日使用相同源码 hash,按重复构建跳过;Claude Code 最新稳定版仍为 2.1.270。

基础设施

  • AMD 数据集适合做小规模 kernel-agent 微调与离线评测。SQD、SAS 与固定状态 cache 目前更适合 WATCH,等待公开 checkpoint、真实服务栈基准与第三方复现。

商业与政策

  • 本窗口没有发现会改变模型供给、API 成本、芯片供应或开源格局的有效事件。OpenAI 的 Perplexity/Astra 页面属于客户案例,没有足够技术细节,未入库。

趋势信号

  • 新趋势 #7:Agent runtime 把宽执行能力与后果控制拆成两层(emerging / Medium)。五组信号跨产品 GA、受控实验与开源 gate;工程动作是把命令生成与后果授权做成两个可独立测试、审计和升级的模块。
  • **趋势 #3(established / High)**新增 harness 配对实验与 ParaRecover,runtime 选型和恢复能力开始有可复用的测量协议。
  • 其余趋势没有足以改变等级的新证据;物理 benchmark 审计是评测质量信号,不等同于安全审查或形式化验证进展。

技术雷达

  • 新 Bash 工具接口实验(Agent & AI Engineering / TRIAL):企业任务成功率和 token 效率均有改善,但采用前提是强沙箱与独立策略层
  • 新 Harness 配对评测(Developer Tools / TRIAL):原生 runtime 未显示平均成功率优势,成本与可观测性应进入选型表
  • 新 OATS(Agent Security / TRIAL):静态 clean 不等于运行安全,实时 consequence gate 值得小规模验证
  • 新 AMDKernelVault(Infrastructure / TRIAL):大规模执行验证数据为 ROCm kernel agent 提供可复现实验入口
  • 新 SAS(Models / WATCH):端到端训练 sparse selector 有潜力,但需要公开权重与独立长上下文复现
  • 新 SQD(Infrastructure / WATCH):能效结果可观,端到端结论仍依赖建模与未来硬件
  • 新 ParaRecover(Agent Evaluation / TRIAL):为并行工具故障的定位、恢复和重规划提供细粒度基线
  • 新物理 benchmark 专家审计(Evaluation / TRIAL):专业评测上线前应加入专家复核与 grader 审计
  • 新固定状态 diffusion cache(Models / WATCH):长上下文复杂度优势明显,等待代码、权重和真实服务验证

当前雷达:ADOPT 6 / TRIAL 65 / WATCH 82。完整当前雷达以站点洞察页为准。

值得一试

  • 在一个现有 coding-agent 任务集上做 Bash 与 typed tools 的 A/B 测试,固定模型与预算,并记录成功率、缓存后成本和违规动作。
  • 用 OATS 或等价的确定性 gate 包住一个低风险 skill 流程,先测误报率、延迟和策略可解释性。
  • 用 ParaRecover 的错误分类检查当前并行工具流水线是否能只恢复失败分支。

观察项

  • 等待 SAS、SQD 与固定状态 diffusion cache 的公开 checkpoint、license 和独立复现。
  • 观察是否有第二家 agent 平台公开统一的 shell、MCP 与 browser consequence policy,并提供采用遥测。

来源