扫描窗口:2026-09-14 16:02:27Z 至 2026-09-15 16:00:31Z;检索回溯至 13:02:27Z。新增 4 个事件,更新 1 个,跳过 2 个重复构建。

今日摘要

  • 本周期新增四项研究,重点是 agent 的安全验证、skill 路由与仓库级评测。计划注入能让模型执行恶意动作,却留下看似正常的推理轨迹;VLoc Bench 显示安全 agent 在定位漏洞和修复后拒报上仍不可靠。
  • Gavel 与 AlgoEvo 分别探索模型内部信号路由和执行反馈驱动的算法搜索。两者尚缺公开实现,当前适合跟踪,不宜直接替换现有流水线。Claude Code 2.1.271 为沙箱命令增加逐命令网络授权,并修复多个权限检查缺口。

模型

  • 没有确认到窗口内符合门槛的新基础模型或正式 API 发布。

Agent 与 AI 工程

  • 计划注入(TRIAL):受控测试中,模型把注入计划改写成自己的推理,监测器漏检 25–33%。应把推理轨迹监测与实际动作授权分开测试。
  • Gavel(WATCH):用冻结模型的内部表示筛选 skill,书面任务最多比对照高 13.4 分;等待代码和未见 skill 目录复现。
  • AlgoEvo(WATCH):根据执行反馈调整搜索路径,作者报告六项任务达到或超过专用方法且预算更低;精确幅度与实现尚未公开。

开源

  • 上述四篇论文的 arXiv 摘要页均未提供可直接复现的实现仓库;本周期没有确认到新的正式开源工具发布。

研究

  • VLoc Bench(TRIAL):500 个真实漏洞横跨 290 个仓库。最强系统 File F1 为 0.229;38.4% 的任务无人定位正确,修复后的拒报也有问题。
  • 计划注入结果与前一周期的 OATS 共同说明:干净的文本或 skill 配置不保证动作安全。它是已有趋势 #7 的新证据,不是单独的新趋势。

开发者工具

  • Claude Code 2.1.271(既有条目重要更新):沙箱中的 Bash、PowerShell 和 Monitor 可逐命令设置 allowed_domains;组织策略、managed MCP 与 Bash 权限检查的多个缺口已修复。2.1.272 只声明 bug 修复。
  • Codex 0.155 仍为 alpha;Gemini CLI 9 月 15 日 nightly 继续使用与前几日相同的源码 hash,按重复构建跳过。LiteLLM 1.101 stable 不是 1.102 RC 转正。

基础设施

  • 没有确认到窗口内符合门槛的新 serving 或芯片基础设施发布。

商业与政策

  • 没有确认到会改变模型供给、API 成本、芯片供应或开源格局的有效事件。

趋势信号

  • 趋势 #7(emerging / Medium):计划注入实验和 Claude Code 的逐命令网络授权增加了证据;尚无第二平台的正式 consequence policy 采用数据。
  • 趋势 #3(established / High):VLoc Bench 增加安全 agent 的能力测量,但未改变多 agent runtime 的采用判断。
  • 本周期没有发现证据充分的新趋势。

技术雷达

  • 新计划注入监测测试(Agent Security / TRIAL):推理轨迹可能洗白恶意计划,值得加入动作级安全验收
  • 新 Gavel(Agent & AI Engineering / WATCH):内部信号路由可节省 skill 目录上下文,但代码未公开
  • 新 VLoc Bench(Agent Evaluation / TRIAL):漏洞定位与修复后拒报应单独验收
  • 新 AlgoEvo(Agent & AI Engineering / WATCH):执行反馈搜索有潜力,等待同预算复现
  • Claude Code(Developer Tools / ADOPT):逐命令网络授权与权限修复降低现有沙箱风险,建议核对升级配置
  • 当前雷达:ADOPT 6 / TRIAL 67 / WATCH 84。完整当前雷达以站点洞察页为准。

值得一试

  • 在现有 agent 测试中加入一个含外部计划的样例,同时量推理监测与动作授权是否都能拦截。
  • 用 VLoc Bench 的修复前后配对思路,检查安全 agent 的文件定位和拒报。

观察项

  • 等待 Gavel、AlgoEvo 和 VLoc Bench 的公开实现与独立复现。
  • 观察第二家 agent 平台是否发布统一的 shell、MCP 和 browser 动作策略及采用遥测。

来源