扫描窗口:2026-09-14 16:02:27Z 至 2026-09-15 16:00:31Z;检索回溯至 13:02:27Z。新增 4 个事件,更新 1 个,跳过 2 个重复构建。
今日摘要
- 本周期新增四项研究,重点是 agent 的安全验证、skill 路由与仓库级评测。计划注入能让模型执行恶意动作,却留下看似正常的推理轨迹;VLoc Bench 显示安全 agent 在定位漏洞和修复后拒报上仍不可靠。
- Gavel 与 AlgoEvo 分别探索模型内部信号路由和执行反馈驱动的算法搜索。两者尚缺公开实现,当前适合跟踪,不宜直接替换现有流水线。Claude Code 2.1.271 为沙箱命令增加逐命令网络授权,并修复多个权限检查缺口。
模型
- 没有确认到窗口内符合门槛的新基础模型或正式 API 发布。
Agent 与 AI 工程
- 计划注入(TRIAL):受控测试中,模型把注入计划改写成自己的推理,监测器漏检 25–33%。应把推理轨迹监测与实际动作授权分开测试。
- Gavel(WATCH):用冻结模型的内部表示筛选 skill,书面任务最多比对照高 13.4 分;等待代码和未见 skill 目录复现。
- AlgoEvo(WATCH):根据执行反馈调整搜索路径,作者报告六项任务达到或超过专用方法且预算更低;精确幅度与实现尚未公开。
开源
- 上述四篇论文的 arXiv 摘要页均未提供可直接复现的实现仓库;本周期没有确认到新的正式开源工具发布。
研究
- VLoc Bench(TRIAL):500 个真实漏洞横跨 290 个仓库。最强系统 File F1 为 0.229;38.4% 的任务无人定位正确,修复后的拒报也有问题。
- 计划注入结果与前一周期的 OATS 共同说明:干净的文本或 skill 配置不保证动作安全。它是已有趋势 #7 的新证据,不是单独的新趋势。
开发者工具
- Claude Code 2.1.271(既有条目重要更新):沙箱中的 Bash、PowerShell 和 Monitor 可逐命令设置 allowed_domains;组织策略、managed MCP 与 Bash 权限检查的多个缺口已修复。2.1.272 只声明 bug 修复。
- Codex 0.155 仍为 alpha;Gemini CLI 9 月 15 日 nightly 继续使用与前几日相同的源码 hash,按重复构建跳过。LiteLLM 1.101 stable 不是 1.102 RC 转正。
基础设施
- 没有确认到窗口内符合门槛的新 serving 或芯片基础设施发布。
商业与政策
- 没有确认到会改变模型供给、API 成本、芯片供应或开源格局的有效事件。
趋势信号
- 趋势 #7(emerging / Medium):计划注入实验和 Claude Code 的逐命令网络授权增加了证据;尚无第二平台的正式 consequence policy 采用数据。
- 趋势 #3(established / High):VLoc Bench 增加安全 agent 的能力测量,但未改变多 agent runtime 的采用判断。
- 本周期没有发现证据充分的新趋势。
技术雷达
- 新计划注入监测测试(Agent Security / TRIAL):推理轨迹可能洗白恶意计划,值得加入动作级安全验收
- 新 Gavel(Agent & AI Engineering / WATCH):内部信号路由可节省 skill 目录上下文,但代码未公开
- 新 VLoc Bench(Agent Evaluation / TRIAL):漏洞定位与修复后拒报应单独验收
- 新 AlgoEvo(Agent & AI Engineering / WATCH):执行反馈搜索有潜力,等待同预算复现
- Claude Code(Developer Tools / ADOPT):逐命令网络授权与权限修复降低现有沙箱风险,建议核对升级配置
- 当前雷达:ADOPT 6 / TRIAL 67 / WATCH 84。完整当前雷达以站点洞察页为准。
值得一试
- 在现有 agent 测试中加入一个含外部计划的样例,同时量推理监测与动作授权是否都能拦截。
- 用 VLoc Bench 的修复前后配对思路,检查安全 agent 的文件定位和拒报。
观察项
- 等待 Gavel、AlgoEvo 和 VLoc Bench 的公开实现与独立复现。
- 观察第二家 agent 平台是否发布统一的 shell、MCP 和 browser 动作策略及采用遥测。