扫描窗口:2026-09-16 16:00:47Z 至 2026-09-17 23:58:56Z;检索回溯至 13:00:47Z。新增 16 个事件,更新 3 个既有 release-line 条目,过滤 15 个重复、预发布、越界或低价值候选。

今日摘要

  • 本周期最重要的变化发生在 agent 的运营层。Anthropic 首次公开约 3 万并发内部 agent 的两级监控数据;GitHub 开始按 skills、agents 与 MCP 统计真实采用;OpenAI 则把失准事件从一次性长报告变成常态化分级披露。
  • 科研工程同时出现两类可落地信号:Anthropic 开源 36 套生物分子模型优化包,ScienceIDE 把科学代码库封装为可训练、可验证环境。安全侧,ASLEval 证明只看最终输出会漏掉接近一半的会话隐私暴露,Pydantic AI 也修补了 web fetch 与遥测边界。

模型

  • Astra for Law(WATCH):专用法律索引覆盖超过 2.3 亿个 URL,私有 benchmark 上明显超过普通 web search,但目前只对部分律所开放,API 尚未上线。
  • Anthropic Life Sciences Verification Program(WATCH):验证组织可申请更宽松的生物研究访问,代价是跨会话监控与 30 天命中活动留存。

Agent 与 AI 工程

  • Anthropic 3 万 agent 运营数据(TRIAL):内部平台在线与离线监控覆盖 100%,8 月在线判断超过 10 亿次,每周约 50 次升级人工。它给出了两级监控的真实规模账。
  • Google CC(WATCH):群组 agent 使用独立 Google Account,并区分共享记忆与个人记忆。多主体 agent 开始有明确身份与权限边界。
  • ASLEval(WATCH):只检查预期出口会漏掉可见出口并集发现暴露的 46.9%。隐私评测必须覆盖完整会话边界。
  • Reward-hacking probe(WATCH):内部表征中的简单向量可接近昂贵 LLM monitor,并在部分情况下提前预警后续作弊动作。
  • DualViewEval(WATCH):用过程信号把部分 agent benchmark 压缩 24 至 40 倍,适合持续回归,但需要周期性全量复核。

开源

  • Anthropic 生物分子优化包(TRIAL):36 套 Apache-2.0 工具包覆盖 exact、fast 与 big 模式。官方报告平均约 4 倍加速,但仓库不会持续维护。
  • UN System Data Commons(TRIAL):权威统计知识图谱上线,并通过 MCP 向 research agent 开放。
  • ScienceIDE(TRIAL):公开科学代码环境、训练流程和 4B/9B/72B 模型产物;仓库缺少明确 license,应先处理合规再试验。

研究

  • HOPE(TRIAL):二阶专家剪枝在 50% 剪枝时保住更多 agentic coding 能力,适合 MoE 自托管团队做工作负载匹配试验。
  • CASHEWS(WATCH):预处理让 LLM 恶意包扫描覆盖率升至 98.8%–100%,但没有公开实现。
  • rMuscle(WATCH):重复机器人任务间复用 VLA 内部状态,报告 1.29–1.42 倍加速;结论只适用于高重复工作负载。

开发者工具

  • GitHub Copilot 遥测(ADOPT):企业报告新增 skills、custom agents、MCP、plugins 与各 Copilot 产品面的 28 天采用数据。MCP interaction 统计连接尝试而非工具调用,解释时要校正失败重连。
  • Pydantic AI 2.44.0(ADOPT):修复两个网络策略绕过、一个二次方 web fetch 阻塞和一个遥测内容泄露;v1 也有回移版,应升级。
  • Codex 0.155(既有条目更新):MCP Touch ID、本地任务归档/删除、daemon 恢复与 WSL/凭据隔离进入 stable。
  • Claude Code 2.1.274–2.1.275(既有条目更新):补强 MCP 启动、nested/fork subagent 输出、plugin 完整性校验与 sandbox/resume 边界。

基础设施

  • HOPErMuscle 分别针对 MoE 权重内存和 VLA 重复执行做状态复用;两项都需在真实工作负载上重测延迟、质量与安全。
  • Z.ai 补充披露 GLM-5.3-Flash 在超过 10 万张国产 accelerator 上、不到两周完成适配到生产;核心 3 倍 serving 提升仍是厂商自报,已合并到既有事件。

商业与政策

  • OpenAI 失准披露框架(ADOPT):三档常态化流程一次公开六起案例,覆盖压缩、凭据、文件上传和跨 agent 通信。趋势 #4 因此从 emerging 升为 strengthening。
  • Anthropic Life Sciences Verification Program 把高风险能力访问做成验证组织和项目级权限,说明能力门控正从模型版本延伸到具体工作流。

趋势信号

  • 趋势 #3(established / High):3 万并发 agent、两级监控与 GitHub feature telemetry 补上大规模运营和采用证据。
  • 趋势 #4(strengthening / Medium):OpenAI 的常态化分级披露把安全事件报告推进为持续机制,但独立审查结果与跨厂商格式仍不足。
  • 趋势 #7(emerging / Medium):Codex MCP 用户验证、Google CC 独立身份和 ASLEval 完整出口边界继续把能力与后果控制拆开。
  • 本周期没有发现证据充分的新趋势。

技术雷达

  • 新 OpenAI 失准披露框架(Safety / ADOPT):把 agent 失准从偶发报告变成常态化三档流程
  • 新 Pydantic AI 2.44.0(Developer Tools / ADOPT):生产 agent 的 web fetch 与遥测边界需要立即升级
  • 新 GitHub Copilot 遥测(Developer Tools / ADOPT):skill、agent 与 MCP 采用终于可以按企业维度量化
  • 新 Anthropic 3 万 agent 运营数据(Agent Observability / TRIAL):两级监控的规模、命中与人工升级账首次公开
  • 新 Claude 生物分子优化包(Scientific AI / TRIAL):可复现的批量代码优化产物已公开,但需科学正确性复核
  • 新 UN Data Commons MCP(Research Agent / TRIAL):权威统计源可直接接入 agent 工作流
  • 新 ScienceIDE(Research Agent / TRIAL):科学代码变成统一训练与验证环境,先处理 license 风险
  • 新 HOPE(Infrastructure / TRIAL):MoE 剪枝要保留专家协作关系,而不只是逐专家打分
  • 新 Astra for Law(Models / WATCH):专用检索增益可观,但私有 benchmark 与限量访问不足以直接采用
  • 新 ASLEval(Agent Security / WATCH):最终输出干净不等于整个会话没有泄露
  • 新 Google CC(Agent / WATCH):群组 agent 的身份、记忆和权限边界值得跟踪
  • 当前雷达:ADOPT 9 / TRIAL 79 / WATCH 93。完整当前雷达以站点洞察页为准。

值得一试

  • 为生产 agent 枚举所有用户可见与外部出口,再按 ASLEval 思路重跑一次隐私测试。
  • 用 GitHub 新增的 28 天指标核对一个 skill 或 MCP server 是否真的被持续使用。
  • 在一个测试完备的科学代码库试跑 ScienceIDE 式环境封装,比较 verifier 建设成本与模型收益。

来源