AI Intelligence Trends - 2026-09-17

本周期没有发现证据充分的新趋势。

趋势 #1:中国实验室的开源权重 agentic coding 模型在前沿水平竞争

  • Status: strengthening / Medium
  • First observed: 2026-08-15
  • Last updated: 2026-09-15
  • Evidence 1: GLM-5.3 与 DeepSeek V4.1 Flash 已形成跨组织同级别开源权重供给,下载量连续多个周期增长。
  • Evidence 2: vLLM 与 SGLang 已为这批混合注意力与稀疏模型合并专用 serving 路径。
  • Evidence 3: 仍没有针对公开权重的第三方 Terminal-Bench 或 SWE 复现;OPEN-1B 解决训练可审计性,不改变 coding 能力判据。
  • Why it matters: 前沿 coding 能力与开放权重的差距继续缩小,但从厂商 API 评测迁移到自托管权重时仍缺最关键的独立复现。
  • What would confirm: 公开权重的第三方 Terminal-Bench / SWE 运行;下载与 serving 采用继续跨周期增长。
  • 2026-09-17 review: 状态与信心维持不变。

趋势 #2:MCP 进入企业安全与强制管控阶段

  • Status: emerging / Medium
  • First observed: 2026-08-15
  • Last updated: 2026-09-15
  • Evidence 1: Cloudflare、GitHub 与 Netskope 已在 gateway、策略与端点发现层提供 MCP 管控信号。
  • Evidence 2: 《Scanning the Harness》在 3,171 个仓库中量化了未锁定 MCP server 与预批准 shell 等供应链缺陷。
  • Evidence 3: Gemini CLI 0.60 把 MCP OAuth issuer 校验推入 stable,但它是客户端加固,不是第二家安全厂商的 GA 识别与遥测。
  • Why it matters: MCP 已从连接协议进入身份、策略与供应链治理阶段。
  • What would confirm: 第二家安全厂商交付 GA MCP 识别并公开遥测;主流 framework 落地统一 auth spec。
  • 2026-09-17 review: 维持 emerging / Medium。

趋势 #3:Coding agent 收敛为 multi-agent runtime

  • Status: established / High
  • First observed: 2026-08-15
  • Last updated: 2026-09-17
  • Evidence 1: 七家组织已在稳定或可安装工具中交付 agent 间消息、协调器或事件驱动任务原语。
  • Evidence 2: SWE-bench resolution audit 显示头部相邻排名不可区分,固定模型后的 scaffold 差距最高 29.8 分。
  • Evidence 3: 生产轨迹研究给出多 agent 层级的信息损失与成本交叉点;ScienceBuddy 公开 harness 演化与模型训练的分层闭环。
  • Why it matters: 选型对象已从单一模型变成 model、runtime、scaffold 与委派拓扑的组合,评测也开始覆盖过程与成本。
  • What would confirm: 两个以上独立组织的生产案例与采用遥测;社区编排接口收敛出事实标准。
  • 2026-09-17 review: 新证据提高可测性,不改变 established / High。

趋势 #4:前沿实验室把安全事件披露与第三方独立审查制度化

  • Status: emerging / Medium
  • First observed: 2026-08-26
  • Last updated: 2026-09-15
  • Evidence 1: OpenAI 与 Anthropic 已公开真实 agent 安全事件、监控方法与 Critical 级护栏框架。
  • Evidence 2: Anthropic 与 METR 签署常设调查协议,并承诺嵌入式第三方评估员。
  • Evidence 3: 外部研究者发现未进入厂商披露通道的 RubyGems 事件,说明制度仍有盲区。
  • Why it matters: 信任模型正在从厂商声明转向可验证披露与独立审查。
  • What would confirm: METR 正式审查、第二家实验室的常态化独立审查,以及跨厂商报告格式。
  • 2026-09-17 review: OPEN-1B 是训练溯源,不是事故披露证据;维持 emerging / Medium。

趋势 #5:AI 工具链的企业自托管 / 数据驻留执行面成形

  • Status: candidate / Low
  • First observed: 2026-08-18
  • Last updated: 2026-09-15
  • Evidence 1: Cursor self-hosted machines 让云 agent 在客户网络内执行。
  • Evidence 2: OpenAI Agents API 将托管沙箱、客户基础设施与九家沙箱伙伴做成执行环境菜单。
  • Evidence 3: ZDR、Private Safety Processing 与 Anthropic EFS 提供数据驻留方向,但后两项仍未完整落地。
  • Why it matters: 执行面位置正在成为与模型选择并列的企业采购轴线。
  • What would confirm: 两个以上独立生产案例;PSP 白皮书与 EFS 落地;更多非开发工具厂商提供自托管执行面。
  • 2026-09-17 review: JustFit 是本地推理容量研究,不构成企业执行面证据;维持 candidate / Low。

趋势 #6:AI 生成的千禧年级数学与 Lean 形式化验证成为前沿实验室的新工作负载

  • Status: emerging / Medium
  • First observed: 2026-09-04
  • Last updated: 2026-09-15
  • Evidence 1: Anthropic 公开形式化费马大定理工程;OpenAI 与 Anthropic 相关团队报告 Navier-Stokes 与 forced Euler 结果。
  • Evidence 2: 三项工作都把 Lean 或可验证证明作为信任层。
  • Evidence 3: 数学界开始公开回应并组织社区验证,但正式接受仍未完成。
  • Why it matters: 形式化验证为长时程 agent 输出提供了比普通 benchmark 更强的可信度层。
  • What would confirm: 数学界正式接受、第三方复现、Lean 工具链采用数据与可操作规范。
  • 2026-09-17 review: ScienceBuddy 是通用科研 agent,不构成本趋势证据;维持 emerging / Medium。

趋势 #7:Agent runtime 把宽执行能力与后果控制拆成两层

  • Status: emerging / Medium
  • First observed: 2026-09-09
  • Last updated: 2026-09-17
  • Evidence 1: GitHub Copilot、CapScope 与 OATS 分别提供组织级策略、task-scoped contract 与实时 consequence gate。
  • Evidence 2: Bash 接口实验与计划注入研究表明,宽执行面能提高能力,但推理轨迹不能替代动作授权。
  • Evidence 3: Gemini CLI 0.60、Claude Code 2.1.273 与 social-harness 实验继续把路径、身份、消息与后果检查移出模型。
  • Why it matters: 模型能生成什么和 runtime 允许什么后果,应成为两个可独立测试、审计与升级的模块。
  • What would confirm: 第二个平台的跨 shell / MCP / browser 统一正式策略、采用遥测与可互操作 policy schema。
  • 2026-09-17 review: 证据扩展到跨主体消息层,但正式跨平台采用仍不足;维持 emerging / Medium。