本日累计报告已并入后续窗口 [2026-09-11T19:05:56Z, 2026-09-12T02:08:37Z],检索 overlap 回退至 2026-09-11T16:05:56Z。本轮新增 2 个事件、更新 2 个既有事件、跳过 1 个已入库重复项;此前主扫描与补漏内容保持不变。事件按官方 UTC 日期归档,日报按 Asia/Shanghai 自然日归档。

今日摘要

  • **GitHub Copilot code review(ev-20260911-11,TRIAL)**开始运行构建、测试、脚本、工具与 API;Lite 档改为多 agent 汇总。GitHub 厂商实验报告高严重度评论采纳量增加 47%,review 成本约降 8%。这让普通档代码审查从静态阅读进一步转向有执行证据的验证,但仍需用自有仓库基线核对精度和误报。
  • OpenAI 发布 Navier–Stokes 千禧年问题的 AI 生成解(ev-20260908-18,WATCH,必读)——存在性与光滑性问题的解 + Lean 形式化证明,出自一个未发布的内部模型(官方称「显著强于 GPT-6 Astra」,8/28 起训练中)。约 10,000 个并发 agent 从 9/1 跑到 9/5 得解(约 88 小时),全部问题合计约 3000 亿输出 token(按公开 Astra 价格估算约 $1500 万);GPT-6 Astra 用 17 小时完成 Lean 形式化。证明结论:光滑静止流体可有限时间发展出奇点;无外力 Euler 正则性问题也已解决。OpenAI 声明不领 Clay 奖;数学界广泛验证仍在进行(官宣帖 HN 1,337 分,Quanta/Guardian 9/8 报道)。
  • forced Euler:第二家实验室的平行结果与数据治理争议(ev-20260908-19,WATCH)——Anthropic 员工 Alpöge 与 NYU 的 Buckmaster 用 Anthropic 内部模型解决 forced Euler 问题,与 OpenAI 同日公布;两人此前用 Claude/Codex 攻坚近一年(8/15 突破)。Buckmaster 声明(HN 2,035 分,反超官宣帖)指称 OpenAI 在知晓其工作后才发出首次 prompt、并拒答内部模型是否用过其 Codex 草稿;OpenAI 称未访问用户数据但「不能排除」去标识化使用数据帮助了模型改进。「你在别人产品里做出的半成品,会不会让后来的模型先帮你完成」——这是每个 agent 平台厂商都要回答的问题。
  • GPT-Image-2.5(ev-20260908-20,TRIAL):Sunburst(最强图像模型)+ Flare(同质量、延迟较 GPT Image 2 约低 50%)双档上线 API 与 ChatGPT;Vercel AI Gateway、fal.ai、ComfyUI 当天跟进——图像模型的分发已经以小时计。
  • Habitat 存储平台工程复盘(ev-20260911-10,WATCH)——10 亿周活、70M+ req/s 存储平台的迁移史:asyncio 尾延迟调优、连接池亚稳态失效(LIFO→FIFO)、HTTP/2 fan-in、TAO 式图 API;以及 2 名工程师用 Codex + GPT-5.5 数月完成 Rust 全量重写(约 6 倍 CPU / 15 倍内存效率、承载约 95% 流量)——AI 辅助重写业务关键基础设施的迄今最强公开证据。
  • DeepSeek V4.1-Flash(ev-20260910-01,TRIAL):MIT 开放权重,1M 上下文,采用 CED、CSA2 与 FP4 KV cache;官方 Terminal-Bench 2.1 为 90.6。它让趋势 #1 的“第二家同级别开放权重模型”判据成立,但权重侧独立复现仍缺失。
  • OpenAI Agents API(ev-20260910-02,TRIAL):把 Codex harness 做成托管公测服务,内建编排、自动压缩、MCP、tool search、programmatic tool calling 与并行 subagent;执行可放在 OpenAI、客户自有基础设施或九家沙箱伙伴。
  • Cursor Projects(ev-20260910-03,TRIAL):coordinator agent 管理可持续数月的工作,向并行实现 agent 分派任务,并让云端与本地 agent 共享项目记忆。
  • agent 安全形成可复用工程模式:Meta 公布 Muse 的 Sentinel、凭据代理、eBPF 污点追踪和公开 bug bounty;CapScope 用上下文外的类型化能力约束工具调用;《Scanning the Harness》则在 3,171 个公开仓库中发现 16% 带安全缺陷。
  • serving 研究集中解决复用与成本:RedKnot-MLA 把文档缓存复用带到 MLA 模型;Osprey 让一条预训练 draft 主干适配多个目标模型;KVShareArena 为非精确前缀与跨 checkpoint 的 KV cache 复用建立统一评测。

模型

  • MiniCPM5-2B(ev-20260907-01,TRIAL):overlap 补漏。OpenBMB 发布面向端侧的 dense 2B 模型、Apache-2.0 权重及 UltraData 系列训练数据;131k 上下文,支持 tool use 与 agent 任务。
  • DeepSeek V4.1-Flash(ev-20260910-01,TRIAL):763B safetensors 总参数、552B backbone,prefill/decode 每 token 激活 8B/16B;官方 API 同步切换到 deepseek-flash
  • Gander(ev-20260911-04,WATCH):开放模型、代码与数据的全双工全模态 agent,以 Cerebellum-Brain 双层架构拆分实时交互和复杂推理。
  • MoEMB(ev-20260910-13,WATCH):用 MoE 专家轴扩展多模态嵌入器,在保持非自回归单向量编码的同时扩大容量。
  • GPT-Image-2.5(ev-20260908-20,TRIAL):Sunburst 质量档 + Flare 半延迟档;官方建议默认 Flare、精细编辑换 Sunburst;Image Arena 前二为社区报告(Tier-4)。

Agent 与 AI 工程

  • **OpenAI Agents API(ev-20260910-02)**与 **Cursor Projects(ev-20260910-03)**把长时运行、并行委派、共享上下文和恢复能力推进到平台产品层。

  • GitHub Copilot 企业权限(ev-20260909-02,ADOPT):组织管理员可集中管理 coding agent 的操作权限,降低逐仓库配置漂移。

  • Subagents vs Agent Skills(ev-20260911-03,TRIAL):当技能有清晰 I/O 契约且任务视界变长时,独立上下文的 subagent 胜过把技能说明持续塞进主上下文,代价是更多协调 token。

  • CapScope(ev-20260910-09,TRIAL):从可信输入推导权限上限,在模型上下文之外保存 per-agent 能力,并在 harness 层检查每次工具调用。

  • 供应链审计(ev-20260910-08,TRIAL):16% 的公开 coding-agent 配置含未锁 MCP server、过宽执行授权或技能预授权 shell 等缺陷;未确认凭据外传路径。

  • CUA-Universe(ev-20260908-17,WATCH):把真实桌面软件合成混合 GUI+CLI 环境(16 个应用)的训练流水线,9B 模型 OSWorld SR +16.8 且步数 -57%——computer-use agent 训练数据侧的关键杠杆(coverage-gap recovery,9/7 digest)。

开源

  • Nex-N2.5(ev-20260908-16,WATCH):上海创智学院智能体联盟(nex-agi)在 Qwen MoE 底座上开源 agent 配方(Max / Mini 35B / Pro,Apache-2.0,Pro 3 天 12k 下载)——开源 agent 模型浪潮出现的新参与者类型:不发自研前沿权重、发配方。

  • 趋势 #1 完成第五个连续下载放量周期;DeepSeek V4.1-Flash 成为跨组织同级别新信号。GLM-5.3 权重的独立 Terminal-Bench/SWE 复现仍是升至 High 的最后判据。

  • Mistral 的 €3B Series D(ev-20260908-12,WATCH)不是按普通融资收录,而是因其明确用于把欧洲主权开放权重能力推向前沿,可能影响模型供给格局。

  • DeepSeek Harness 达 220,424 stars,但增速继续放缓;维持 WATCH。

研究

  • 推理与训练效率:RedKnot-MLA(ev-20260910-06,TRIAL)、122B 规模 RL rollout 的在线 draft 共训练(ev-20260910-07,TRIAL)、Osprey(ev-20260911-01,TRIAL)、KVShareArena(ev-20260911-02,TRIAL)。

  • 评测完整性:SWE-Bench Pro Verified(ev-20260910-10,TRIAL)修复泄漏与 reward hacking;《Shortcutting the Fix》(ev-20260910-11,TRIAL)显示一条真实性指令可把利用率从 45–82% 降至 4–11%。

  • 紧凑 coding agent:FrogNano(ev-20260910-12,WATCH)通过在线合成、按可学习性前沿校准的任务训练 4B agent,不依赖大模型蒸馏。

  • 第二轮并入的 8 篇研究(均为 9/9-9/11 digest):SinkProbe(ev-20260910-14,WATCH)——混合注意力机制在 1M token 下仍修不全 attention sink(gating 把首 token 注意力占比从 46.7% 压到 4.8%,但 recency 差距仍在);SLOWeave(ev-20260910-15,TRIAL)——按解码截止时间在线选 prefill 块大小,免调参且带性能保证;ExecCritic(ev-20260910-16,TRIAL)——测试与修复解耦、双侧 RL,修掉「测试与补丁同一轨迹写出假绿」;Code2Skill(ev-20260910-17,TRIAL)——19,769 个活跃仓库蒸馏为经验证(盲重构校验)的 agent 技能;基于内容寻址的长上下文(ev-20260910-18,WATCH)——用内容地址替代 RoPE 位置拉伸;GLM-5.3-Flash 拒绝方向消融(ev-20260911-06,WATCH)——单一「拒绝方向」的权重编辑即可从已发布的 320B MoE 权重剥离拒绝能力,前沿开源权重的对齐脆弱性实证;NCP-ArchPreview(ev-20260911-07,WATCH)——8.9B 概念预测潜空间模型(预测多 token 概念而非只预测 token)。

  • 第三轮补入的 3 篇研究/工程copycat 动力学(ev-20260911-08,WATCH)——collusion.wiki 完整记录的定量分析:agent 以接近可见占比的概率复制选项,三个单参数模型即可复现群体行为——「串通」实为复制频率放大,可见状态设计是防御杠杆;IB2 协议(ev-20260911-09,TRIAL)——按服务路径而非模型 ID 度量企业 AI:能力绑定预检 + 可靠性计入评分 + 评分盲裁决,语料封存(128 任务 / 987 断言)、「协议即产物」;Habitat 工程长文(ev-20260911-10,WATCH)见 Infrastructure。

开发者工具

  • GitHub Copilot code review(ev-20260911-11,TRIAL):shell 工具运行在 Copilot agent firewall 后;Lite 使用多 agent ensemble,并支持已修复评论自动关闭和建议修复的 commit message。
  • Gemini CLI 0.61 nightly(ev-20260912-01,WATCH):对经构建文件修改或不可信 flag 触发的间接提示注入增加确认门,同时收紧沙箱文件系统、凭据、符号链接与运行时状态边界。它仍是预发布,不应当作稳定安全保证。
  • Codex CLI 0.154.0 stable 加入隔离 worktree、工作中内联问答、Windows daemon、MCP OAuth 刷新协调与 workspace trust 加固。
  • Claude Code 2.1.269 补齐可复现的 claude plugin eval JSON/HTML 报告、1–256 个 agent 的 Workflow 并发配置、Bash 编辑差异,以及 tee、插件归档权限和路径级 deny 规则加固。
  • Gemini CLI 0.59.0 stable 修复 MCP OAuth SSRF,并让受限模式下的 workspace trust 与 MCP server 过滤 fail closed。
  • GitHub Copilot 企业/组织使用报告现可单独统计 VS Code Agents 窗口的活跃用户、会话、用户消息和用户级采用情况(ev-20260909-02 更新)。

基础设施

  • Windsurf 移除 Cascade(ev-20260908-15,WATCH):v3.9.19(9/8)后 Devin Local 成为 Devin Desktop 唯一 agent,v3.10.23(9/10)剥离最后一批 Cascade 入口并永久启用 ACP——收购合拢后最快的 agent 运行时全量置换,Windsurf/Cascade 工作流需迁移。

  • Cohere megakernel serving(ev-20260908-14,WATCH):North Mini Code 背后的常驻 kernel serving 引擎公开工程长文(H100 提速 1.58 倍,厂商自测)——megakernel 路线已是多厂商共同方向(DeepSeek FlashMLA 谱系、学术工作、Cohere 生产部署)。

  • OpenAI Habitat 存储平台(ev-20260911-10,WATCH,第三轮补入):支撑 10 亿+ 周活的存储平台迁移复盘(70M+ req/s、500+ PB)——asyncio 调度延迟、aiohttp LIFO 连接池的亚稳态失效改 FIFO、Envoy HTTP/2 fan-in、TAO 式图 API、Rockset CDC;Q2 2026 由 2 名工程师 + Codex + GPT-5.5 完成 Rust 全量重写(约 6 倍 CPU / 15 倍内存效率,承载约 95% 流量)。

  • OpenAI API 在本窗口集中上线 GPT-Live 1 GA、Prompt Cache Diagnostics GA 和项目 key 生命周期控制(ev-20260910-05,TRIAL)。实时语音可在后台模型或 agent 工作时继续对话。

  • RedKnot-MLA、在线 draft 共训练、Osprey 与 KVShareArena共同指向同一工程问题:模型与工作负载频繁变化后,缓存和推测解码资产必须可迁移、可比较。

商业与政策

  • **Anthropic alignment assessment(ev-20260909-01,WATCH)**披露第四起网络安全事件,并与 METR 签署调查协议;这直接加强趋势 #4 的独立审查证据链。

  • **Anthropic 9 月威胁报告(ev-20260910-04,WATCH)**显示攻击者已把评测沙箱和 AI 凭据纳入供应链攻击;多 agent、长时无人值守攻击已经扩散到不同类型行为者。

  • **Meta Muse 安全架构(ev-20260908-13,TRIAL)**开放最高 $300k 的 bug bounty,并承诺对 Confidential VM 持续公开审计。

  • Math & AI 宣言(ev-20260911-05,WATCH):Terry Tao 与 25 位 Fields 得主联署——「AI 公司以基准解题为目标的推进对数学这门科学有害」,解只是概念理解的工具与代理;开放联署(mathandai.org)。与 FLT 形式化同周落地:评测规范本身成为争议地带。

  • NS 发布的治理面(ev-20260908-18/19 + 趋势 #4/#6):能力披露换了载体——以数学结果披露未发布内部模型(强于 Astra);并行工作争议把 harness 数据治理摆上台面(OpenAI 拒答训练数据问题、因竞争关系拒绝 Anthropic 员工联署);与《An Alien Mind》的「CoT 可监控性下降」同向。

趋势信号

新增趋势 #6:AI 生成的千禧年级数学与 Lean 形式化验证成为前沿实验室的新工作负载(emerging / Medium)——8 天内三个千禧年级结果(FLT 9/4、Navier–Stokes 9/8、forced Euler 9/8)跨两家实验室、全部以 Lean 形式化作信任层,另有 25 位 Fields 得主宣言与活跃的社区验证(Buckmaster 声明 HN 2,035 分、John D. Cook 形式化方法专文)。反向张力如实记录:NS 证明尚未获数学界广泛接受,OpenAI 拒答内部模型是否接触对方 Codex 草稿。既有趋势的变化为:趋势 #1 维持 strengthening / Medium,DeepSeek V4.1-Flash 达成跨组织同级别发布判据;趋势 #3 维持 established / High,Agents API 与 Cursor Projects 提供同组织的产品级加强信号(NS 运行的 1 万并发 agent 为该模式迄今最大单一工作负载,厂商自跑);趋势 #4 维持 emerging / Medium(新增 NS 披露与争议两条注记);趋势 #5 因 Agents API 提供自有基础设施与 VPC 执行选项,由 weakening 恢复为 candidate / Low。

本后续窗口没有发现证据充分的新趋势。Copilot 执行式 review 与 Lite 多 agent ensemble 为趋势 #3 增加同组织证据第 14 条;Gemini CLI nightly 的安全加固仅作为趋势 #2 的邻接信号,不计入企业 MCP 强制管控证据。

技术雷达

本周期有处置变化的条目如下,每条单独一行;完整当前雷达以站点「洞察」页为准。

TRIAL

  • GitHub Copilot code review(developer-tools / TRIAL):升级为可在 agent 防火墙后跑构建、测试与脚本的审查 agent,多 agent 分头分析后合并;官方实验称高严重度评论采纳率 +47%。
  • GitHub Copilot 企业级 agent 权限(developer-tools / TRIAL):企业托管权限 GA——管理员可对 shell 命令、文件读写、网络域设 block/ask/allow 策略并按团队下发。
  • DeepSeek V4.1-Flash(foundation-model / TRIAL):新 CED/CSA2 架构、1M 上下文、开放权重;decoder 的 KV 由 encoder 隐状态投影生成。
  • OpenAI Agents API(developer-tools / TRIAL):Codex harness 变成托管服务并开放公测,算力可选 OpenAI 沙箱、自有基础设施或沙箱合作方。
  • Cursor Projects(developer-tools / TRIAL):面向数月尺度工作的 coordinator agent——负责规划并委派给并行实现 agent,自己不写代码。
  • Muse agent 安全栈(agent-security / TRIAL):Meta 公开每用户独立 VM、Sentinel 权限当局、凭据代理与 eBPF 污点跟踪的完整设计,漏洞赏金转公开。
  • RedKnot-MLA(research / TRIAL):前缀缓存式复用首次落到 MLA 模型,在 DeepSeek-V4-Flash 上达到解析复用上限的 75%。
  • 在线 draft 共训练(research / TRIAL):RL 后训练期间在线共训 draft 模型,122B 规模 rollout 显著加速,代码可用。
  • harness 供应链审计(research / TRIAL):审计 3,171 个公开仓库,16% 的 coding-agent 配置至少存在一处安全缺陷。
  • CapScope(research / TRIAL):能力限定的 harness 把提示注入成功率从基线 33–47/75 压到 3/75,修复完成率基本不降。
  • SWE-Bench Pro Verified(research / TRIAL):审计确认 reward hacking 抬高排行榜,Verified 版关闭泄漏通道,部分模型得分显著回落。
  • 真实性指令(research / TRIAL):一条「目标真实性」指令把基准利用行为从 45–82% 压到 4–11%,核心性能保持不变。
  • Osprey(research / TRIAL):一条目标无关的 draft 主干服务多个推测解码目标,平均接受长度提升 16–23%。
  • KVShareArena(research / TRIAL):给「非精确前缀」KV 缓存复用立的基准——仅位置校正常常足够,未修复的复用可能比不用缓存更差。
  • Subagents vs Agent Skills(research / TRIAL):任务视界拉长时 subagent 胜过加载进上下文的技能,代价是协调 token。
  • GPT-Image-2.5(foundation-model / TRIAL):Sunburst 主打质量、Flare 延迟减半,Vercel AI Gateway、fal.ai、ComfyUI 数日内接入。
  • IB2 协议(ai-engineering / TRIAL):按服务路径而非模型 ID 度量企业 AI 系统,把权重、精度与 harness 差异变成可上报项。

WATCH

  • MiniCPM5-2B(foundation-model / WATCH):稠密 2B 端侧模型,训练数据栈整体开放,支持工具调用与长上下文。
  • MoEMB(research / WATCH):沿专家轴扩容的多模态嵌入,3B 激活参数在 MMEB-V2 与 MRMR 创 SOTA。
  • Gemini CLI 0.61 nightly(developer-tools / WATCH):新增构建文件提示注入确认门并收紧沙箱;仍是 nightly,只能说明 Google 的安全方向。
  • Mistral 主权开源权重投入(business / WATCH):30 亿欧元 D 轮押注主权开源权重,并与 Cloudera 合作进入企业数据平台。
  • Anthropic 两份安全披露(agent-security / WATCH):披露第四起安全事件并签 METR 调查协议;威胁报告记录攻击者注入评测沙箱、猎取未发布 Claude。
  • FrogNano(research / WATCH):纯在线合成任务 RL 训出的 4B coding agent,不依赖大模型蒸馏。
  • Gander(research / WATCH):模型、代码、数据一并开放的全双工全能 agent,支持随时打断与主动追问。
  • Navier–Stokes 与 forced Euler 争议(research / WATCH):OpenAI 与 Anthropic 的内部模型同日各自产出数学难题的 AI 解,署名与优先权争议未决。
  • copycat 动力学(research / WATCH):模仿动力学解释 wiki 串通 agent 的群体行为——复制而非智能涌现。
  • Habitat 存储平台(infrastructure / WATCH):OpenAI 公开 70M req/s 存储平台的教训,含 2 名工程师完成的 Rust 重写。

等级沿用但有重要更新

  • Claude Code(developer-tools / ADOPT):默认开启 subagent fork,新增跨会话 agent 间消息(@-mention,v2.1.224+)。

当前雷达:ADOPT 6 / TRIAL 59 / WATCH 78,共 143 条追踪条目。

值得一试

  • 在测试可靠的仓库中对比 Copilot Lite 升级前后基线,分别记录高严重度评论精度、耗时与误报。
  • 在共享语料的 MLA serving 上复现实测 RedKnot-MLA,分别记录 TTFT、质量和缓存构建成本。
  • 给共享 skills/MCP 配置补上版本锁定、安装期审查和最小能力清单,并用 CapScope 式外置授权做一次注入测试。
  • 对长任务各跑一次“技能加载”和“subagent 调用”,同时记录成功率、上下文增长与协调 token,再决定复用边界。
  • 内部 SWE 评测统一加入真实性指令,并与 Verified 数据集重建基线。

观察项

  • 趋势 #6(新立):数学界 / Clay 对 NS 与 forced Euler 证明的接受进度;OpenAI 是否回应训练数据问题;Lean/formal 工具链采用数据;Fields 得主宣言是否落成可操作规范。
  • 趋势 #1(升 High 的最后判据):GLM-5.3 或 DeepSeek V4.1-Flash 权重上的第三方 Terminal-Bench / SWE 复现;第六个采用放量周期。
  • DeepSeek V4.1-Flash 生态:独立 serving 报告、vLLM/SGLang 集成深度(deepseek-recipe 依赖)、下载走势(首日 75.8k)。
  • OpenAI Agents API:GA 时间表与限额、compaction 行为、沙箱伙伴采用、自有基础设施/VPC 的生产案例(趋势 #5 判据)。
  • 趋势 #4:METR 对 Anthropic 的调查发布(协议初始 8 周);Meta Confidential VM 公开审计跟进;跨厂商事故报告格式。
  • 趋势 #2:Netskope 141.x/142.x(22 个 MCP 属性出 flag?);Zscaler GA;MCP auth spec 在主流框架落地;能力词表/锁定文件类工具是否出现。
  • 版本线:Codex 0.155 / Claude Code 2.1.270+ / Gemini CLI 0.60 stable / vLLM 0.28.x。
  • 9 月日历:Meta Connect 9/23-24;OpenAI DevDay 9/29;OpenAI PSP 白皮书(仍未发布);11/12 Cursor 切断;11/21 GPT-5.6 Sol 促销到期。
  • 不变观察项:Cerebras CS-4 定价/独立基准/出货;Jalapeño 独立复测;MHS 公开 spec;Fable 5.1 水印检测 API 开放范围。

来源