本次运行扫描窗口为 [2026-08-24T00:00:29Z, 2026-08-28T00:31:03Z](约 4 天,检索 overlap 回退至 2026-08-23T21:00:29Z)。本日产出:5 个窗口内新事件(GLM-5.3-Flash 开源、Gemini CLI 0.57.0 将 A2A server 打进 stable、AutoSaddler / AgentWeave / SCAE 三篇研究)、5 个既有事件更新(GLM-5.3 权重落地、Codex 0.150.0/0.150.1、Claude Code 2.1.242–250、Cursor Origin 无仓库启动、Nvidia×Poolside 细节)。趋势侧有两个重要升级:趋势 #1(中国开源权重前沿 coding)因 GLM-5.3 权重落地 + Artificial Analysis 独立评测升级为 strengthening / Medium;趋势 #3(coding agent 收敛为 multi-agent runtime)因 Codex 0.150.0 的 agent 间消息 + Gemini CLI a2a-server 进 stable,确认判据 (a) 达成,升级为 established / High。本周期没有发现证据充分的新趋势。

今日摘要

  • 新事件:Z.ai 以 MIT 开源 GLM-5.3-Flash(ev-20260825-01,TRIAL)——320B 总参 / 18B 激活的原生多模态 MoE,GLM-5 系列首个全新底座(不再沿用 GLM-5.2),混合稀疏-线性注意力 + mHC,30T token 多模态预训练。官方称十分之一价格全面超过 GLM-5.2、coding/agentic 接近 Opus 4.8;Artificial Analysis 独立评分 57。对本轮中国开源潮,这是第一个纯 MIT(无营收门槛、无安全审查条款)的前沿级模型,且架构明确瞄准长上下文服务成本。
  • 新事件:Gemini CLI 0.57.0 stable 将 a2a-server 打进发布线(ev-20260825-02,WATCH)——v0.57.0(8/25)tag 内含 packages/a2a-server,并发布为 npm 包 @google/gemini-cli-a2a-server@0.57.0;release notes 合并了一整批 [SSR Agent] 修复。A2A 协议 server 从 main 分支实验变成 Google 稳定产物,但零文档零公告——当路线图信号看,别当构建目标。
  • 更新:GLM-5.3 权重落地(ev-20260814-02,维持 TRIAL)——zai-org/GLM-5.3(FP8,153 个文件)与 GLM-5.3-BF16 于 8/25 创建,较官方「两周后」(~8/28)提前约 3 天;总参数 753B,无门禁。许可证为自定义 glm-5.3:MIT 式宽松,唯一限制是年收入超 $10B 的 MaaS 业务商用前需过 Z.ai 安全审查。Artificial Analysis 独立评测 Intelligence Index 60(与 Kimi K3 持平、较 GLM-5.2 +7)。趋势 #1 确认判据(权重落地 + 独立评测)实质达成。
  • 更新:Codex 0.150.0 stable 落地 agent 间消息(ev-20260818-02,维持 ADOPT)——8/26 发布:@ 引用其他 Codex 任务,agent 可在终端读取、创建或向任务发消息——agent 发起的跨任务消息进入非 Anthropic stable 运行时,趋势 #3 判据 (a) 达成。另有 Interrupt hooks(回合中断触发命令/MCP handler)与一批安全加固(不可信项目不注入 AGENTS.md、凭据脱敏、应用签名校验)。0.150.1(8/27)修复远程压缩图片预算。
  • 更新:Claude Code 四天七发 2.1.242–250(ev-20260814-04,维持 ADOPT)——要点:2.1.248 的 --restricted 收敛模式(移除执行类内置工具、限工作目录、拒 bypassPermissions——CI/自动化场景的 confinement 方案);跨会话消息扩展到 Bedrock/Vertex/Foundry 及关闭遥测场景;2.1.247 的 /claude-api cost-optimize(按缓存、token 卫生、batch、effort 逐项测量降本);2.1.243 的 promptCacheTtl(主会话 1h / subagent 5m)与 modelPricing(组织合同价进 /cost)。
  • 更新:Cursor「Start from scratch」让 cloud agents 摆脱 GitHub 依赖(ev-20260817-02,维持 WATCH)——8/27 起 cloud agents 无需连接 SCM 即可开工,后台自动创建 Origin 仓库,浏览器实时预览 agent 环境,可接 Vercel 发布。Origin 仍是 early beta,但已成为无仓库路径的默认后端——coding agent 平台纵向整合的 early indication 进一步增强(仍单组织,不立项)。

既有事件更新

事件 更新内容 处理
GLM-5.3 发布(ev-20260814-02) 权重 8/25 落地 HF(FP8+BF16,753B,无门禁);glm-5.3 许可证条款(MIT 式 + $10B MaaS 安全审查条款);Artificial Analysis 独立评测 60 更新实体(technical_details.weights/license/independent_eval),推荐维持 TRIAL
Codex CLI(ev-20260818-02) 0.150.0 stable(8/26):@ 任务引用 + agent 读/建/消息任务、Interrupt hooks、安全加固;0.150.1(8/27):压缩图片预算修复 更新实体,推荐维持 ADOPT
Claude Code(ev-20260814-04) 2.1.242–250(8/24–8/27):--restricted 模式、跨会话消息多云扩展、cost-optimize、promptCacheTtl/modelPricing 等 更新实体,推荐维持 ADOPT
Cursor Origin(ev-20260817-02) 8/27「Start from scratch」:无 SCM 启动、自动 Origin 仓库、浏览器实时预览、Vercel 发布 更新实体,推荐维持 WATCH
Nvidia×Poolside(ev-20260822-01) Quartz 8/24(援引 WSJ):100+ Poolside 工程师加入 Nvidia 的 Nemotron 开源权重项目;截至 8/28 仍无官方确认 更新实体,推荐维持 WATCH

模型

  • GLM-5.3 开源权重(ev-20260814-02 更新):见 Executive Summary。工程视角的三个要点:许可证足够宽松(绝大多数企业不受限);day-0 支持 vLLM / SGLang / TokenSpeed / Transformers / KTransformers / Unsloth / vLLM-Ascend;模型卡披露后训练涌现的网络攻防能力(CyberGym 84.5 开源 SOTA、ExploitGym 较 GLM-5.2 翻倍以上)——与 OpenAI《Defender's Window》对 8 月底开源权重网络能力的预警直接呼应(背景交叉引用,见 ev-20260818-04)。
  • GLM-5.3-Flash(ev-20260825-01 新事件):见 Executive Summary。混合稀疏-线性注意力是主流开源权重里第一次大规模落地「线性注意力降长上下文成本」的验证,值得 infra 团队跟踪 vLLM/SGLang 的支持深度与实际吞吐数据。
  • 背景(不立事件):o3 于 8/26 从 ChatGPT 退役——90 天 sunset 期满,仅影响消费端模型选择器与 custom GPT,API 不受影响。与 2 月退役的 o4-mini、6 月退役的 GPT-4.5 同属例行清理。
  • 过滤:OpenAI 拟 Q4 IPO 抢先 Anthropic 上市(WSJ 8/26)与 Anthropic 机密 IPO 后续报道——普通资本市场新闻,不影响技术生态,按规则过滤;「Claude Opus 5 预计 Q3」类预测无技术细节,不采。

Agent 与 AI 工程

  • Gemini CLI a2a-server 进 stable(ev-20260825-02):见 Executive Summary。对 multi-agent 互操作而言,这是继 Anthropic SendMessage 之后第二家在稳定工具链暴露 agent 间消息面的巨头。
  • AgentWeave(ev-20260826-02,WATCH):推理前确定性过滤工具集——少暴露 70% 工具、少 62% 输入 token、降 51% 延迟;48 任务小样本,但「语义 top-8 选工具 0/48」是对相似度选工具这一默认做法的有力警示。MCP 工具目录膨胀的团队可参考其路由信号设计。
  • 趋势 #2(MCP 企业安全):窗口内无新信号。Netskope 官方 release notes 仍停留在 140.0.0(8/28 复核),22 个 MCP 数据属性未出 feature flag;Zscaler 1/27 新闻稿中的 MCP gateway 表述经核实为更早的覆盖前背景(同组织,不另计证据)。干净 GA 判据仍未满足。

开源

  • DeepSeek Harness(ev-20260814-05,延续观察):主仓 201,745 stars(8/28 核查;8/24 为 187,934,四天 +13.8k),最近 push 8/27。星速维持高位但按规则不构成趋势,维持 WATCH,等 API/plugin 面稳定后复评。
  • GLM-5.3 / GLM-5.3-Flash 开源(见 Models):HF 生态 day-0 就位(vLLM/SGLang cookbook、recipes.vllm.ai、unsloth 指南均已挂出)。

研究

  • AutoSaddler(ev-20260826-01,TRIAL):把 harness(prompt、工具配置、控制逻辑)当代码、从失败轨迹离线学习改进——GAIA2 / SWE-Bench Pro / Terminal-Bench 2.0 分别 +9.0 / +9.6 / +10.0 pp。代码已开源(aka.ms)。运营 coding agent 的团队可直接借鉴其「失败诊断 → 结构化补丁 → 留出验证」闭环。
  • SCAE 过程评估(ev-20260826-03,WATCH):499 段文件定位轨迹的证据显示全轨迹 LLM judge 有系统性 collider bias——打的是语义相关性而非因果贡献。用 LLM judge 给 agent 轨迹打分做发布门禁的团队需要警惕。
  • AgentWeave(ev-20260826-02,WATCH):见 Agent & AI Engineering。
  • 社区热度但不采为事件:arXiv 2608.25518(用游戏开发作可验证轨迹数据引擎 scaling world models,HF 112 票)——范式提案、摘要无数值无代码,暂列观察。

开发者工具

  • Claude Code 2.1.242–250(ev-20260814-04 更新,ADOPT):见 Updates 表。CI/自动化用户重点关注 --restricted;API 计费用户关注 modelPricingpromptCacheTtl
  • Codex CLI 0.150.0 / 0.150.1(ev-20260818-02 更新,ADOPT):见 Updates 表。编排多任务的用户可开始用 @ 任务引用替代手工传递上下文。
  • Gemini CLI 0.57.0 stable(8/25):除 a2a-server 外为可靠性修复(容量错误静默重试、取消回滚整轮请求、IDE 连接目录不匹配修复)。
  • OpenCode v1.18.22 / v1.18.23(8/24–25):常规修复(Cloudflare AI Gateway 第三方路由、Anthropic 虚线 slug、GitHub OIDC 登录),无新原语,不立事件。
  • Cursor 8/27 changelog:见 Updates 表。

基础设施

  • 窗口内无新独立信息;Cerebras CS-4 三项 watch(定价、独立 benchmark、出货确认)继续等待,无 MLPerf 提交。Nvidia×Poolside 的 Nemotron 归属(见 Business & Policy)若坐实,将成为美国开源权重供给侧的首个重量级项目。

商业与政策

  • Nvidia×Poolside(ev-20260822-01 更新,WATCH):新细节——100+ 工程师去向为 Nvidia 的 Nemotron 开源权重项目(Quartz 8/24 援引 WSJ);截至 8/28 仍无任何一方官方确认、无模型、无时间表、无许可证条款。评估不变:官方确认 / 模型产物 / 许可条款三者任一出现再升级。
  • 过滤:OpenAI Q4 IPO 计划(WSJ 8/26)、Anthropic IPO 进程报道(Reuters)、Anthropic Q2 营收 $11.5B(Fortune 8/15,覆盖前)——资本市场新闻,不影响模型获取、API 成本或开源格局。

趋势信号

本周期没有发现证据充分的新趋势。 两个 early indication 维持 watch(不立项):

  • Agentic retrieval loop:窗口内无第二家厂商等效产品(Mistral Agentic Search 8/20 后无跟进者)、无独立复现。
  • Coding agent 平台纵向整合:Cursor 8/27「Start from scratch」进一步把 Origin 变成默认后端(无 SCM 依赖、自动建仓、实时预览、Vercel 发布),纵向整合信号增强,但仍为单组织行为。

既有趋势复核:

  1. 中国 lab 开源权重 frontier coding 模型 — 升级为 strengthening / Medium:确认判据实质达成——GLM-5.3 权重 8/25 落地(宽松 glm-5.3 许可、无门禁、753B)+ Artificial Analysis 独立评测(60,与 Kimi K3 持平);同日 GLM-5.3-Flash 以纯 MIT 开源(同组织,加强信号)。未到 High 的原因:判据的另外两项(下一周期再出现一个同级发布、HF 下载增速持续)仍在等待,且独立评测针对 API 而非权重的社区复现。
  2. MCP 进入企业安全与治理阶段 — 维持 emerging / Medium(无新信号):Netskope 仍停在 140.0.0,22 属性未出 flag;Zscaler 1/27 MCP gateway 为覆盖前背景(同组织不另计)。干净 GA 判据未满足。
  3. Coding agents 收敛为 multi-agent runtime — 升级为 established / High:判据 (a)(agent-to-agent 语义消息落地非 Anthropic stable 运行时)由 Codex 0.150.0 达成(agent 可读/建/消息任务);同窗口 Gemini CLI 0.57.0 将 a2a-server 打进 stable 并发 npm 包,成为第七家组织(Google)在稳定运行时落地协议级互操作。残余缺口:Google 侧零文档、生产案例与采用遥测仍缺——已记为持续观察点,不再阻碍 established 定级。

技术雷达

新增:GLM-5.3-Flash(foundation-model / TRIAL)、Gemini CLI a2a-server(agent-protocol / WATCH)、AutoSaddler(agent-engineering 研究 / TRIAL)、AgentWeave(tool-routing 研究 / WATCH)、SCAE 过程评估(agent-evaluation 研究 / WATCH)。更新:GLM-5.3(foundation-model / TRIAL,权重已落地)、Codex CLI(developer-tools / ADOPT,0.150.1)、Claude Code(developer-tools / ADOPT,2.1.250)、Cursor Origin(developer-tools / WATCH,无仓库启动)。其余沿用 8/13–8/24 雷达。

值得一试

  • 自托管用户按 SGLang cookbook / vLLM recipes 起 GLM-5.3-Flash:MIT 许可 + 线性注意力长上下文,320B 总参需要多卡/多节点;先在长上下文负载上对比吞吐与显存,再决定是否进路由池。
  • 运营 coding agent 的团队本周就可以抄 AutoSaddler 的作业:不必上全套系统,先建立「失败轨迹 → 归因 → harness 补丁 → 留出验证」的周循环,这是 +9~10 pp 的来源。
  • CI 里的 Claude Code 换 --restricted:移除执行类工具 + 限工作目录 + 拒 bypassPermissions,比纯 permission prompt 更可审计。
  • 多任务编排改用 Codex @ 任务引用:让 agent 直接读/建/消息其他任务,减少人肉搬运上下文。

观察项

  • GLM-5.3 权重的社区独立复现(Terminal Bench / SWE 系列的第三方运行)与 HF 下载增速——趋势 #1 升 High 的剩余判据。
  • Gemini CLI a2a-server 的官方文档/公告——从 shipped-but-undocumented 转正的信号。
  • Codex 0.151 stable 线(alpha.9 已到 8/28;下一 stable 是否继续扩展任务间协作原语);Claude Code 2.1.251+(8/28 15:34Z 已发,窗口外,下次覆盖)。
  • 趋势 #2:Netskope 141.x 是否把 22 个 MCP 属性移出 feature flag;Zscaler AI Broker GA 状态;MCP auth spec 在主流框架落地。
  • Nvidia×Poolside / Nemotron:官方确认、模型产物、许可证条款任一出现即升级评估。
  • Mistral Agentic Search 的第二厂商等效产品(agentic retrieval loop early indication 转正式判据)。
  • 9 月:OpenAI ZDR/Private Safety 白皮书(ev-20260818-05);9/29:OpenAI DevDay11/21:GPT-5.6 Sol 促销价到期(ev-20260821-01)。
  • 背景日历:Astra / OpenAI 前沿 RL 恢复时间(ev-20260818-04);DeepSeek Harness API/plugin 面稳定后复评 TRIAL。

来源