今日摘要

  • Qwen3.8-27B 开放权重发布(Apache 2.0):27.8B 稠密多模态模型(图像/视频/文本),混合注意力架构(Gated DeltaNet + Gated Attention),262K 原生上下文,YaRN 可扩到 1M。SWE-bench Pro 61.7、OSWorld 84.3、Terminal-Bench 2.1 73.0。发布一天内拿下 9.2 万下载、319 个社区量化版本,Ollama 当天支持。对想单卡自托管 agent 模型的团队,这是目前的默认候选。
  • Zhipu 发布 GLM-5.3:与 GLM-5.2 同一底座,只做后训练扩展(post-training scaling),宣称是最强开源 coding 模型。Terminal-Bench 3.0 从 4.6 跳到 28.3,CyberGym 84.5%,领先美国前沿模型。另已发现 2,436 个漏洞,在 cvd.z.ai 公开登记。API 和 Coding Plan 即时可用,权重约在两周后通过安全审查开源。
  • Cloudflare 在 Zero Trust Gateway 中上线 MCP 流量检测与管控:通过 MCP-Protocol-Version 头识别 MCP 流量(含 2026-07-28 无状态规范),新增 experimental.is_mcp 选择器、MCP 专属面板和 Portal-only 强制策略。这是首个大规模部署的网络层 MCP 管控能力,正打在企业 agent 上线时 shadow MCP(员工私自接入的 MCP 服务)失控这个痛点上。
  • Claude Code 2.1.232/233 转向多 agent 运行时:subagent forking 默认开启,fork 出的子 agent 继承对话和 prompt 缓存;支持跨会话 @ 消息互通;新增 cgroup 内存限额;网关侧可按用户统计花费。代价是:新模型上默认移除了 todo 工具(breaking)。
  • DeepSeek 开源 Harness(dsh,MIT):DeepSeek 自家基准测试背后的 TypeScript agent 运行时,设计理念是 "everything is a plugin"。扫描时 108k stars,社区报道首日 24k+。目前只是开发者预览,后续会有破坏性变更。
  • SpaceX 600 亿美元收购 Cursor 交割:Grok 4.6 是合作的首批产物。模型厂商加 IDE 的垂直整合,正在成为竞争模板。
  • Anthropic 公开 Claude 文本水印机制:适用于 2026-08-02 之后发布的 Claude 模型,机器可读、肉眼不可见。做内容溯源(provenance)流水线的团队需要跟进。

模型

Qwen3.8-27B(Alibaba / Qwen)

  • 稠密 27.78B、Apache 2.0、262K→1M 上下文、image-text-to-text
  • SWE-bench Pro 61.7 · LiveCodeBench v6 90.3 · GPQA Diamond 89.2 · OSWorld-Verified 84.3 · Terminal-Bench 2.1 73.0(对照:DeepSWE 1.1 只有 42.2,长程软件工程任务上和 Max 版本仍有差距)
  • vLLM / SGLang / transformers / Ollama 均已支持;OpenRouter $0.45/$3.20
  • 评估:TI 4 · EV 5 · AS 4 · Maturity 3 · Risk 2 → TRIAL(本地或自托管跑 coding agent 的用户,可以直接拿它当默认候选验证)

GLM-5.3(Zhipu / Z.ai)

  • 1M 上下文 / 128K 输出;Z.ai Code Bench +50%;Terminal-Bench 3.0 28.3(声称开源 SOTA);CyberGym 84.5%
  • 即时可用:GLM Coding Plan(兼容 Claude Code / OpenCode);API "coming soon";权重约 8/28 前后放出
  • 评估:TI 4 · EV 4 · AS 3 · Maturity 3 · Risk 3 → TRIAL(benchmark 均为自报,权重落地前别重仓)

Anthropic 水印机制说明

  • 适用于 2026-08-02 后发布的模型;托管模型正在逐步切换 → WATCH(做 provenance/检测流水线的团队相关)

Agent 与 AI 工程

Cloudflare MCP 流量检测与强制管控

  • 检测方式:TLS 解密后看 MCP-Protocol-Version 头。2025-11-25 规范要求携带该头;2026-07-28 无状态规范下每个 POST 都会带,并新增 Mcp-Method/Mcp-Name
  • experimental.is_mcp == true 选择器向全部 Zero Trust 客户开放;MCP 面板可看请求数、唯一用户/服务器、Portal 与直连对比、top shadow servers。
  • Portal-only 强制:基线规则拦截不走 mcp_portal 的 MCP 流量;Portals 支持预注册 OAuth 客户端;Agents SDK v0.20.0 支持无状态规范(client+server)。
  • 评估:TI 4 · EV 4 · AS 3 · Maturity 4 · Risk 3(前提是能做 TLS 解密,且接受 Cloudflare 依赖)→ TRIAL(已经在 CF One 上的组织;否则 WATCH)

开源

DeepSeek Harness(dsh)

  • MIT、TypeScript/Node、Cordis 框架、"everything is a plugin"、兼容 AGENTS.md/CLAUDE.md
  • npx @deepseek-ai/dsh web 即可启动;目前是开发者预览
  • 108k stars / 10.4k forks(扫描时);首日 24k+ 是社区报道数字
  • 评估:TI 3 · EV 4 · AS 4 · Maturity 2 · Risk 3 → WATCH(它是 DeepSeek agent loop 的参考实现,读代码的价值很高)

其他开源信号

  • Ollama v0.32.12/13(8/14 16:37Z / 19:16Z):day-0 支持 Qwen3.8-27B 及其 developer instructions
  • GitHub trending(8/15 快照,星速集中在 Claude Code 生态资产):
    Project 信号 为什么重要 Action
    cathrynlavery/diagram-design ~1,619 stars/day 给 Claude Code 用的 29 种编辑级图表(自包含 HTML/SVG) WATCH
    cactus-compute/needle ~551 stars/day 14MB 的端侧基础模型 WATCH
    citrolabs/ego-lite ~546 stars/day 自称"最快 agent 浏览器",与 Codex/Claude Code 共享登录态 WATCH(安全面需审)
    MakazhanAlpamys/Soup ~303 stars/day 一个 YAML 文件微调 LLM,4GB 笔记本 GPU 能训 8B WATCH
  • Tenable 开源 CyberAgents Exchange(安全 agent 交换项目,目前只有新闻稿级验证)— WATCH
  • HF《State of Open Models: Summer 2026》报告(日期未经一手来源验证)— 值得读

研究

(本窗口内没有新增的可见 arXiv 论文。arXiv 周五/周六暂停 announce,窗口内提交的论文会在周日/周一公告后出现,属预期行为。8/13 边界论文见 daily/2026-08-13.md。)

开发者工具

Claude Code 2.1.232/233(Anthropic)

  • forking 默认开启、跨会话 SendMessage、GitLab MR 与插件市场、多项安全修复;.233 增加 cgroup 内存限额、按用户统计花费、修复 MCP v2 重连
  • breaking:新模型(Opus 4.8 / Sonnet 5 / Fable 5 / Mythos 5+)默认禁用 todo 工具
  • 评估:TI 3 · EV 4 · AS 4 · Maturity 4 · Risk 3 → ADOPT(现有用户直接升级;先检查依赖 todo 工具的工作流)

ChatGPT Linux 桌面公开预览(Ubuntu/Debian/Fedora,含 Codex)— WATCH

基础设施

  • Cerebras 预告 8/18 直播 SUPERNOVA 2026,预计发布新的推理产品。这是 Ultrafast 合作之后下一个值得盯的点。〔WATCH〕

商业与政策

  • SpaceX × Cursor 交割($60B 全股票,6/16 达成、8/14 交割):Grok 4.6 是首批整合产物,组织架构细节暂未公布。对模型获取、默认模型和定价的中期影响还要再观察。〔WATCH〕

趋势信号

首次运行,无历史基线。本日观察到的候选信号(详见 trends/current.md,均为 Low confidence、emerging):

  1. 中国实验室的开源 agentic coding 模型在前沿水平上扎堆竞争(Qwen3.8-27B、GLM-5.3 同日发布,前后还有 Kimi K3、Muse Glimmer)
  2. MCP 进入企业安全与强制管控阶段(Cloudflare 落地管控;无状态规范生效)
  3. Coding agent 工具普遍演化成多 agent 运行时(Claude Code forking/消息互通、Copilot Agent Plugins、DeepSeek Harness)

技术雷达

项目 状态 变化
Qwen3.8-27B TRIAL 新增
GLM-5.3 TRIAL 新增
Cloudflare MCP enforcement TRIAL 新增
Claude Code 2.1.23x ADOPT 新增(升级)
DeepSeek Harness (dsh) WATCH 新增
Gemini 3.7 Flash TRIAL 新增(8/13)
DeepSeek V4-Pro TRIAL 新增(8/13)
Copilot Agent Plugins TRIAL 新增(8/13)
Cursor Builds WATCH 新增(8/17 默认开启后再评估)
OpenAI Ultrafast WATCH 新增(8/13 边界)
Anthropic watermark WATCH 新增
ChatGPT Linux desktop WATCH 新增

值得一试

  1. Qwen3.8-27B:在本地或 OpenRouter 上跑自己的 coding-agent 任务集(半天到一天),对照当前默认模型,看 SWE 类任务通过率和上下文利用率。
  2. Gemini 3.7 Flash:挑一条高并发 agent loop 做价格/质量 A/B,介绍期内成本优势最大。
  3. Cloudflare is_mcp 日志(如已在 CF One 上):先只开日志,摸清 shadow MCP 的规模,再决定要不要上强制策略。

来源