今日摘要
- Qwen3.8-27B 开放权重发布(Apache 2.0):27.8B 稠密多模态模型(图像/视频/文本),混合注意力架构(Gated DeltaNet + Gated Attention),262K 原生上下文,YaRN 可扩到 1M。SWE-bench Pro 61.7、OSWorld 84.3、Terminal-Bench 2.1 73.0。发布一天内拿下 9.2 万下载、319 个社区量化版本,Ollama 当天支持。对想单卡自托管 agent 模型的团队,这是目前的默认候选。
- Zhipu 发布 GLM-5.3:与 GLM-5.2 同一底座,只做后训练扩展(post-training scaling),宣称是最强开源 coding 模型。Terminal-Bench 3.0 从 4.6 跳到 28.3,CyberGym 84.5%,领先美国前沿模型。另已发现 2,436 个漏洞,在 cvd.z.ai 公开登记。API 和 Coding Plan 即时可用,权重约在两周后通过安全审查开源。
- Cloudflare 在 Zero Trust Gateway 中上线 MCP 流量检测与管控:通过
MCP-Protocol-Version头识别 MCP 流量(含 2026-07-28 无状态规范),新增experimental.is_mcp选择器、MCP 专属面板和 Portal-only 强制策略。这是首个大规模部署的网络层 MCP 管控能力,正打在企业 agent 上线时 shadow MCP(员工私自接入的 MCP 服务)失控这个痛点上。 - Claude Code 2.1.232/233 转向多 agent 运行时:subagent forking 默认开启,fork 出的子 agent 继承对话和 prompt 缓存;支持跨会话
@消息互通;新增 cgroup 内存限额;网关侧可按用户统计花费。代价是:新模型上默认移除了 todo 工具(breaking)。 - DeepSeek 开源 Harness(dsh,MIT):DeepSeek 自家基准测试背后的 TypeScript agent 运行时,设计理念是 "everything is a plugin"。扫描时 108k stars,社区报道首日 24k+。目前只是开发者预览,后续会有破坏性变更。
- SpaceX 600 亿美元收购 Cursor 交割:Grok 4.6 是合作的首批产物。模型厂商加 IDE 的垂直整合,正在成为竞争模板。
- Anthropic 公开 Claude 文本水印机制:适用于 2026-08-02 之后发布的 Claude 模型,机器可读、肉眼不可见。做内容溯源(provenance)流水线的团队需要跟进。
模型
Qwen3.8-27B(Alibaba / Qwen)
- 稠密 27.78B、Apache 2.0、262K→1M 上下文、image-text-to-text
- SWE-bench Pro 61.7 · LiveCodeBench v6 90.3 · GPQA Diamond 89.2 · OSWorld-Verified 84.3 · Terminal-Bench 2.1 73.0(对照:DeepSWE 1.1 只有 42.2,长程软件工程任务上和 Max 版本仍有差距)
- vLLM / SGLang / transformers / Ollama 均已支持;OpenRouter $0.45/$3.20
- 评估:TI 4 · EV 5 · AS 4 · Maturity 3 · Risk 2 → TRIAL(本地或自托管跑 coding agent 的用户,可以直接拿它当默认候选验证)
GLM-5.3(Zhipu / Z.ai)
- 1M 上下文 / 128K 输出;Z.ai Code Bench +50%;Terminal-Bench 3.0 28.3(声称开源 SOTA);CyberGym 84.5%
- 即时可用:GLM Coding Plan(兼容 Claude Code / OpenCode);API "coming soon";权重约 8/28 前后放出
- 评估:TI 4 · EV 4 · AS 3 · Maturity 3 · Risk 3 → TRIAL(benchmark 均为自报,权重落地前别重仓)
Anthropic 水印机制说明
- 适用于 2026-08-02 后发布的模型;托管模型正在逐步切换 → WATCH(做 provenance/检测流水线的团队相关)
Agent 与 AI 工程
Cloudflare MCP 流量检测与强制管控
- 检测方式:TLS 解密后看
MCP-Protocol-Version头。2025-11-25 规范要求携带该头;2026-07-28 无状态规范下每个 POST 都会带,并新增Mcp-Method/Mcp-Name。 experimental.is_mcp == true选择器向全部 Zero Trust 客户开放;MCP 面板可看请求数、唯一用户/服务器、Portal 与直连对比、top shadow servers。- Portal-only 强制:基线规则拦截不走
mcp_portal的 MCP 流量;Portals 支持预注册 OAuth 客户端;Agents SDK v0.20.0 支持无状态规范(client+server)。 - 评估:TI 4 · EV 4 · AS 3 · Maturity 4 · Risk 3(前提是能做 TLS 解密,且接受 Cloudflare 依赖)→ TRIAL(已经在 CF One 上的组织;否则 WATCH)
开源
DeepSeek Harness(dsh)
- MIT、TypeScript/Node、Cordis 框架、"everything is a plugin"、兼容 AGENTS.md/CLAUDE.md
npx @deepseek-ai/dsh web即可启动;目前是开发者预览- 108k stars / 10.4k forks(扫描时);首日 24k+ 是社区报道数字
- 评估:TI 3 · EV 4 · AS 4 · Maturity 2 · Risk 3 → WATCH(它是 DeepSeek agent loop 的参考实现,读代码的价值很高)
其他开源信号
- Ollama v0.32.12/13(8/14 16:37Z / 19:16Z):day-0 支持 Qwen3.8-27B 及其 developer instructions
- GitHub trending(8/15 快照,星速集中在 Claude Code 生态资产):
Project 信号 为什么重要 Action cathrynlavery/diagram-design ~1,619 stars/day 给 Claude Code 用的 29 种编辑级图表(自包含 HTML/SVG) WATCH cactus-compute/needle ~551 stars/day 14MB 的端侧基础模型 WATCH citrolabs/ego-lite ~546 stars/day 自称"最快 agent 浏览器",与 Codex/Claude Code 共享登录态 WATCH(安全面需审) MakazhanAlpamys/Soup ~303 stars/day 一个 YAML 文件微调 LLM,4GB 笔记本 GPU 能训 8B WATCH - Tenable 开源 CyberAgents Exchange(安全 agent 交换项目,目前只有新闻稿级验证)— WATCH
- HF《State of Open Models: Summer 2026》报告(日期未经一手来源验证)— 值得读
研究
(本窗口内没有新增的可见 arXiv 论文。arXiv 周五/周六暂停 announce,窗口内提交的论文会在周日/周一公告后出现,属预期行为。8/13 边界论文见 daily/2026-08-13.md。)
开发者工具
Claude Code 2.1.232/233(Anthropic)
- forking 默认开启、跨会话
SendMessage、GitLab MR 与插件市场、多项安全修复;.233增加 cgroup 内存限额、按用户统计花费、修复 MCP v2 重连 - breaking:新模型(Opus 4.8 / Sonnet 5 / Fable 5 / Mythos 5+)默认禁用 todo 工具
- 评估:TI 3 · EV 4 · AS 4 · Maturity 4 · Risk 3 → ADOPT(现有用户直接升级;先检查依赖 todo 工具的工作流)
ChatGPT Linux 桌面公开预览(Ubuntu/Debian/Fedora,含 Codex)— WATCH
基础设施
- Cerebras 预告 8/18 直播 SUPERNOVA 2026,预计发布新的推理产品。这是 Ultrafast 合作之后下一个值得盯的点。〔WATCH〕
商业与政策
- SpaceX × Cursor 交割($60B 全股票,6/16 达成、8/14 交割):Grok 4.6 是首批整合产物,组织架构细节暂未公布。对模型获取、默认模型和定价的中期影响还要再观察。〔WATCH〕
趋势信号
首次运行,无历史基线。本日观察到的候选信号(详见 trends/current.md,均为 Low confidence、emerging):
- 中国实验室的开源 agentic coding 模型在前沿水平上扎堆竞争(Qwen3.8-27B、GLM-5.3 同日发布,前后还有 Kimi K3、Muse Glimmer)
- MCP 进入企业安全与强制管控阶段(Cloudflare 落地管控;无状态规范生效)
- Coding agent 工具普遍演化成多 agent 运行时(Claude Code forking/消息互通、Copilot Agent Plugins、DeepSeek Harness)
技术雷达
| 项目 | 状态 | 变化 |
|---|---|---|
| Qwen3.8-27B | TRIAL | 新增 |
| GLM-5.3 | TRIAL | 新增 |
| Cloudflare MCP enforcement | TRIAL | 新增 |
| Claude Code 2.1.23x | ADOPT | 新增(升级) |
| DeepSeek Harness (dsh) | WATCH | 新增 |
| Gemini 3.7 Flash | TRIAL | 新增(8/13) |
| DeepSeek V4-Pro | TRIAL | 新增(8/13) |
| Copilot Agent Plugins | TRIAL | 新增(8/13) |
| Cursor Builds | WATCH | 新增(8/17 默认开启后再评估) |
| OpenAI Ultrafast | WATCH | 新增(8/13 边界) |
| Anthropic watermark | WATCH | 新增 |
| ChatGPT Linux desktop | WATCH | 新增 |
值得一试
- Qwen3.8-27B:在本地或 OpenRouter 上跑自己的 coding-agent 任务集(半天到一天),对照当前默认模型,看 SWE 类任务通过率和上下文利用率。
- Gemini 3.7 Flash:挑一条高并发 agent loop 做价格/质量 A/B,介绍期内成本优势最大。
- Cloudflare
is_mcp日志(如已在 CF One 上):先只开日志,摸清 shadow MCP 的规模,再决定要不要上强制策略。
来源
- https://huggingface.co/Qwen/Qwen3.8-27B · https://qwen.ai/blog?id=qwen3.8
- https://z.ai/blog/glm-5.3 · https://docs.z.ai/guides/llm/glm-5.3
- https://blog.cloudflare.com/mcp-security-updates/
- https://code.claude.com/docs/en/changelog · https://github.com/anthropics/claude-code/releases/tag/v2.1.233
- https://github.com/deepseek-ai/deepseek-harness
- https://cursor.com/blog/joining-spacex
- https://www.anthropic.com/news
- https://help.openai.com/en/articles/6825453-chatgpt-release-notes
- https://github.com/ollama/ollama/releases