本次运行扫描窗口为 [2026-08-29T11:35:46Z, 2026-08-30T00:00:20Z](约 12.5 小时,周六;检索 overlap 回退至 2026-08-29T08:35:46Z)。窗口本身为周末静默期,无严格窗口内新事件;本日产出为 5 个覆盖缺口恢复(均落在 8/25–8/28 的先前扫描窗口内、当时漏收,本次补录):OpenAI Jalapeño 首批实测(8/25)、vLLM 0.28.0(8/26)、Nvidia×Hugging Face 收购报道(8/27)、腾讯 Hy4 预览版开源(8/28)、OpenAI 宣布终止 Cursor 模型合同(8/28);另更新 2 个既有事件(Cerebras Hot Chips 深度分享、Qwen3.8-Flash 生产版核实)。趋势侧:趋势 #1 新增腾讯 Hy4 证据——一周内第三家中国实验室开源大权重,判据 (b) 至今最强候选,但整体维持 strengthening / Medium;趋势 #2、#3 无新信号。本周期没有发现证据充分的新趋势。
今日摘要
- 新事件(覆盖缺口恢复):OpenAI 自研推理芯片 Jalapeño 首批实测领先 Nvidia 系统(ev-20260825-03,WATCH)——8/25 Hot Chips 上,OpenAI 在公开的 SemiAnalysis InferenceX 基准给出结果:对比 GB200/GB300,峰值每瓦多完成 1.5-1.9 倍 AI 工作、端到端延迟低 1.7-3.6 倍、交互式负载性能高 2.1-4.1 倍。与 Broadcom 合作、TSMC 3nm、约 9 个月设计周期;额定 700W、生产档持续 ≤550W;AI 生成 kernel 在选定模块比人类专家快 1.5-1.8 倍。2026 年底很小批量首部署。厂商发布但跑在公开基准上,可验证性高于常规芯片发布。
- 新事件(覆盖缺口恢复):Nvidia 据报道以 129 亿美元协议收购 Hugging Face(ev-20260827-03,WATCH)——The Information 8/27 首报「已达成协议」,Reuters/CNBC 跟进;约 HF 收入 86 倍、Nvidia 史上最大交易之一。截至 8/30 双方均无官方声明,监管与交割在前。HF 托管着开源权重生态的几乎全部产物;叠加一周前报道的 Poolside/Nemotron 交易,Nvidia 正把开源供应链的「造模型」与「分发模型」两层都收入手中。关注官方确认与中立性承诺。
- 新事件(覆盖缺口恢复):OpenAI 将于 11 月 12 日切断 Cursor 的模型合同供应(ev-20260828-03,WATCH)——SpaceX 600 亿美元收购 Anysphere 触发控制权变更条款:OpenAI 8/28 通知 SpaceX 拟终止合同,给出协议下最长通知期;未来模型(点名 Astra)不再提供给 Cursor,理由是无法确信 SpaceX 在 ToS 内使用(援引 Twitter/xAI 既往违约)。开发者可继续走自带 API key(BYOK)或 Codex IDE 扩展。所有在 Cursor 里用 OpenAI 模型的团队需要在 11/12 前完成迁移盘点。
- 新事件(覆盖缺口恢复):腾讯开源 Hy4 预览版(ev-20260828-02,WATCH)——770B 总参 / 49B 激活 MoE、上下文超 1M、Apache 2.0(HF 标签),标准 + FP8 权重与 day-0 vLLM recipe;主打软件工程、办公、游戏开发与科研。公开 benchmark 缺席,仅内部盲测(163 专家 / 203 任务,2.99 vs GLM-5.3 2.92、Kimi K3 2.94)。这是一周内第三家放出重要开源权重的中国实验室(Z.ai 8/25、Qwen 8/24-26、腾讯 8/27-28),计入趋势 #1 证据。
- 新事件(覆盖缺口恢复):vLLM 0.28.0 发布(ev-20260826-05,ADOPT)——主线是开源大模型的服务攻坚:Kimi-K3 全栈优化(DCP、融合 FlashKDA kernel、自适应投机预算令 DSpark 首 token 延迟改善约 60%、共享专家分片每卡省 17 GiB)+ DeepSeek V4 稀疏 MLA 全链路;另有 DFlash2 投机解码、E/P/D 分离部署、磁盘级 KV offload、Rust 前端 + gRPC。破坏性变更:bitsandbytes 迁出为外部插件、Transformers 5.15.0。
- 更新:Cerebras CS-4 路线图公开(ev-20260818-01,维持 WATCH)——8/25 Hot Chips 深度分享:CS-5(2027)目标开源模型 10,000 tok/s/人、多万亿参数模型 5,000 tok/s/人、每 MW 3M tok/s;CS-6 引入 3D 堆叠 DRAM、系统体积缩小一个数量级。三项 watch(定价、独立 benchmark、出货确认)依旧未满足。
既有事件更新
| 事件 | 更新内容 | 处理 |
|---|---|---|
| Cerebras CS-4(ev-20260818-01) | Hot Chips 2026 深度分享(8/25,覆盖缺口恢复):供电架构细节(AC/DC 距晶圆约 0.5mm、约 2 倍供电能力);CS-5/CS-6 路线图首次公开;WSE-3T 片上互连 53.5 PB/s 对比 NVL72 NVLink ~260 TB/s。定价/独立 benchmark/出货确认仍未落地 | 更新实体,推荐维持 WATCH |
| Qwen3.8-Flash-Next(ev-20260826-04) | 生产对位版本核实(此前 watch 项):Qwen3.8-Flash 为 API-only 生产版,自发布周起在 QwenCloud / Model Studio / OpenRouter 提供,默认 1M 上下文,$0.15/$0.47 每百万 token(含缓存折扣);开源侧仍只有 Flash-Next(自定义许可)。采用复核:主仓 52,341 下载 + 4,287 likes(30 天口径数字未滚动) | 更新实体,推荐维持 WATCH |
模型
- 腾讯 Hy4 预览版(ev-20260828-02 新事件):见 Executive Summary。工程视角看点:770B/49B 激活 + Apache 2.0 是「同级别、不同组织」开源发布至今最接近的一次,但能力面只有厂商盲测——公开 SWE-bench / Terminal-Bench 跑分出来之前,只能按架构与许可定价看待。完整版 Hy4 未发,官方称下一批「很快」。API 定价 $0.834/$2.501/$0.042(缓存)。
- Qwen3.8-Flash 生产版(ev-20260826-04 更新):见 Updates 表。生产路径 = API(默认 1M 上下文、官方内置工具),自托管路径 = Flash-Next 权重(实验性 + 自定义许可)——两条路径的分界已完全清晰。
- 过滤:Claude Opus 4.8(5/28 发布,旧闻二次传播)、月之暗面 35 亿美元 F 轮(7/29,旧闻)、SpaceX×xAI 合并(2/2,背景旧闻)——均不在窗口内且无新信息;Anthropic IPO 预期报道——资本市场新闻,按规则过滤。
Agent 与 AI 工程
- 趋势 #2(MCP 企业安全):窗口内无新信号。Netskope release notes 仍停在 140.0.0(8/30 检索确认,未检出 141.x),22 个 MCP 数据属性未出 feature flag;Zscaler 无 GA 公告。干净 GA 判据继续未满足。
- vLLM 0.28.0 的分层 KV offload(含磁盘)与 E/P/D 分离部署对 agent 长会话服务的显存与吞吐有直接参考价值(详见 Open Source 节)。
开源
- vLLM 0.28.0(ev-20260826-05 新事件,ADOPT):见 Executive Summary。自托管 Kimi-K3 / DeepSeek V4 的团队应安排升级;用 bitsandbytes 的用户升级前先装树外插件。584 个提交、270 位贡献者(76 位新加入)——开源前沿模型发布数天内即获默认服务栈的模型专属 kernel 优化,这个节奏本身值得注意。
- Hy4 开源生态:day-0 vLLM recipe(recipes.vllm.ai/tencent/Hy4-preview)、FP8 变体、ModelScope 镜像齐备;早期下载约 1.4k(主仓)/ 1.3k(FP8),与 GLM-5.3-Flash 同期的 19 万级不在一个量级——知名度与供给节奏差异明显。
- DeepSeek Harness(ev-20260814-05,延续观察):203,390 stars(8/30 核查;8/29 为 202,778,+612/日)——星速持续放缓(8/22-24 约 +13.8k/4d → 8/29 +1,033/日 → 本次 +612/日),API/plugin 面仍无稳定化信号,维持 WATCH。
- GLM-5.3 权重复现核查(趋势 #1 判据 (a)):HF 讨论区新增均为琐碎问题(引用错误、FP8/BF16 询问、refusal 反馈、typo PR),无第三方 Terminal Bench / SWE 运行。判据 (a) 继续未达成。
研究
- 周六无 arXiv 更新(上一 digest 为 Fri 8/28,已在 8/29 日报覆盖;下一 digest 预计 8/30T00:00Z 宣告,留给下次运行)。周日同理。
- 过滤:TTPO、BTS-AgentBench 维持上次结论;小米 EMNLP 2026 论文入选(8/29)——学术会议常规动态,不立事件。
开发者工具
- Cursor × OpenAI(ev-20260828-03 新事件):迁移视角——BYOK 保访问但计费与支持口径变化;Codex IDE 扩展是 OpenAI 第一方路径;或切换其他模型供应商。凡在第三方工具里绑定单一模型厂商的团队,建议借此盘点自身工具链的厂商合同依赖。
- Codex CLI:窗口内仅 0.151.0-alpha.7.2(8/29 21:46Z,无变更说明的 alpha 通道补丁),0.152 stable 线仍待观察。维持 0.151.0 / ADOPT。
- Claude Code:无新版本(最新 2.1.251,8/28)。2.1.252+ 继续等待。
- Gemini CLI:仍 0.57.0 stable + nightlies(0.59.0-nightly.20260829);a2a-server 停在 0.57.0 且零文档——趋势 #3 残余观察项不变。
- OpenCode:无新版本(1.18.25,8/28)。
基础设施
- OpenAI Jalapeño(ev-20260825-03 新事件,WATCH):见 Executive Summary。与 ev-20260813-03(OpenAI Ultrafast 模式跑在 Cerebras 上)合看:OpenAI 一边租用第三方超低延迟推理,一边自研 ASIC——自有芯片若在 2027 年规模化,其 API 单位成本曲线将与 GPU 市场定价进一步脱钩。
- Cerebras CS-4(ev-20260818-01 更新):见 Updates 表。CS-5/CS-6 路线图补全了 2027-2028 的能效叙事,但当前三项 watch(定价、独立 benchmark、出货确认)无一落地。
商业与政策
- Nvidia×Hugging Face(ev-20260827-03 新事件,WATCH):见 Executive Summary。对开源生态的真正问题不是交易金额,而是 Hub 中立性:竞品模型的托管待遇、CUDA 耦合、Enterprise 业务走向。官方确认与条款公开前不调整任何推荐。
- 过滤:Anthropic IPO 预期(8/26 报道)、OpenAI×Anthropic IPO 对比、OpenAI×泰国加速器、Guidelight AI 评估、月之暗面削减投放预算、中国 AI 标准集中交稿——均不改变模型获取、API 成本或开源格局。
- Nvidia×Poolside / Nemotron(ev-20260822-01):窗口内无带日期的新信息(媒体细节均为 8/22-24 旧报道复述),维持 WATCH。
趋势信号
本周期没有发现证据充分的新趋势。 既有 early indication 维持 watch(不立项):agentic retrieval loop(无第二家厂商)、coding-agent 平台纵向整合(Cursor 无新动作)、agent-物理世界接口标准化(MHS 仍单事件、spec 未公开)。新增一条 early indication(不立项):Nvidia 开源供应链整合——Poolside/Nemotron(8/22 报道)+ Hugging Face 收购(8/27 报道)两笔均为同一家公司的未确认交易,按规则属单主体行为,不构成趋势;出现官方确认或第二家等效动作后再评估。
既有趋势复核:
- 中国 lab 开源权重 frontier coding 模型 — 维持 strengthening / Medium:新增证据第 9 条——腾讯 Hy4 预览版(770B/49B、Apache 2.0、1M+ 上下文,不同组织)。判据复核:(a) 权重社区独立复现仍未达成(HF 讨论区无第三方运行);(b) 不同组织同级别发布——Hy4 为至今最强候选但未完全达成(preview 定位 + 仅厂商盲测 + 无公开 benchmark);(c) 下载增速——30 天口径数字未滚动(Flash 189,793 / Flash-Next 52,341 与上次持平;likes +60/+74),需下周期再取数。镜像背景(不计证据):Nvidia 拟收购 Hugging Face,美国供给侧对开源权重主战场的第二记重手。
- MCP 进入企业安全与治理阶段 — 维持 emerging / Medium(无新信号):Netskope 仍停 140.0.0;干净 GA 判据(属性出 flag + 公开遥测)未满足。
- Coding agents 收敛为 multi-agent runtime — 维持 established / High(无新跨组织证据):窗口内 Codex/Claude Code/Gemini CLI 均无新 stable;a2a-server 仍零文档;公开生产案例与采用遥测仍缺。
技术雷达
新增:Jalapeño 首批实测(infrastructure / WATCH)、vLLM 0.28.0(open-source / ADOPT)、Nvidia×Hugging Face 收购报道(business / WATCH)、腾讯 Hy4 预览版(foundation-model / WATCH)、OpenAI 终止 Cursor 模型合同(business / WATCH)。更新:Cerebras CS-4(infrastructure / WATCH,Hot Chips 路线图)、Qwen3.8-Flash-Next(foundation-model / WATCH,生产版核实)。其余沿用 8/13–8/29 雷达。
值得一试
- 自托管 Kimi-K3 / DeepSeek V4 的团队升级 vLLM 0.28.0:DSpark 首 token 延迟 -60%、每卡 -17 GiB 这类优化直接落在账上;升级前先处理 bitsandbytes 树外插件与 Transformers 5.15.0 两个破坏性变更。
- 用 day-0 vLLM recipe 试跑腾讯 Hy4 预览版:Apache 2.0 无许可顾虑;重点测长上下文(1M)与编码任务的真实表现,公开 benchmark 缺位时自己的评测就是证据。
- 盘点「第三方工具 × 单一模型厂商」依赖:借 OpenAI→Cursor 断供事件,列出团队每个 AI 工具背后的模型合同与 BYOK 路径,11/12 前完成 Cursor 内 OpenAI 模型的迁移方案。
观察项
- Nvidia×Hugging Face:官方确认、交割条款、Hub 中立性承诺、监管动向(ev-20260827-03 升级条件)。
- Cursor 断供时间线:2026-11-12 切断;BYOK 计费变化;Astra 是否如期不进 Cursor(ev-20260828-03)。
- Hy4 完整版:下一批 Hy4 系列发布时间、公开 benchmark(SWE-bench / Terminal-Bench)、下载增速(当前 ~1.4k/2d)。
- 趋势 #1 判据:(a) GLM-5.3 权重的第三方复现;(b) Hy4 从 preview 转正或再一家同级别开源;(c) 下载 30 天口径数字滚动后再评估增速。
- Jalapeño:年底小批量部署证据、第二代扩展性、InferenceX 独立复测。
- 9 月日历:OpenAI ZDR/Private Safety 白皮书(ev-20260818-05);9/29 OpenAI DevDay;11/21 GPT-5.6 Sol 促销价到期(ev-20260821-01)。
- 背景日历:Astra / OpenAI 前沿 RL 恢复(ev-20260818-04);DeepSeek Harness API/plugin 面稳定后复评 TRIAL;Cerebras CS-4 定价/独立 benchmark/出货;MHS spec 公开与第二家等效规范;Netskope 141.x。
来源
- https://openai.com/index/jalapeno-first-results/ 、https://openai.com/index/openai-broadcom-jalapeno-inference-chip/ 、https://techcrunch.com/2026/08/25/openais-jalapeno-chip-is-built-for-fast-inference-at-scale-benchmarks-show/ (Jalapeño,8/25,一手 + Tier-3)
- https://www.cnbc.com/2026/08/27/nvidia-hugging-face-acquisition.html 、https://www.reuters.com/technology/nvidia-talks-acquire-hugging-face-13-billion-deal-business-insider-reports-2026-08-27/ (Nvidia×HF,8/27-28,Tier-3,无官方声明)
- https://openai.com/index/our-decision-on-cursor-following-its-acquisition-by-spacex/ 、https://www.cnbc.com/2026/08/29/openai-cursor-spacex-model-access.html (OpenAI 终止 Cursor 合同,8/28-29,一手 + Tier-3)
- https://www.tencent.com/tencent-releases-and-open-sources-tencent-hy4-preview/ 、https://huggingface.co/tencent/Hy4-preview 、https://recipes.vllm.ai/tencent/Hy4-preview (腾讯 Hy4,8/27-28,一手)
- https://github.com/vllm-project/vllm/releases/tag/v0.28.0 (vLLM 0.28.0,8/26,一手)
- https://www.cerebras.ai/blog/ultrafast-frontier-inference-cerebras-deep-dive-at-hot-chips-2026 (Cerebras Hot Chips,8/25,一手)
- https://qwen.ai/blog?id=qwen3.8-flash-next 、https://www.alibabacloud.com/help/en/model-studio/model-pricing 、https://openrouter.ai/qwen/qwen3.8-flash (Qwen3.8-Flash 生产版核实,一手)
- https://huggingface.co/zai-org/GLM-5.3/discussions (GLM-5.3 复现核查,一手)、https://huggingface.co/zai-org/GLM-5.3-Flash 、https://huggingface.co/Qwen/Qwen3.8-Flash-Next (采用数据,一手)
- https://registry.npmjs.org/@openai/codex 、…/@anthropic-ai/claude-code 、…/@google/gemini-cli 、…/@google/gemini-cli-a2a-server (版本线核查)、https://api.github.com/repos/vllm-project/vllm/releases 、https://api.github.com/repos/deepseek-ai/deepseek-harness
- https://hn.algolia.com/api/v1 (HN 头条信号:Hy4 161 分、vLLM 0.28.0 91 分,8/29)