Boundary/backfill file: events below were discovered during the first-run overlap scan (first run occurred 2026-08-15). They are attributed to their actual publication date. No prior run covered this date.
今日摘要
- Google 发布 Gemini 3.7 Flash:定位编码和 agent 场景的"干活主力"档模型。相比 3.6 Flash,DeepSWE 从 49.0 升至 65.3,AutomationBench 从 17.0 升至 30.4。首发优惠价 $0.75/$3.75 per Mtok(至 2026-12-31),发布当天即 GA,并同步进入 GitHub Copilot。
- DeepSeek V4-Pro GA:原生兼容 OpenAI Responses API,支持一键配置 Codex;新增 low/high/max 三档 thinking effort;8/16 起实行峰谷定价,谷时降至 50%。
- OpenAI 预览 Ultrafast mode:GPT-5.6 Sol 跑在 Cerebras 晶圆级芯片上,输出速度最高 750 tok/s(约 14x)。这是 OpenAI 首次把前沿模型放到第三方非 GPU 芯片上。(发布时间在元数据与报道之间有 8/11–8/13 的出入,已标注。)
- GitHub Copilot 周报:Agent Plugins 1.0 GA,覆盖 VS Code / CLI / SDK / App;Kimi K3 进入付费计划;JetBrains 支持 Ollama BYOK。
- Cursor 推出 Builds:预热环境让云端 agent 启动速度最高提升 3x,8/17 起全量默认开启,不加价。
- 研究:一项工作用契约级验证(contract-level verification,按代码应当满足的约束逐条检查,而不是只看测试是否通过)检查 LLM 生成的 GPU kernel,发现已合入的 kernel 中 39.5% 存在超出容差的错误;DARTree 结合扩散投机解码与自回归 draft tree,无损加速至 9.73x;DCD(解耦对比解码)加速 1.65-1.95x,有代码。
模型
- Gemini 3.7 Flash(Google)— FrontierCode 1.1 43.6%、DeepSWE v1.1 65.3%、WebDev Arena Elo 1588;首发价 $0.75/$3.75(2027-01-01 起 $1.50/$7.50)。GA 渠道:Gemini API / AI Studio / Copilot / Antigravity。〔TRIAL〕
- DeepSeek V4-Pro GA — Terminal-Bench 2.1 87.9、HLE 60.0(带工具)、CyberGym 83.3;兼容 Responses API;8/16 16:00 UTC 起实行峰谷定价。〔TRIAL〕
- GPT-5.6 Sol Ultrafast mode(OpenAI × Cerebras)— 750 tok/s、14x;小范围 preview,尚未定价。〔WATCH〕
Agent 与 AI 工程
- GitHub Copilot Agent Plugins 1.0 GA:一次构建、多端运行,相当于 Copilot 给 MCP 生态立下一套"插件标准";Copilot CLI 新增
/tasks子代理视图、--plan+--mode autopilot和/rewind。〔TRIAL〕
开源
- JetBrains 上的 Copilot 支持 Ollama BYOK(bring your own key,接入自己部署的本地模型)和跨会话记忆。这是本地模型进入企业 IDE 的信号。
研究
| 论文 | 结果 | 工程相关性 | 代码 | 建议 |
|---|---|---|---|---|
| arXiv 2608.12700 GPU kernel 契约级验证器 | 2,638 个已合入 kernel 中,39.5% 存在错误,62.1% 至少违反一项契约 | 直接警示"LLM 生成代码 + 宽松测试就上线"的做法;基于属性的验收关卡(property-based gates)应进入 CI | Zenodo artifact | TRIAL |
| arXiv 2608.13524 DARTree | 每轮验证接受 12.97 tokens;无损加速 9.73x | 推理服务栈的加速候选 | 无 | WATCH |
| arXiv 2608.12913 DCD | 对比解码加速 1.65-1.95x | 有代码,验证成本低 | github.com/chadlzx/dcd | WATCH |
开发者工具
- Cursor Builds:环境按小时级预热,构建失败则不启用;8/17 起全量默认开启。〔WATCH → 届时评估〕
基础设施
- OpenAI Ultrafast mode(Cerebras):前沿模型与非 GPU 芯片的组合,首次进入 OpenAI 生产级 API 的版图。〔WATCH〕
趋势信号
(首次运行,无历史基线;候选信号记录见 trends/current.md。)
技术雷达
- Gemini 3.7 Flash: TRIAL(新)
- DeepSeek V4-Pro: TRIAL(新)
- OpenAI Ultrafast: WATCH(新)
- Copilot Agent Plugins: TRIAL(新)
- Cursor Builds: WATCH(新)
值得一试
- 在高并发 agent loop 中,将 Gemini 3.7 Flash 与当前默认模型做一次成本/质量 A/B 对比。
- 把 property-based gates 的思路引入自己的 LLM 代码生成 CI。
来源
- https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-gemini-3-7-flash/
- https://api-docs.deepseek.com/updates/
- https://openai.com/index/previewing-ultrafast/ · https://techcrunch.com/2026/08/13/openai-introduces-ultrafast-a-new-mode-that-makes-gpt-5-6-sol-work-at-14x-the-speed/
- https://github.blog/changelog/2026-08-13-github-copilot-weekly-releases-august-10/
- https://cursor.com/blog/builds
- https://arxiv.org/abs/2608.12700 · https://arxiv.org/abs/2608.13524 · https://arxiv.org/abs/2608.12913