扫描窗口:2026-09-15 16:00:31Z 至 2026-09-16 16:00:47Z;检索回溯至 13:00:31Z。新增 8 个事件,更新 2 个既有事件,跳过 4 个预发布或低价值候选。

今日摘要

  • 本周期的主线不是新模型,而是如何验证训练、评测和 agent 编排。OPEN-1B 让单个训练步骤可跨硬件逐 bit 回放;SWE-bench 审计则显示头部 coding agent 的细小名次差异没有统计分辨力。
  • 多 agent 方面出现两条互补证据:生产轨迹显示层级越深,信息在交接中越容易丢失;跨主体协作实验表明,即使 agent 都诚实,现有消息原语也会随参与者增多而失效。Gemini CLI 0.60 与 Claude Code 2.1.273 同时加固权限、来源和运行时边界。

模型

  • OPEN-1B(TRIAL):公开 4000 亿 token 训练轨迹、810 个 checkpoint 和审计回放工具。每个步骤可在 CPU、CUDA 或 Metal 上复现相同 bit,适合试验模型训练溯源。
  • 本窗口没有确认到新的前沿基础模型或正式 API 发布。

Agent 与 AI 工程

  • 多 agent 分层研究(TRIAL):600 条生产 research 轨迹和 743,819 次工具调用显示,深层委派能减轻根上下文压力,却会损失发现并增加偏题。按论文参数,约 403 个发现后两层结构才在等成本下超过单 agent。
  • ScienceBuddy(TRIAL):把用户反馈与执行证据转成评测规则,先改 harness、再训练模型。代码和工作台已公开,但仍需留出集与人工复核。
  • Social harness(TRIAL):跨主体日程实验中,一组配置从单人 90% 成功率降到七人 0%。A2A 只解决连通性,来源、权限、任务协议和后果需要独立层处理。

开源

  • OPEN-1B、ScienceBuddy、social-harness 实验与 SWE-bench resolution audit 均公开了代码或复现材料。JustFit 提供持续演进的 MLX 分支,但历史运行环境记录不完整。

研究

  • SWE-bench resolution audit(TRIAL):Verified 前 30 名的 29 组相邻结果没有一组能被精确配对检验区分;固定模型后的 scaffold 差距最高 29.8 分。选型应看自有任务、配对不确定性和 model-scaffold 组合。
  • 这些结果强化了趋势 #3 的评测面:coding agent 已进入 runtime 与 scaffold 决定结果的阶段,但不改变 established / High 的采用判断。

开发者工具

  • Gemini CLI 0.60(既有条目重要更新):MCP OAuth 强制 RFC 9207 issuer 校验,并加固 WebFetch、扩展路径、环境变量变更、工具输出来源和沙箱目录。安全簇已从 preview 进入 stable。
  • Claude Code 2.1.273(既有条目重要更新):新增网关路由 header、MCP 重连失败提示和 Remote Control 会话 fork;同时修复 Bash 权限跳过、危险子 shell、托管策略优先级与外部 memory 读取问题。
  • GitHub AI Scan(TRIAL):pull request 扫描不再要求每个仓库启用 CodeQL 默认配置,但仍是 GitHub Advanced Security 的 public preview,且不支持 GHES。

基础设施

  • JustFit(TRIAL):在 24 GiB M4 Pro 上让 Qwen3.8-27B MXFP4 完成 196K 输入加 16K 输出。极限运行约需 103 分钟,更适合异步导入和前缀复用。
  • FlashVector(WATCH):Unity 报告 agent 跨 CUDA、PyTorch、Triton 和 Python 特征层优化生产 serving,模型服务最高吞吐翻倍。实现未公开,等待独立复现。

商业与政策

  • 没有确认到会改变模型供给、API 成本、芯片供应或开源格局的新事件。

趋势信号

  • 趋势 #3(established / High):SWE-bench 审计和分层成本研究让 runtime、scaffold 与委派拓扑更可测;它们补充工程决策依据,不改变采用成熟度。
  • 趋势 #7(emerging / Medium):Gemini CLI 0.60、Claude Code 2.1.273 与 social-harness 实验继续支持把能力、消息和后果控制拆开。仍缺第二个平台跨 shell、MCP、browser 的统一正式策略与采用遥测。
  • 本周期没有发现证据充分的新趋势。

技术雷达

  • 新 OPEN-1B(Open Source / TRIAL):逐步骤跨硬件回放为开源模型增加可验证训练层
  • 新 SWE-bench resolution audit(Agent Evaluation / TRIAL):头部小分差无法支撑严格排名,应改用配对检验与分层
  • 新多 agent 分层规则(Agent & AI Engineering / TRIAL):深层委派会丢发现,先用自有轨迹测成本交叉点
  • 新 JustFit(Infrastructure / TRIAL):消费级设备可承载 200K 上下文,但极限延迟很高
  • 新 ScienceBuddy(Research Agent / TRIAL):可试验轨迹到评测规则的闭环,递归训练仍需护栏
  • 新 Social harness(Agent Security / TRIAL):跨主体通信需要模型外的来源、权限与协议层
  • 新 FlashVector(Infrastructure / WATCH):生产 serving 跨层优化收益可观,但实现和独立复现缺失
  • 新 GitHub AI Scan 扩展(Developer Tools / TRIAL):覆盖门槛下降,先量误报与审查负担
  • Gemini CLI(Developer Tools / WATCH):0.60 安全修复进入 stable,A2A server 仍无正式文档
  • Claude Code(Developer Tools / ADOPT):2.1.273 再次修补权限与托管策略边界,建议升级
  • 当前雷达:ADOPT 6 / TRIAL 74 / WATCH 85。完整当前雷达以站点洞察页为准。

值得一试

  • 用现有 coding-agent 结果跑一次逐题配对检验,确认排行榜差距是否真的可分。
  • 在多 agent research 流程记录每次交接保留了多少发现,并比较单层与两层的 token 成本。
  • 在隔离环境回放一个 OPEN-1B 步骤,评估可验证训练对内部模型治理的实际成本。

观察项

  • 等待 FlashVector、分层成本阈值和 social harness 在其他组织的独立复现。
  • 观察 Gemini CLI、Claude Code 或第二个平台是否公开跨 shell、MCP、browser 的统一 consequence policy 与采用遥测。

来源