摘要
IBIB(arXiv 2609.10494,9 月 10 日周四 digest)从一个测量误差出发:企业部署的是系统而不是 checkpoint——可用能力由权重、服务路径、精度、输出契约与 harness 共同决定——但被审计的 18 个基准全部只对「广告化的模型 ID」打分。IB2 协议用三部分把差异变成可上报项:gold-blind 的能力绑定预检(任务到达前先验证该路由能执行评测契约);可靠性计入的首轮评分(失败留在分数里、未支持的能力留在分数外);结构性评分盲的裁决。参照实例为 128 个锁定任务、987 条断言,覆盖文档、表格、图表、工具与数据库工作,且保持封存——程序即产物,语料不公开。在 11 个系统上,能力可用性被证明可测量,单路由系统在整类任务上直接出局。
为什么重要
这是企业采购真正需要的评测方法论:给你要跑的那条路由(你的网关、你的量化、你的 harness)打分,而不是给厂商的模型 ID。封存语料的设计(协议公开、任务锁定)是对基准污染的一个可行回答;预检步骤则在采购前就抓住「基准能过、但你的部署执行不了契约」的失败。
技术细节
| ArXiv | 2609.10494,2026 年 9 月 10 日周四 digest 宣告 |
|---|---|
| 动机 | 被审计的 18 个基准全部只对广告化模型 ID 打分;企业能力取决于权重 + 路由 + 精度 + 输出契约 + harness |
| 协议 | gold-blind 能力绑定预检;可靠性计入的首轮评分;结构性评分盲裁决;算法、分类表、请求契约与 manifest schema 全部公开 |
| 实例 | 128 个锁定任务 / 987 条断言(文档、表格、图表、工具、数据库),封存;评测 11 个系统;能力可用性可测量,单路由系统在整类任务上出局 |
标签
evaluationbenchmark-methodologyenterpriseprocurementserving-route