摘要
OpenAI 预览了 Ultrafast 模式:GPT-5.6 Sol 的输出速度最高可达 750 tokens/s,约为标准模式的 14 倍。推理由 Cerebras 的晶圆级(wafer-scale)硬件承担,不再用 GPU。目前仅向少量预览用户开放,定价未公布。
为什么重要
这是 OpenAI 第一次把前沿模型跑在第三方非 GPU 推理芯片上。对做推理基础设施的人来说,它验证了替代芯片在前沿质量下可行,也说明按速度分层的 API 产品正在成为下一个竞争点。
技术细节
| 输出速度 | 750 tok/s |
|---|---|
| 加速比 | 14x |
| 硬件 | Cerebras 晶圆级(wafer-scale) |
| 获取方式 | 限量预览(limited preview) |
| 定价 | 未公布 |
标签
openaicerebrasinferencespeedpreviewgpt-5.6