摘要

OpenAI 预览了 Ultrafast 模式:GPT-5.6 Sol 的输出速度最高可达 750 tokens/s,约为标准模式的 14 倍。推理由 Cerebras 的晶圆级(wafer-scale)硬件承担,不再用 GPU。目前仅向少量预览用户开放,定价未公布。

为什么重要
这是 OpenAI 第一次把前沿模型跑在第三方非 GPU 推理芯片上。对做推理基础设施的人来说,它验证了替代芯片在前沿质量下可行,也说明按速度分层的 API 产品正在成为下一个竞争点。
技术细节
输出速度 750 tok/s
加速比 14x
硬件 Cerebras 晶圆级(wafer-scale)
获取方式 限量预览(limited preview)
定价 未公布
标签
openaicerebrasinferencespeedpreviewgpt-5.6