摘要
SQD 不再把 decode 当作一个整体,也不只按 attention 与 FFN 拆分,而是按二次与子二次注意力阶段分配硬件。在调整后的 8×B200 代理系统上,GLM-5.2、Nemotron 3 Ultra 与 Gemma 4 31B 相对最强纯 GPU 基线的每瓦 token 提升 31–56%。经 B200 结果校准的 Rubin + LPX 分析模型预计可把可达延迟收紧 1.2–1.5 倍,并把 attention-FFN disaggregation 的吞吐最多提高 3.6 倍。代理系统修改了 decode 设备特性,未来硬件的大部分结果仍是模型推演,不是生产实测。
为什么重要
对规划 GPU 与 decode accelerator 混合集群的推理架构团队,混合与稀疏注意力会改变正确的拆分边界。把固定状态的注意力阶段和 FFN 一起迁移,有机会降低能耗与互连压力。这篇论文更像架构指引,不是可部署软件;容量规划应等待真实 Rubin/LPX 实现与端到端验证。
技术细节
| 模型 | GLM-5.2 稀疏注意力;Nemotron 3 Ultra 线性/循环注意力;Gemma 4 31B 滑动窗口注意力 |
|---|---|
| 代理系统 | 调整后的 8×B200,修改 decode 设备带宽、容量与功耗假设 |
| 实测能效 | 相对最强纯 GPU 基线,平均每瓦 token +31–56%;1M context 下 +53–71% |
| 未来系统推演 | Rubin + LPX;可达延迟收紧 1.2–1.5 倍;相对 attention-FFN disaggregation 吞吐最高 3.6 倍 |
| 实验成本 | 579 次运行共 4,058 B200 GPU-hours;其中 358 小时进入论文报告结果 |
| 可用性 | 仅论文与方法;未链接实现仓库 |
标签
inferencedisaggregationsubquadratic-attentionsparse-attentionnvidiaenergy-efficiency