摘要
HOPE 用二阶目标选择 Mixture-of-Experts 中要保留的专家,不再把每个专家的贡献看成彼此独立。研究覆盖三款最高 122B 参数的 MoE 模型和两套校准数据;在 50% 剪枝时平均排名第一,并在 agentic coding 上最明显地超过次优基线。SWE-bench Pro 的报告增益最高为 6.1%。实现通过 AWS 的 hybrid-model-factory 仓库提供。
为什么重要
对自托管 MoE 模型的团队来说,专家剪枝可以缓解权重内存瓶颈,而不必重训整套模型。HOPE 表明,在长时程 agent 工作负载上,保留专家组合关系比静态短 benchmark 更重要。试验时应使用贴近自身工作负载的校准数据,并同时重测延迟、内存和质量。
技术细节
| 方法 | 保留专家协作关系的二阶专家剪枝目标 |
|---|---|
| 模型 | 三款最高 122B 参数的 MoE 模型 |
| 校准 | Evol-CodeAlpaca 与 SWE-bench Verified 轨迹 |
| 剪枝结果 | 剪掉 50% 专家时平均排名第一 |
| Agentic 增益 | SWE-bench Pro 相对基线最高提升 6.1% |
标签
HOPEmixture-of-expertspruningmodel-servingSWE-bench-Pro