摘要

HOPE 用二阶目标选择 Mixture-of-Experts 中要保留的专家,不再把每个专家的贡献看成彼此独立。研究覆盖三款最高 122B 参数的 MoE 模型和两套校准数据;在 50% 剪枝时平均排名第一,并在 agentic coding 上最明显地超过次优基线。SWE-bench Pro 的报告增益最高为 6.1%。实现通过 AWS 的 hybrid-model-factory 仓库提供。

为什么重要
对自托管 MoE 模型的团队来说,专家剪枝可以缓解权重内存瓶颈,而不必重训整套模型。HOPE 表明,在长时程 agent 工作负载上,保留专家组合关系比静态短 benchmark 更重要。试验时应使用贴近自身工作负载的校准数据,并同时重测延迟、内存和质量。
技术细节
方法 保留专家协作关系的二阶专家剪枝目标
模型 三款最高 122B 参数的 MoE 模型
校准 Evol-CodeAlpaca 与 SWE-bench Verified 轨迹
剪枝结果 剪掉 50% 专家时平均排名第一
Agentic 增益 SWE-bench Pro 相对基线最高提升 6.1%
标签
HOPEmixture-of-expertspruningmodel-servingSWE-bench-Pro