摘要
《Training-Free Halving of Activated Experts in Fine-Grained Mixture-of-Experts Models》(arX 2609.04575,9 月 7 日周一 digest)利用了细粒度 MoE 路由的一个微妙性质:路由概率重归一化会把专家输出增益隐式校准到训练时的 top-k,因此推理时直接减小 k 会同时改变哪些专家被激活和它们的强度。修复只需一个整数:激活 top k1 个专家,但按 top k2 个专家的概率质量归一化——零参数、零训练、无可测开销。在 Qwen3.6-35B-A3B 上,8 减到 4 个专家在标准重归一化下损失 4.65 个 MMLU 点,k2=16 时只损失 0.35 点,同时专家路由算力减半;结果在 11 倍大的 Qwen3.5-397B-A17B 上复现(10 减到 5,配好参照集损失 0.55 点)。完全去掉重归一化是灾难性的——关键是保留合适的参照质量。困惑度与下游准确率偏好的 k2 不同,选择时要用任务指标。
为什么重要
对任何在跑细粒度 MoE 模型 serving 的团队,这是一行改动换来约 2 倍专家算力削减,且在 11 倍模型尺寸跨度上得到验证——读完当天下午就能测完的那种结果。注意事项:困惑度不是合适的选型指标,要在下游任务上验证;且这是对已训练模型的推理期专家跳过,不是训练期稀疏化。
技术细节
| 方法 | 激活 top k1 个专家,按 top k2(k2 > k1)的概率质量归一化;一个整数,零参数/训练/开销 |
|---|---|
| 结果 | Qwen3.6-35B-A3B 8->4:标准重归一化损失 4.65 MMLU 点 vs k2=16 损失 0.35 点,专家路由算力减半;Qwen3.5-397B-A17B 复现(10->5,损失 0.55);完全去掉重归一化是灾难 |
| 注意 | 困惑度与下游准确率偏好不同 k2——按任务指标选型 |
标签
moeexpert-skippinginference-efficiencyllm-servingtraining-free