摘要
Osprey 用现成预训练小 LM 引导推测解码的 draft 模型,而不是为每个目标单独训练:剪枝成浅层主干、用目标无关的下一 token 预训练恢复语言能力,再做轻量的按目标适配(词表对齐、零初始化 QKV 扩展、目标分布蒸馏)。一条主干把平均接受长度提升 16.1%(Qwen3-8B)、21.2%(Llama-3.3-70B-Instruct)、22.7%(MiniMax-M2.5 229B,另 +17.5% tokens/s),OOD/多语场景收益最大。被 EMNLP 2026 接收;代码公开。
为什么重要
「每个目标训一个 draft」是生产环境推测解码的隐性成本(目标模型每次升级都要重训)。可复用主干 + 廉价按目标适配,让加速效果对工作负载漂移和模型轮换更稳健——对经常换目标模型的 serving 机群直接适用。
技术细节
| ArXiv | 2609.09338(9 月 10 日周四 digest,2026-09-11T00:00Z 宣告);EMNLP 2026 |
|---|---|
| 方法 | 预训练小 LM 剪枝 → 浅层主干;目标无关下一 token 预训练;按目标:词表对齐 + 零初始化 QKV 扩展 + 目标分布蒸馏 |
| 结果 | 平均接受长度 +16.1%(Qwen3-8B)、+21.2%(Llama-3.3-70B-Instruct)、+22.7%(MiniMax-M2.5 229B,另 +17.5% tokens/s);OOD/多语收益最大 |
| 代码 | 公开(GitHub) |
标签
speculative-decodingservinginference-optimization