摘要
一套在 RL 后训练期间在线共同训练 draft 模型的端到端系统:把 rank 本地分支注意力合并进紧凑的锯齿环形注意力(上下文并行),另经独立的 TapChannel 通路跨流水线阶段传递目标模型中间特征。该系统在 122B 规模模型上实现显著的 rollout 与端到端加速,并在 256K token 下具备强上下文并行扩展性。代码可用(论文内给出链接)。
为什么重要
RL 后训练的成本大头是 rollout 生成,而长上下文 rollout 一直最难加速。这项工作证明推测解码机制能在真实分布式训练栈里、在多数团队跑不动的规模与上下文长度上活下来。
技术细节
| ArXiv | 2609.07108(9 月 9 日周三 digest,2026-09-10T00:00Z 宣告) |
|---|---|
| 机制 | RL 期间在线 draft 共同训练;rank 本地分支注意力 → 紧凑锯齿环形注意力(上下文并行);TapChannel 跨流水线阶段传目标中间特征 |
| 结果 | 122B 规模显著的 rollout 与端到端加速;256K token 强上下文并行扩展 |
| 代码 | 可用(论文内链接) |
标签
speculative-decodingrl-trainingdistributed-traininglong-context