摘要
Qwen 团队发布 Qwen3.8-Flash-Next 的设计与消融研究(arXiv 2608.30320,9 月 1 日周二 digest):125B 参数、6B 激活的稀疏 MoE,另有 51B n-gram 嵌入表放在加速器之外。在 14 项预训练基准上,它有 8 项超过 397B-A17B 前代,其余最多落后 2.6 分——而激活参数只有三分之一、训练 token 只有三分之一、训练 FLOPs 约为九分之一。token 混合层在 Gated DeltaNet 与全局注意力间交替(每四层一个全注意力层);继续预训练阶段,这些全注意力层替换为 Qwen Sparse Attention,用压缩轻量索引器按微块粒度对上下文打分。
为什么重要
这是 8/26 落地的开源权重(ev-20260826-04)的架构论文,把混合线性注意力这条路线变成了有消融支撑的公开数字。「约 1/9 FLOPs 达到相近质量」是迄今最强的公开证据,说明混合注意力 + n-gram 嵌入这个配方是效率前沿而非实验室技巧——对选底座做从头训练或继续预训练的团队直接相关,也解释了为什么 serving 栈正在竞相支持这些层。
技术细节
| ArXiv | 2608.30320,2026 年 9 月 1 日周二 digest 宣告 |
|---|---|
| 规模 | 125B 总参 / 6B 激活 MoE + 51B n-gram 嵌入表(置于加速器外);合计约 180B |
| 结果 | 对比 397B-A17B 前代,14 项预训练基准:8 项领先,其余最多落后 2.6 分;激活参数 1/3、训练 token 1/3、训练 FLOPs 约 1/9 |
| Token 混合 | 分层混合:Gated DeltaNet 与全局注意力交替,每四层一个全注意力层;继续预训练时全注意力层替换为 Qwen Sparse Attention(压缩轻量索引器按微块粒度打分) |
| 上下文 | 原生 262k(HF 模型卡),多模态 |
| 许可证 | 开源权重采用自定义 qwen-community-1.0(以 HF 仓库为准) |
标签
architecturemoelinear-attentiongated-deltanetsparse-attentionefficiencyqwenopen-weights