摘要

SAS 不再逐层蒸馏 dense attention 分布,而是把 selector 的连续分数注入注意力 logits,让语言建模损失直接更新 selector。团队对 OLMo3-7B 继续训练约 500 亿 token,平均下游分数为 43.28,接近 dense base 的 43.88,并高于蒸馏基线的 41.68。LongBench 平均分 30.0,与对比中最强的稀疏方法并列,也高于 dense base 的 29.0。代码已公开,但扫描截止时仓库没有声明许可证。

为什么重要
对把 dense checkpoint 改造成稀疏注意力的模型团队,直接按最终预测质量训练 selector,比模仿 dense attention 权重更贴近目标。继续训练成本不低,而且不同任务的收益不一致,采用前应在目标架构上复现。仓库缺少许可证,是当前落地阻碍。
技术细节
方法 训练时把连续 selector 分数注入 attention logits,由语言建模损失端到端反向传播
底座 OLMo3-7B
继续预训练 13,000 步,global batch 512,约 500 亿 token,最大序列长度 8,192
下游平均分 SAS 43.28;dense base 43.88;滑动窗口基线 43.24;HiLS-Attn-RoPE 41.68
LongBench 平均分 SAS 30.0;dense base 29.0;滑动窗口基线 28.0;HiLS-Attn-RoPE 30.0
可用性 公开 GitHub 仓库;48 stars;截止时未检测到许可证
标签
sparse-attentionlong-contextcontinued-pretrainingselectormodel-efficiency