摘要
AMD 发布 Instella-MoE 技术报告(arXiv 2609.00791,9 月 2 日周三 digest):完全开放的 16B 总参 / 2.8B 激活 MoE,从头在 AMD Instinct MI300X 与 MI325X GPU 上训练。模型结合 Gated Multi-head Latent Attention 与 FarSkip-Collective 连接结构,走多阶段流水线:预训练、中训、长上下文扩展、带反馈数据筛选的 SFT、DPO、以及 Multi-Teacher On-Policy Distillation 的 RL。
为什么重要
开源权重前沿目前是中国实验室主导、美国方面以 Nvidia/Poolside 回应的格局;Instella-MoE 加入了第三个方向——在非 NVIDIA 芯片上规模化跑通的全开放权重。16B 不算前沿量级,但对评估 MI300X/MI325X 训练栈的团队是有价值的参照;MLA 类架构选择也说明 AMD 在对齐 DeepSeek 系模型开创的 serving 效率惯例。
技术细节
| ArXiv | 2609.00791,2026 年 9 月 2 日周三 digest 宣告 |
|---|---|
| 规模 | 16B 总参 / 2.8B 激活 MoE |
| 硬件 | 完全在 AMD Instinct MI300X 与 MI325X 上训练 |
| 架构 | Gated Multi-head Latent Attention(Gated MLA);FarSkip-Collective 连接结构 |
| 流水线 | 预训练 → 中训 → 长上下文扩展 → SFT(反馈驱动数据筛选)→ DPO → Multi-Teacher On-Policy Distillation 的 RL |
| 开放性 | 完全开放(技术报告 + Hugging Face AMD 组织下的模型家族) |
标签
open-weightsamdmoemlatraining-infrastructureinstinct