摘要
Minima(arXiv 2609.04098,9 月 4 日周五 digest,cs.AI)把 NVFP4 W4A4 应用到 Qwen3.8-27B 混合模型的全部 496 个线性层——包括全部 48 个 Gated DeltaNet 层——直接检验「门控必须保高精度」的直觉。结果:在 4K/32K 困惑度、MMLU-Pro、GSM8K、AIME'25、GPQA-Diamond、LiveCodeBench 与 64K 以内 RULER 上与 BF16 相差在噪声内(五项任务平均 -0.52),同时是其对比中最小的配方(17.5 GiB)、prefill 最快(+14-19%)。四部分机制研究解释了原因:NVFP4 的 16 元素块缩放把异常值局部化;门控投影最不敏感;delta-rule 递归让噪声保持平稳;每 token 的代价会被摊销而非累积。量化后的 checkpoint 已公开在 HF(minima-ai),同时发布 FP8 KV-cache 缩放因子。
为什么重要
开源权重前沿刚切换到混合线性注意力架构(趋势 #1:GLM-5.3-Flash、Qwen3.8-Flash-Next),而这类模型还没有成熟的量化配方——各厂商在临时发 NVFP4 衍生版。这项工作给出 27B 混合模型的首个系统性公开答案:全部量化,包括循环那一半,质量损失在测量噪声内。这会直接改写混合模型的 serving 成本账。
技术细节
| ArXiv | 2609.04098,2026 年 9 月 4 日周五 digest 宣告(cs.AI 池) |
|---|---|
| 对象 | Qwen3.8-27B 混合模型:全部 496 个线性层 NVFP4 W4A4,含全部 48 个 Gated DeltaNet 层 |
| 结果 | 4K/32K 困惑度、MMLU-Pro、GSM8K、AIME'25、GPQA-Diamond、LiveCodeBench、64K 内 RULER 上与 BF16 差异在噪声内(五项平均 -0.52);对比中最小配方(17.5 GiB);prefill 最快(+14-19%) |
| 机制 | 16 元素块缩放局部化异常值;门控投影最不敏感;delta-rule 递归使噪声平稳;每 token 代价被摊销 |
| 产物 | 量化 checkpoint 公开于 HF(minima-ai);同时发布 FP8 KV-cache 缩放因子 |
标签
quantizationnvfp4hybrid-attentiongated-deltanetservingopen-weights