摘要

《Margins, Not Windows》(arXiv 2609.02897,9 月 4 日周五 digest)提出 AdaptiveSpec:免训练的有损推测解码,在解码时协同调节两个旋钮——逐步的边际验证规则(目标与草稿 top-1 概率之比超过阈值时,提升不匹配的草稿 token)与草稿树形态(深度 / 宽度 / 节点数,由草稿 top-1 置信度加滚动接受历史调整)。两个信号都是解码过程本来就有的,无需任何训练。已在 SGLang 生产引擎中实现:在三个目标模型(DeepSeek-R1-Distill-Llama-8B、Llama-3.1-8B-Instruct、Qwen3-8B)上,吞吐较 SGLang 上的 EAGLE-3 最高提升 56%,在 GSM8K、MATH-500、HumanEval 上恢复无损失准确率的 93-100%。

为什么重要
推测解码是标准的吞吐杠杆,但有损版本通常要重训验证器。这一版是即插即用:边际规则与树形调整复用引擎本就计算的信号,SGLang 已有集成,且准确率 / 吞吐的权衡(恢复 93-100% 准确率)是显式的——团队可以自选工作点,而不是在「无损 / 不用」之间二选一。
技术细节
ArXiv 2609.02897,2026 年 9 月 4 日周五 digest 宣告
机制 逐步边际规则(目标 / 草稿 top-1 概率比超阈值时提升不匹配草稿 token)+ 自适应草稿树形态(由草稿置信度 + 滚动接受历史决定深度 / 宽度 / 节点数);零训练
集成 已在 SGLang 生产引擎中实现
结果 三个目标模型(DeepSeek-R1-Distill-Llama-8B、Llama-3.1-8B-Instruct、Qwen3-8B)上较 SGLang 的 EAGLE-3 吞吐最高 +56%;GSM8K / MATH-500 / HumanEval 上恢复无损失准确率的 93-100%
标签
speculative-decodingsglangservingthroughputinference-efficiency