摘要

论文把预训练的自回归修正头从单链扩展到树结构,全程免训练,用于扩散推测解码(diffusion speculative decoding)。定宽候选树按深度在一个批次内打分,配合 best-first 剪枝。单轮验证最多接收 12.97 个 token,比 DFlash 高 98.6%,比 Domino 高 27.9%,在 7 个 benchmark 上最高实现 9.73 倍无损加速。

为什么重要
对维护 vLLM、SGLang 这类推理栈的人来说,如果结果可复现,这是一项有实质价值的加速技术。目前没有代码仓库,先观望复现情况。
技术细节
单轮接收 Token 数 12.97
加速比 9.73x 无损
代码 未列出
标签
speculative-decodingdiffusioninferenceserving