摘要
vLLM 0.28.0(584 个提交、270 位贡献者、其中 76 位新加入)的主线是 Kimi-K3 性能攻坚:Decode Context Parallel 支持、融合 FlashKDA decode/prefill kernel、合并 all-gather(kernel 级提速 1.5-3 倍)、自适应投机 token 预算(DSpark 首 token 延迟改善约 60%)、可选共享专家分片(每卡省约 17 GiB 显存)。DeepSeek V4 侧稀疏 MLA 在纯 decode、MTP 与 DSpark 投机解码上全链路打通,另有 AMD Quark NVFP4 与 ROCm 支持。其余亮点:DFlash2 投机解码带候选选择器、Model Runner V2 成熟化(E/P/D 分离部署、权重 offload)、分层 KV cache offload(含磁盘)、Rust 前端 + gRPC(protobuf schema 上 Buf)、新默认值(max_num_batched_tokens 8192->16384、Mamba 默认开前缀缓存)。破坏性变更:bitsandbytes 迁出为外部插件、Transformers 升到 5.15.0、移除废弃 API。
为什么重要
在自托管 Kimi-K3 或 DeepSeek V4 权重的团队,这版就是吞吐与显存收益落地的地方,值得安排一次升级。其他团队的看点是两个结构性信号:开源前沿模型发布数天内就在默认服务栈里拿到模型专属的 kernel 优化;用 bitsandbytes 的用户升级前必须先装外部插件。
技术细节
| Kimi-K3 | Decode Context Parallel(#50484);融合 FlashKDA kernel(#50654/#51311/#52458);MegaMoE 的 SiTU 激活(#50510);GEMM-RS 序列并行(#52079);合并 all-gather 令 kernel 提速 1.5-3 倍(#51070);自适应投机 token 预算令 DSpark 首 token 延迟改善约 60%(#51725);可选共享专家分片每卡省约 17 GiB(#50912);ROCm V2 model runner(#51653) |
|---|---|
| DeepSeek V4 | 稀疏 MLA 在纯 decode/MTP/DSpark 全链路(#51538);AMD Quark NVFP4(#47972);reasoning-effort 提示映射(#50580);ROCm gfx11/gfx950(#47017/#52212) |
| 投机解码 | DFlash2 带局部卷积与候选选择器(#52816);DSpark 置信度调度验证(#47808);draft 模型默认开异步调度(#48341) |
| Model Runner V2 | E/P/D 分离部署(#38390);权重 offload(#51413);多层 MTP KV cache(#50062);encoder CUDA graph(#49852);thinking_token_budget(#46727) |
| KV Offload | 磁盘 offload(#49644);树外二级 tier manager(#51007);分层指标(#48798);规范 CPU 布局(#48414) |
| 默认值与破坏性变更 | max_num_batched_tokens 8192->16384(#51726);Mamba 前缀缓存默认开(#50991);Blackwell CUDA graph 捕获默认 1024(#49390);bitsandbytes 迁为树外插件(#43529);Transformers 5.15.0(#51668);移除 calculate_kv_scales 与 override_attention_dtype |
| 新模型支持 | Muse Glimmer、Ling 3.0 Flash(含 FP8 与混合 MXFP4)、Dots3 NOTE、Interns2mobius;CuTe DSL skinny GEMM 扩展到 GLM-5.2 |
标签
vllminferencemodel-servingopen-weightsperformancerelease