摘要

《Deadline-Aware Adaptive Prefill Chunking》(arXiv 2609.07883,9 月 9 日周三 digest)提出 SLOWeave:在线调度器选择预测能在最早活跃解码截止前完成的最大 prefill 块,取代固定块大小(启动开销与延迟尖峰的两难)。无需按负载调参,单调迭代成本模型上的对数时间搜索。作者证明:纯解码迭代可行且成本预测准确时,SLOWeave 在所有不违约选择中最大化即时 prefill 进度。

为什么重要
分块 prefill 是 vLLM/SGLang 级引擎的标准做法,但块大小是手工调的常数。这项工作把它换成可证不伤解码 SLO 的截止时间驱动在线决策——serving 团队一个下午就能 A/B 完的升级。
技术细节
ArXiv 2609.07883,2026 年 9 月 9 日周三 digest
方法 不违反截止时间的最大 prefill 块;单调成本模型上的对数时间搜索;无需负载调参
保证 纯解码迭代可行且预测准确时,可证在不违约选择中最大化即时 prefill 进度
标签
llm-servingchunked-prefillsloschedulinglatency