摘要
Unity 报告已在广告模型 serving 栈部署 FlashVector。该 agent 在同一个闭环中优化 CUDA 算子、PyTorch 计算图、NVIDIA Triton C++、Python 特征处理和服务参数。生产环境报告的最高收益为模型服务吞吐翻倍、延迟提速 1.98 倍,特征存储吞吐提升 1.6 倍。论文未公开系统,也没有独立复现。
为什么重要
对推理团队来说,真正需要优化的是完整 serving 路径,而不只是 GPU 算子。这是 agent 能跨语言、跨层搜索并检查服务级约束的生产信号。实现未公开,指标也只由厂商报告,因此先列为 WATCH,等待其他团队复现。
技术细节
| 部署 | Unity Vector 广告平台;每秒数十万次请求 |
|---|---|
| 覆盖层 | CUDA 算子、PyTorch 计算图、NVIDIA Triton 服务、Python 特征存储与服务参数 |
| 模型服务 | 最高吞吐 2 倍、延迟提速 1.98 倍 |
| 特征存储 | 最高吞吐 1.6 倍 |
| 可用性 | 仅论文;实现未公开 |
标签
model-servingoptimization-agentGPUTritonproduction