摘要

Unity 报告已在广告模型 serving 栈部署 FlashVector。该 agent 在同一个闭环中优化 CUDA 算子、PyTorch 计算图、NVIDIA Triton C++、Python 特征处理和服务参数。生产环境报告的最高收益为模型服务吞吐翻倍、延迟提速 1.98 倍,特征存储吞吐提升 1.6 倍。论文未公开系统,也没有独立复现。

为什么重要
对推理团队来说,真正需要优化的是完整 serving 路径,而不只是 GPU 算子。这是 agent 能跨语言、跨层搜索并检查服务级约束的生产信号。实现未公开,指标也只由厂商报告,因此先列为 WATCH,等待其他团队复现。
技术细节
部署 Unity Vector 广告平台;每秒数十万次请求
覆盖层 CUDA 算子、PyTorch 计算图、NVIDIA Triton 服务、Python 特征存储与服务参数
模型服务 最高吞吐 2 倍、延迟提速 1.98 倍
特征存储 最高吞吐 1.6 倍
可用性 仅论文;实现未公开
标签
model-servingoptimization-agentGPUTritonproduction