摘要

PTXBench 是一个评测并改造 LLM 做 GPU kernel 优化的 benchmark,目标是架构特定的 PTX(NVIDIA 的底层中间表示)。它在 H100 和 B200 上测 GEMM 与 attention 负载,看三件事:功能是否正确、选中的目标指令运行时是否真的执行、相对 cuBLAS/cuDNN 这类前沿库的加速比。主要结论偏负面:没有一个被测模型能稳定追平调优库;复杂的 attention 反向传播负载上成功率明显下降;目标指令真的执行了,也不等于性能有竞争力。作者还用 repair-conditioned SFT 改造 Qwen3.6-27B,若干任务有改善但泛化不稳;数据覆盖度、平衡性和推理教师的质量比数据规模更关键。PTXBench 把自己定位为可审计的试验台,用来度量并改进 LLM 利用新 GPU 架构的能力。

为什么重要
Kernel 生成是 LLM 复利效应最强的方向之一:硬件每年换代,kernel 工程师稀缺。对做 kernel 生成 agent 流水线的人来说,最可行动的是这个负结果——成功信号要看加速比,而不是指令选没选对,因为现在的模型能写出特殊指令却跑不赢调优库。这也是首批下探到架构特定 PTX、同时覆盖 H100 与 B200、并验证指令是否真的在运行时执行的 benchmark 之一,把知识库的 GPU-kernel 证据线(ev-20260813-06)从验证推进到能力度量。
技术细节
范围 GEMM + attention 负载;H100 + B200;架构特定 PTX
度量 功能正确性 · 目标指令是否在运行时真正执行 · 相对前沿库的加速比
发现 attention 反向传播上成功率骤降 · 指令被执行 ≠ 性能有竞争力 · 没有模型能稳定追平前沿库
适配 在 Qwen3.6-27B 上做 SFT;repair-conditioned 训练对若干任务有帮助;泛化不均;数据覆盖、平衡与教师质量比规模更关键
代码 摘要页无仓库链接;宣称 benchmark 为可审计 testbed
与知识库的关系 延续 arXiv 2608.12700 合约级验证器(ev-20260813-06)开启的 GPU-kernel × LLM 证据线
标签
gpu-kernelsptxbenchmarkllmkernel-optimizationh100b200qwensftarxivresearch