摘要

AMD 发布 AMDKernelVault:面向新一代 CDNA GPU 的 HIP 与 Triton kernel 生成训练框架和开放语料。内容包括 62,153 个经执行验证的 HIP 样本、39,893 个 Triton kernels,以及 2,377 条来自实际 ROCm Libraries 的问答数据。团队用监督微调与执行反馈强化学习训练 Qwen3-8B,在固定预算下的 PyTorch-to-HIP、TritonBench-G 和 ROCmBench 正确率领先对比模型,但编译率和速度指标并非全面领先。

为什么重要
对开发 kernel-generation agent 的团队,这是首个把 AMD 硬件当作训练目标、而不是 CUDA 附属品的大规模执行验证路径。公开数据和 Apache-2.0 工具使 ROCm 定向复现可行。发布时仓库与数据集使用量很低,因此适合 TRIAL,尚不能视为采用信号。
技术细节
语料规模 62,153 个经执行验证的 HIP kernels;39,893 个 Triton kernels;2,377 条 ROCm Libraries 问答
流水线 HIPKernelGen 与 TritonKernelGen 在 AMD 硬件上编译、验证并测量候选延迟
训练 Qwen3-8B,监督微调 + 执行反馈强化学习
结果 PyTorch-to-HIP Pass@1 34.0%;TritonBench-G Corr@3 33.2%;ROCmBench Corr@3 41.94%
可用性 Apache-2.0 代码;公开无门禁 HF 数据集;扫描时 293 次下载、2 个 likes
局限 固定预算下正确率领先,但编译率或速度并非全面领先
标签
amdrocmhiptritongpu-kernelrlvropen-source