摘要
AMD 发布 AMDKernelVault:面向新一代 CDNA GPU 的 HIP 与 Triton kernel 生成训练框架和开放语料。内容包括 62,153 个经执行验证的 HIP 样本、39,893 个 Triton kernels,以及 2,377 条来自实际 ROCm Libraries 的问答数据。团队用监督微调与执行反馈强化学习训练 Qwen3-8B,在固定预算下的 PyTorch-to-HIP、TritonBench-G 和 ROCmBench 正确率领先对比模型,但编译率和速度指标并非全面领先。
为什么重要
对开发 kernel-generation agent 的团队,这是首个把 AMD 硬件当作训练目标、而不是 CUDA 附属品的大规模执行验证路径。公开数据和 Apache-2.0 工具使 ROCm 定向复现可行。发布时仓库与数据集使用量很低,因此适合 TRIAL,尚不能视为采用信号。
技术细节
| 语料规模 | 62,153 个经执行验证的 HIP kernels;39,893 个 Triton kernels;2,377 条 ROCm Libraries 问答 |
|---|---|
| 流水线 | HIPKernelGen 与 TritonKernelGen 在 AMD 硬件上编译、验证并测量候选延迟 |
| 训练 | Qwen3-8B,监督微调 + 执行反馈强化学习 |
| 结果 | PyTorch-to-HIP Pass@1 34.0%;TritonBench-G Corr@3 33.2%;ROCmBench Corr@3 41.94% |
| 可用性 | Apache-2.0 代码;公开无门禁 HF 数据集;扫描时 293 次下载、2 个 likes |
| 局限 | 固定预算下正确率领先,但编译率或速度并非全面领先 |
标签
amdrocmhiptritongpu-kernelrlvropen-source