摘要
论文提出一个面向 AI 生成 GPU kernel 的验证器,包含 12 个对抗性的属性检查门(property-based gates,多数为零容差),与参考正确性代码的一致率达 98.5%。作者用它审计了 2,638 个已公开通过验收的机器生成 kernel:39.5% 存在无法靠容差解释的错误,62.1% 至少有一项违规。业界标准测试放过了其中 1,487 个被该验证器拒绝的 kernel。
为什么重要
对只靠宽松测试就给 LLM 生成代码放行上线的团队,这是一条可以直接照做的警告:基于属性的对抗性检查应该进 CI,成为 kernel 和代码的必测项。
技术细节
| 审计的 Kernel 数 | 2638 |
|---|---|
| 无法以容差解释 | 39.5% |
| 至少一处违规 | 62.1% |
| 与参考正确性代码一致率 | 98.5% |
| 代码 | Zenodo artifact,无 GitHub 仓库 |
标签
verificationgpu-kernelsllm-codegenproperty-based-testing