本文介绍了DataKernelBench,一个用于评估大语言模型(LLM)优化GPU数据库查询性能的新基准。现有LLM内核基准多聚焦于机器学习算子,忽略了数据库场景中不规则、异构且数据移动密集的算子。DataKernelBench将SQL转换为PyTorch TorchPlan程序,并测试LLM通过执行引导修复,将核心代码或完整查询优化为CUDA或Triton实现。在TPC-H SF10数据集和H100 GPU上,对十个专有及开源模型进行评估,最强配置在完整查询CUDA优化下实现了2.11倍加速,且全部通过验证。研究发现,高性能实现常采用内核融合和执行策略调整,更强模型在完整查询优化中获益更多,且工作负载上下文比硬件上下文更具影响力。为处理超GPU内存数据,该基准扩展了Dask-cuDF,在TPC-H SF100和四块H100 GPU上实现2.54倍加速。这项工作填补了LLM在数据库内核优化领域的评估空白,为异构数据密集型算子优化提供了新基准。
| DataKernelBench | 一个用于评估 LLM 优化 GPU 数据库查询内核的基准测试框架。 |
| TorchPlan | 一种将 SQL 查询转换为 PyTorch 程序的表示形式,便于优化和执行。 |
| CUDA | NVIDIA 的并行计算平台和编程模型,用于 GPU 通用计算。 |
| Triton | 一种用于编写高效 GPU 内核的领域特定语言和编译器。 |
| TPC-H | 决策支持基准测试,模拟商业分析工作负载,用于评估数据库系统性能。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅