LLM写GPU数据库内核,比torch.compile快2.11倍!
DataKernelBench: Can LLMs Optimize Database Queries on GPUs?
arXiv CL (cs.CL) 重要 大模型论文方法 🕐 08-27 12:00

📖 AI 总结

本文介绍了DataKernelBench,一个用于评估大语言模型(LLM)优化GPU数据库查询性能的新基准。现有LLM内核基准多聚焦于机器学习算子,忽略了数据库场景中不规则、异构且数据移动密集的算子。DataKernelBench将SQL转换为PyTorch TorchPlan程序,并测试LLM通过执行引导修复,将核心代码或完整查询优化为CUDA或Triton实现。在TPC-H SF10数据集和H100 GPU上,对十个专有及开源模型进行评估,最强配置在完整查询CUDA优化下实现了2.11倍加速,且全部通过验证。研究发现,高性能实现常采用内核融合和执行策略调整,更强模型在完整查询优化中获益更多,且工作负载上下文比硬件上下文更具影响力。为处理超GPU内存数据,该基准扩展了Dask-cuDF,在TPC-H SF100和四块H100 GPU上实现2.54倍加速。这项工作填补了LLM在数据库内核优化领域的评估空白,为异构数据密集型算子优化提供了新基准。

🔑 关键词速览

DataKernelBench一个用于评估 LLM 优化 GPU 数据库查询内核的基准测试框架。
TorchPlan一种将 SQL 查询转换为 PyTorch 程序的表示形式,便于优化和执行。
CUDANVIDIA 的并行计算平台和编程模型,用于 GPU 通用计算。
Triton一种用于编写高效 GPU 内核的领域特定语言和编译器。
TPC-H决策支持基准测试,模拟商业分析工作负载,用于评估数据库系统性能。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅