本文介绍了ESQ-Bench,一个面向企业级Oracle环境的NL2SQL基准测试集,旨在评估模型在复杂数据库方言下的泛化能力和语义偏差。现有基准如Spider和BIRD虽报告超过89%的执行准确率,但基于简化学术模式,无法反映真实企业场景。ESQ-Bench包含465张表、164,682行数据,覆盖Oracle、PostgreSQL、MySQL和SQL Server四种数据库,并设计了三个复杂度层级和550个经过验证的问题-查询对。评测采用EM、EX、SR、SD四项指标,其中SD专门检测“静默语义偏差”。实验显示,GPT-4o在schema-linked提示下执行匹配率随层级递增而下降(79.8%、60.3%、57.2%),而Claude Sonnet 4.6在各层级均超越GPT-4o。本地开源模型Llama 3.2表现显著落后,凸显闭源API模型与开源权重模型在企业级NL2SQL任务上的巨大差距。该研究揭示了现有基准的局限性,为企业级NL2SQL评估提供了更贴近实际的标准。
| NL2SQL | 自然语言到SQL的转换,即将自然语言查询自动生成对应的SQL查询语句。 |
| 静默分歧(Silent Divergence) | 指生成的SQL查询执行结果与预期结果不同,但未触发错误或异常,导致结果语义偏差。 |
| ESQ-Bench | 本文提出的企业级Oracle优先NL2SQL基准,包含多层级复杂度和静默分歧评估。 |
| 执行匹配(Execution Match, EX) | 评估生成的SQL查询执行结果与金标准结果是否一致的指标。 |
| 模式链接提示(Schema-Linked Prompting) | 一种提示方法,将数据库模式信息(如表结构)作为上下文提供给模型,以提升SQL生成准确性。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅