🔥 今日值得一读 预算砍到2.5%还能提18个百分点,这个Text-to-SQL基准让模式选择不再靠猜
BudgetSchemaBench: A Budget-Swept Diagnostic for Schema Context in Text-to-SQL
arXiv CL (cs.CL) 🔥 重点 #Text-to-SQL#评测基准#上下文管理 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
帮助开发者在有限预算下权衡表覆盖与序列化细节,优化text-to-SQL的schema上下文。

📖 AI 总结

本文提出 BudgetSchemaBench,一个面向 Text-to-SQL 场景中模式上下文预算问题的执行级诊断基准。其核心问题是:当数据库目录庞大、包含数千列时,模型上下文窗口内如何权衡表的覆盖范围与序列化细节。该基准的相关性标签直接由金标准 SQL 机械推导,无需人工或大模型标注,并采用 80 个数据库的池化目录,在四种模式上下文预算下比较三种表示方式,同时通过源命名空间检查排除从错误数据库得到正确答案的查询。实验覆盖端到端检索、冻结金标准表和移除必需表三种条件。主要发现是:在词汇检索下,将预算从目录的 2.5% 提升至 50% 可使 1279 道留出题的执行准确率提高 18 个百分点,而稠密检索仅提高 3 个百分点,说明稠密检索在最小预算下已能找回大部分必需表;移除必需表后,94.6% 的正确预测仍能准确指出这些表,提示模型可能依据参数化知识重建缺失模式。在冻结金标准条件下,三种表示方式的差异不超过 2 个百分点。研究表明,当检索受覆盖范围限制时,执行准确率对模式预算的敏感度高于对序列化方式的敏感度。

🔑 关键词速览

Text-to-SQL将自然语言问题自动转换为可执行 SQL 查询的技术。
Schema Context数据库模式(表、列等)在模型上下文窗口中的表示与占用。
BudgetSchemaBench本文提出的基于执行的诊断基准,用于评估模式上下文预算对 Text-to-SQL 的影响。
Execution Accuracy通过比较 SQL 查询执行结果与标准答案来评估正确性的指标。
Frozen-Gold一种评估条件,其中查询所需的表被保证包含在上下文中,以隔离检索的影响。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅