本文提出 BudgetSchemaBench,一个面向 Text-to-SQL 场景中模式上下文预算问题的执行级诊断基准。其核心问题是:当数据库目录庞大、包含数千列时,模型上下文窗口内如何权衡表的覆盖范围与序列化细节。该基准的相关性标签直接由金标准 SQL 机械推导,无需人工或大模型标注,并采用 80 个数据库的池化目录,在四种模式上下文预算下比较三种表示方式,同时通过源命名空间检查排除从错误数据库得到正确答案的查询。实验覆盖端到端检索、冻结金标准表和移除必需表三种条件。主要发现是:在词汇检索下,将预算从目录的 2.5% 提升至 50% 可使 1279 道留出题的执行准确率提高 18 个百分点,而稠密检索仅提高 3 个百分点,说明稠密检索在最小预算下已能找回大部分必需表;移除必需表后,94.6% 的正确预测仍能准确指出这些表,提示模型可能依据参数化知识重建缺失模式。在冻结金标准条件下,三种表示方式的差异不超过 2 个百分点。研究表明,当检索受覆盖范围限制时,执行准确率对模式预算的敏感度高于对序列化方式的敏感度。
| Text-to-SQL | 将自然语言问题自动转换为可执行 SQL 查询的技术。 |
| Schema Context | 数据库模式(表、列等)在模型上下文窗口中的表示与占用。 |
| BudgetSchemaBench | 本文提出的基于执行的诊断基准,用于评估模式上下文预算对 Text-to-SQL 的影响。 |
| Execution Accuracy | 通过比较 SQL 查询执行结果与标准答案来评估正确性的指标。 |
| Frozen-Gold | 一种评估条件,其中查询所需的表被保证包含在上下文中,以隔离检索的影响。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅