🔥 今日值得一读 智能体别再瞎猜了!PlanPool让SQL澄清覆盖率飙升,静默失败大幅减少
Beyond Correctness: Resolving Underspecification in Agentic Text-to-SQL
arXiv CL (cs.CL) 🔥 重点 #Text-to-SQL#Agent#对话系统 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
帮助开发者改进Text-to-SQL智能体的澄清策略,避免过早停止提问导致SQL虽正确但基于错误假设。

📖 AI 总结

该研究聚焦智能体式Text-to-SQL系统中的欠规范问题,指出正确执行结果并不代表智能体真正消除了查询歧义——智能体可能默默做出未经核实的假设,恰好与预期答案吻合。作者发现,这一现象部分源于澄清过程过早终止:尽管强制智能体多提问能提升执行准确率,但歧义主要集中在早期交互中,暴力提问效率低下;更关键的是,即使被明确要求规划澄清流程,智能体仍常放弃已识别出的相关问题。为此,作者提出PlanPool方法,将澄清计划外化为可变问题池,每个计划问题必须被明确询问或丢弃后才能提交,交互中新发现的歧义也可随时加入。在基于BIRD-Interact和Spider构建的三个基准上,PlanPool持续提升歧义覆盖率并减少静默失败,同时保持有竞争力的执行准确率。研究揭示了一个重要区别:识别缺失信息并不足够,智能体还必须在给出答案前可靠地维护并解决这些问题。

🔑 关键词速览

Agentic Text-to-SQL智能体式文本到SQL,指能够与用户交互以澄清查询并生成SQL的智能系统。
Underspecification欠明确性,指用户查询中信息不完整或模糊,导致多种解释可能。
Premature Clarification Termination过早终止澄清,指智能体在未充分解决歧义前就停止提问的行为。
PlanPool一种将澄清计划外化为可变问题池的方法,要求每个计划问题必须被提问或丢弃。
Silent Failures静默失败,指智能体做出未经验证的假设并得到正确答案,但实际未解决歧义的情况。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅