长任务下ICL上下文暴涨到95k,成本翻倍,探测效率却从5.6暴跌到0.95!
Measure Learning at Steady State: A BIRD-SQL Formula 1 Case Study
arXiv LG (cs.LG) 重要 #持续学习#ICL#评测方法#SQL 🕐 今天 12:00

📖 AI 总结

本文提出一种在“稳态”下衡量学习效果的方法,并以 BIRD-SQL 一级方程式数据集为案例展开研究。作者将上下文学习(ICL)视为一个学习系统,在更长的共享任务序列上进行评估,把稳态学习定义为在预设的后期窗口(174 道题中的最后 40 道)上相对基线的表现差距,并将其拆解为探索效率(SQL 探测次数)、任务奖励(命中数)和交付成本(API 费用与上下文规模)三个维度。在 gpt-5.6-luna 上,后期探测次数从 4.6–5.6 降至 0.95,但命中数仅小幅上升,同时 ICL 上下文增长至约 9.5 万 token,成本近乎翻倍。研究表明,短周期增益会低估后期探测节省,并忽略成本反转,因此无界 ICL 并非理想的学习机制。

🔑 关键词速览

ICL (In-Context Learning)上下文学习,指模型在不更新参数的情况下,仅通过提示中的示例来学习新任务。
BIRD-SQL一个大规模跨领域文本到SQL的基准数据集,用于评估模型将自然语言问题转换为SQL查询的能力。
Steady-state learning稳态学习,指在长期运行中模型性能达到稳定状态后的学习效果评估。
Exploration efficiency探索效率,衡量模型在解决问题时进行有效探索(如SQL探测)的效率。
Delivery cost交付成本,指模型运行过程中产生的API调用费用和上下文大小等开销。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅