本文提出一种在“稳态”下衡量学习效果的方法,并以 BIRD-SQL 一级方程式数据集为案例展开研究。作者将上下文学习(ICL)视为一个学习系统,在更长的共享任务序列上进行评估,把稳态学习定义为在预设的后期窗口(174 道题中的最后 40 道)上相对基线的表现差距,并将其拆解为探索效率(SQL 探测次数)、任务奖励(命中数)和交付成本(API 费用与上下文规模)三个维度。在 gpt-5.6-luna 上,后期探测次数从 4.6–5.6 降至 0.95,但命中数仅小幅上升,同时 ICL 上下文增长至约 9.5 万 token,成本近乎翻倍。研究表明,短周期增益会低估后期探测节省,并忽略成本反转,因此无界 ICL 并非理想的学习机制。
| ICL (In-Context Learning) | 上下文学习,指模型在不更新参数的情况下,仅通过提示中的示例来学习新任务。 |
| BIRD-SQL | 一个大规模跨领域文本到SQL的基准数据集,用于评估模型将自然语言问题转换为SQL查询的能力。 |
| Steady-state learning | 稳态学习,指在长期运行中模型性能达到稳定状态后的学习效果评估。 |
| Exploration efficiency | 探索效率,衡量模型在解决问题时进行有效探索(如SQL探测)的效率。 |
| Delivery cost | 交付成本,指模型运行过程中产生的API调用费用和上下文大小等开销。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅