该研究提出了一种基于多臂老虎机(MAB)框架的自适应提示词选择方法,用于降低大语言模型在自动作文评分中的推理成本。传统方法依赖固定提示词或穷举网格搜索,既昂贵又难以适应动态最优配置。研究者将每种提示类型视为老虎机的一个“臂”,在推理过程中动态选择最优策略。在雅思写作任务2数据集上的实验表明,该框架在评分准确性与穷举搜索相当的前提下,将寻找最优评分方案的LLM调用次数减少了78.4%。研究还比较了四种评分流程,发现结合多步骤评估与校准示例的提示词方案准确率最高。此外,通过同步追踪token消耗、延迟与评分一致性,作者首次绘制了作文评分的成本-可靠性学习曲线,为教育科技平台在运营成本与评估有效性之间权衡提供了实证依据。这项工作首次将在线控制机制引入AES提示词选择,将原本的离线超参数优化转化为高效的在线学习问题。
| Automated Essay Scoring (AES) | 自动作文评分,使用计算机模型对作文进行自动评分的领域。 |
| Multi-Armed Bandit (MAB) | 多臂老虎机,一种在线学习框架,用于在多个选项(臂)之间进行自适应选择以最大化累积奖励。 |
| Prompt Selection | 提示选择,指在LLM推理过程中选择不同的提示模板或策略的过程。 |
| Grid Search | 网格搜索,一种穷举搜索方法,通过遍历所有参数组合来寻找最优配置。 |
| Calibration Examples | 校准示例,用于调整模型输出或评分标准的示例,以提高准确性。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅