LLM语法纠错新突破:F0.5冲到78.32,逼近微调SOTA!
Larger Context Window, Fewer Overcorrections: Optimizing Prompts and Batching for Minimal-Edit Grammatical Error Correction
arXiv CL (cs.CL) 重要 大模型论文方法 🕐 09-11 12:00

📖 AI 总结

本文研究最小编辑语法纠错(GEC)任务中,零样本和少样本提示的大语言模型普遍存在过度纠错问题——它们倾向于改写本已通顺的片段,从而拉低F0.5指标。虽然微调可有效缓解,但基础设施成本高昂。作者提出一套基于提示的方法,通过三项改进缩小与微调模型的差距:一是引入基于分类体系的指令,用完整的语法错误规则列表约束可纠正编辑的范围;二是将多个未纠正句子批量放入同一输入上下文,发现这能起到针对性正则化作用,系统性地降低编辑率,作者推测其源于自注意力分数容量有限导致的注意力稀释效应;三是利用大模型辅助的提示优化进一步精炼指令。在Gemini 3.1-Pro支持下,该方法在BEA-2019测试集上取得F0.5=78.32,创下基于提示的新最优结果,与微调单模型最优水平的差距仅0.38分。

🔑 关键词速览

Minimal-edit Grammatical Error Correction (GEC)最小编辑语法纠错,一种语法纠错任务,要求模型仅对错误部分进行最小程度的修改,避免不必要的重写。
F_{0.5}F_{0.5} 分数,一种评估指标,是精确率和召回率的加权调和平均,其中精确率的权重是召回率的两倍,强调精确率。
Overcorrection过度纠正,指模型在语法纠错中修改了原本正确的文本片段,导致性能下降。
Attention Dilution Effect注意力稀释效应,指在自注意力机制中,当输入上下文包含多个句子时,注意力分数被分散,从而降低对单个句子的过度关注,起到正则化作用。
BEA-2019BEA-2019 测试集,一个广泛使用的语法纠错基准数据集,用于评估模型性能。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅