该研究系统评估了大语言模型在时间与事件表达抽取任务中的多维泛化能力。作者针对现有评测多局限于域内性能、难以反映分布偏移下可靠性的问题,跨模型家族、架构与推理策略,从领域迁移、对抗扰动、组合性和长度增长四个维度考察泛化表现,并分析其与基础任务性能、规模、架构及提示策略的关系。研究发现,基础任务表现强通常预示泛化较好,但在显著分布偏移下这一关联明显减弱;归纳式提示在四个维度上表现最为稳定,而模型规模、架构以及演绎、溯因提示带来的增益则因维度而异。结论指出,时间抽取任务的泛化无法由单一维度预测,也不能仅凭域内或单维评测推断,需发展跨维度稳健的推理策略。
| Temporal Extraction Tasks | 从文本中识别和抽取时间表达(如日期、时间)及事件表达的任务,是时间推理的基础。 |
| Distribution Shifts | 指训练数据和测试数据分布不一致的情况,例如领域变化、对抗扰动等,用于评估模型的泛化能力。 |
| Inductive Prompting | 一种提示策略,通过提供示例或引导模型从具体实例中归纳规律,以提升模型在任务上的表现。 |
| Compositionality | 指模型理解和处理由已知部分组合而成的新表达或结构的能力,是泛化的重要维度。 |
| Adversarial Perturbations | 对输入进行微小、有意设计的改动,以误导模型产生错误输出,用于测试模型的鲁棒性。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅