位置约束让预训练语言模型更强,POSPAN统一所有跨度掩码方法并持续超越原始MLM!
POSPAN: Position-Constrained Span Masking for Language Model Pre-training
arXiv LG (cs.LG) 重要 大模型论文方法 🕐 09-16 12:00

📖 AI 总结

本文提出POSPAN,一种面向语言模型预训练的位置约束跨度掩码框架。现有跨度级掩码语言建模仅关注跨度长度的离散分布,默认被掩码跨度的位置均匀分布,忽略了跨度之间的依赖关系。POSPAN通过将跨度长度分布与位置约束分布相结合,统一了已有的各类跨度级掩码方法,并支持多样化的位置约束策略。作者在多个自然语言理解基准数据集上进行预训练评估,结果表明位置约束能够普遍增强跨度级掩码效果,最佳POSPAN配置持续优于仅考虑跨度长度的对照方法及原始单token掩码。文章还从理论层面分析了位置约束在掩码语言模型中的作用机制,论证了POSPAN的合理性与必要性。

🔑 关键词速览

Span-level Masking一种掩码语言建模方法,掩码连续的令牌序列(跨度)而非单个令牌,以更好地捕捉短语和实体信息。
Position Constraint在掩码过程中对跨度位置施加的约束或分布,而非假设均匀分布,以利用跨度间的依赖关系。
MLM (Masked Language Modeling)掩码语言建模,一种预训练任务,通过预测被掩码的令牌来学习语言表示。
NLU (Natural Language Understanding)自然语言理解,指让计算机理解人类语言的一系列任务和基准。
Pre-training预训练,指在大规模无标注数据上训练语言模型,以学习通用语言表示,然后微调用于下游任务。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅