本文提出POSPAN,一种面向语言模型预训练的位置约束跨度掩码框架。现有跨度级掩码语言建模仅关注跨度长度的离散分布,默认被掩码跨度的位置均匀分布,忽略了跨度之间的依赖关系。POSPAN通过将跨度长度分布与位置约束分布相结合,统一了已有的各类跨度级掩码方法,并支持多样化的位置约束策略。作者在多个自然语言理解基准数据集上进行预训练评估,结果表明位置约束能够普遍增强跨度级掩码效果,最佳POSPAN配置持续优于仅考虑跨度长度的对照方法及原始单token掩码。文章还从理论层面分析了位置约束在掩码语言模型中的作用机制,论证了POSPAN的合理性与必要性。
| Span-level Masking | 一种掩码语言建模方法,掩码连续的令牌序列(跨度)而非单个令牌,以更好地捕捉短语和实体信息。 |
| Position Constraint | 在掩码过程中对跨度位置施加的约束或分布,而非假设均匀分布,以利用跨度间的依赖关系。 |
| MLM (Masked Language Modeling) | 掩码语言建模,一种预训练任务,通过预测被掩码的令牌来学习语言表示。 |
| NLU (Natural Language Understanding) | 自然语言理解,指让计算机理解人类语言的一系列任务和基准。 |
| Pre-training | 预训练,指在大规模无标注数据上训练语言模型,以学习通用语言表示,然后微调用于下游任务。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅