该研究提出一种无需注意力机制的掩码语言建模架构,用低秩瓶颈自编码器替代Transformer中的注意力模块。具体而言,模型堆叠了三类混合模块,分别作用于局部邻域、全序列和注意力头之间,每个模块通过瓶颈压缩并重建输入,瓶颈宽度作为超参数可显式控制。针对掩码位置,作者设计了迭代精炼过程,包含将嵌入拉向邻居加权平均的“拉近”步骤和通过自编码器投影回学习流形的“校正”步骤。在C4数据集上预训练并与参数匹配的BERT基线对比,该架构以约1.9倍更少的浮点运算量达到了注意力机制相当一部分的性能。此外,采用频率感知训练调度使稀有词被更频繁采样后,模型在最稀有词频段上追平了参数匹配的BERT和TinyBERT基线。
| Masked Language Modeling | 掩码语言建模,一种预训练任务,通过预测被掩码的标记来学习语言表示。 |
| Autoencoder | 自编码器,一种神经网络,通过编码器压缩输入到低维瓶颈,再通过解码器重建输入。 |
| Manifold Projection | 流形投影,将数据点映射到学习到的低维流形上的操作,常用于降维或去噪。 |
| FLOPs | 浮点运算次数,衡量模型计算复杂度的指标,常用于比较模型效率。 |
| Frequency-aware Training Schedule | 频率感知训练计划,一种根据标记频率调整采样概率的训练策略,以更好地处理稀有标记。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅