8.7M小模型实测:MacBERT困惑度暴涨22倍,排名彻底反转!
Tiny-Scale Chinese BERT Pretraining: A Controlled Comparison of MLM, WWM, and MacBERT Strategies
arXiv CL (cs.CL) #预训练#中文BERT#掩码语言建模 🕐 今天 12:00

📖 AI 总结

本研究在极小规模中文BERT模型(4层、256隐藏维度、870万参数)上,对掩码语言建模(MLM)、全词掩码(WWM)和MacBERT式替换三种预训练策略进行了受控对比。在相同架构、语料(129万句中文维基百科)和超参数下从头训练三个模型,并从困惑度、MLM命中率、语义区分、语法判断和上下文敏感性五个维度评估。结果显示,小规模下MLM综合表现最佳(五维中胜出三项),WWM在困惑度和命中率上占优;而MacBERT因同义词词典严重受限(仅222条、覆盖率3.3%)导致困惑度急剧恶化,整体排序为MLM>WWM>>MacBERT,与基座规模下MacBERT>WWM>MLM的结论明显不同。研究还揭示了一个评估陷阱:MacBERT训练损失最低却困惑度最高,说明混合替换策略下仅凭训练损失判断模型质量并不可靠。

🔑 关键词速览

MLM (Masked Language Modeling)掩码语言建模,一种预训练任务,随机掩盖输入中的部分词元并让模型预测它们。
WWM (Whole Word Masking)全词掩码,一种改进的掩码策略,在中文中掩盖整个词而非单个字符。
MacBERT一种基于BERT的预训练方法,使用同义词替换被掩码的词元,以缓解预训练和微调之间的不一致。
Perplexity困惑度,衡量语言模型预测样本概率的指标,值越低表示模型性能越好。
Tiny-scale微型规模,指模型参数量远小于基础规模(如本文的8.7M参数),用于资源受限场景。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅