31亿词波兰语历史语料库开源,349M小模型竟超越现代大模型!
Wieszcz-XIX: A 3.1-Billion-Word Corpus of Pre-1918 Polish and Temporally Bounded Language Models Trained From Scratch
arXiv CL (cs.CL) 大模型论文方法 🕐 今天 12:00

📖 AI 总结

该研究构建了Wieszcz-XIX语料库,收录1800至1918年间出版的波兰语文献,共约31亿词、67.5亿词元、294369份文档,规模比同期人工标注语料大三个数量级以上。语料经过去重、后1918年内容泄漏审计等处理,泄漏残留控制在0.04%至0.38%之间。在可辨识文本上字符错误率为0.68%,但45%的样本段落无法校正。研究者基于该语料从零训练了47M至349M参数的仅解码器模型,发现这些模型对1918年后词汇的编码成本比同期词汇高出约3.1比特每字节,而现代波兰语基线模型无此差异,且模型能更好保留历史拼写。该工作为历史语言建模提供了大规模资源与时间边界评估方法,并公开了语料、代码与权重。

🔑 关键词速览

Wieszcz-XIX本文提出的一个包含31亿词(67.5亿词元)的1918年前波兰语历史语料库。
temporally bounded language models时间边界语言模型,指在特定历史时期语料上训练、能更好建模该时期语言特征的模型。
character error rate (CER)字符错误率,衡量OCR转录文本与正确文本之间字符级差异的指标。
post-1918 leakage1918年后的泄漏,指语料库中混入了所研究时期之后的文本内容。
decoder-only models仅解码器模型,一种基于Transformer的生成式语言模型架构,如GPT系列。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅