Transformer可读性评估竟复现传统特征,覆盖5种语言!
Analyzing Traditional and Neural Approaches to Multilingual Readability Assessment
arXiv CL (cs.CL) 论文方法大模型 🕐 09-11 12:00

📖 AI 总结

本研究比较了传统特征模型与神经模型在多语言可读性评估中的表现,覆盖阿拉伯语、英语、法语、印地语和俄语五种语言,使用ReadMe++数据集。作者关注一个核心问题:可读性标签本身具有主观性和评分者依赖性,因此高准确率未必意味着模型真正掌握了定义文本难度的语言结构。研究采用SHAP方法识别驱动传统分类器的关键特征,并将其作为TCAV概念集,用以探测多语言模型XLM-R及多种语言专属编码器。结果显示,Transformer模型确实能够捕捉表层长度、句法和词汇多样性等信号,并反映出传统模型所依据的CEFR有序等级结构;但模型与传统模型的对齐程度因模型家族、语言和层级而异,语言专属编码器的对齐效果普遍优于XLM-R。研究还发现,高线性可分性并不总意味着方向性影响,这限制了线性探测方法在基于计数的可读性特征上的适用性。该工作为理解神经可读性评估模型是否真正内化了语言学特征提供了方法论参考。

🔑 关键词速览

Automatic Readability Assessment (ARA)自动可读性评估,指利用计算模型自动预测文本阅读难度的任务。
Shapley Additive Explanations (SHAP)沙普利加性解释,一种基于博弈论的特征归因方法,用于解释机器学习模型的预测。
TCAV测试概念激活向量,一种通过概念集探测模型内部表示以理解其决策的方法。
XLM-R多语言鲁棒性Transformer模型,一种支持多语言的自然语言处理预训练模型。
CEFR欧洲共同语言参考框架,一种描述语言能力的标准等级体系。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅