阿拉伯语句法歧义破解新突破:神经符号框架准确率高达96.88%!
A generative-informed neuro-symbolic framework for syntactic ambiguity resolution: Evidence from Arabic DPs
arXiv CL (cs.CL) #神经符号#句法分析#阿拉伯语 🕐 今天 12:00

📖 AI 总结

本研究针对现代标准阿拉伯语中形态丰富名词短语的结构歧义问题,提出了一种生成语法信息驱动的神经符号框架。该框架将生成句法理论与AraBERT模型相结合,把歧义消解转化为基于候选结构的决策任务,通过显式构建语言学上合理的候选解释并采用候选条件化的输入表示进行评估。在未见评估集上,模型取得96.88%的准确率、95.92%的宏平均F1值、96.83%的加权F1值及93.94%的二分类F1值。类别层面分析显示性能存在不对称性:高附着(VP附着)解释的召回率达99.71%,而低附着(NP嵌入)解释仅为89.26%,表明嵌入结构的识别难度更大。研究说明形式句法表征可在基于Transformer的自然语言处理中作为语言结构与上下文神经建模之间的显式接口,为阿拉伯语及其他语言的句法歧义消解提供了可控且可解释的途径。

🔑 关键词速览

神经符号框架结合神经网络(如Transformer)与符号化语言学规则或表示,以增强可解释性和推理能力的混合方法。
句法歧义同一表层字符串可对应多种句法结构解释的现象,例如短语附着位置的不同。
限定词短语(DP)以限定词为核心的名词性短语结构,在生成句法中常作为名词短语的扩展投射。
AraBERT针对阿拉伯语预训练的BERT类Transformer模型,用于阿拉伯语自然语言理解任务。
候选条件化输入表示将每个候选结构编码为条件信息,与输入文本一同送入模型,使模型基于候选进行决策的表示方式。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅