AI学语言也怕“笑我”这种错?新实验拆穿固化假说!
Disentangling Statistical Preemption from Entrenchment in Language Models' Avoidance of Overgeneralization
arXiv CL (cs.CL) 重要 #语言模型#认知建模#训练方法 🕐 09-03 12:00

📖 AI 总结

这篇论文通过受控实验,探究语言模型如何避免过度泛化错误(如“Tom laughed me”),并区分了两种竞争理论:统计抢占(依赖近义结构作为间接负证据)和固化(依赖动词所有合法用法的积累)。研究者在基于亲子对话训练的语言模型上,系统性地移除抢占性或非抢占性证据。结果显示,模型虽能避免过度泛化,但并未表现出动词层面的抢占效应,仅存在微弱的抽象抢占迹象。结合训练动态分析,模型在动词特定条件下将竞争结构视为间接正证据而非负证据。该发现表明,若抢占是人类避免过度泛化的更合理机制,则神经网络学习者需具备对间接负证据的敏感性,并为未来人类实验设计提供了新方向。

🔑 关键词速览

preemption一种语言学习机制,指接触近义结构会抑制过度概括的使用。
entrenchment一种语言学习机制,指通过反复接触动词的合法用法来强化正确形式,从而避免错误。
overgeneralization语言学习中过度推广规则导致的错误,如错误地使用不及物动词作及物动词。
indirect negative evidence通过未出现的结构或竞争结构的存在,间接提供关于错误用法的信息。
controlled rearing experiments在受控环境中训练模型,通过系统性地改变输入数据来测试特定假设的实验方法。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅