大模型没“未完成体悖论”?新基准暴露76%标注漏洞,GPT-5.4也翻车!
The Imperfective Paradox Is Not Necessarily in Large Language Models: A Benchmark Failure Before a Model Failure
arXiv CL (cs.CL) 论文方法 🕐 08-27 12:00

📖 AI 总结

该研究重新审视了大型语言模型在“未完成悖论”上的表现,指出此前报告模型存在“目的论偏差”的结论源于基准测试本身的概念与评估错误。作者识别出三种概念性错误,其中“体貌还原”问题影响最广:在严格NLI标准下,76%的A类实例并未明确排除事件完成义,且母语者标注显示38%的A类和29%的C类示例允许多重解读。通过构建词汇匹配的最小对比对并采用多步推理评估,研究发现模型并非直接推断完成义,而是表现出“充分性偏差”——接受简单过去式假设却不肯定完成义。提示干预仅造成标签间的决策转移,未真正提升语义理解。实验还发现组合体貌分类错误和“表层形式吸引”两种额外失败模式,但Qwen系列等模型在适当提示下可达接近人类标注者的表现,表明体貌分类具有上下文敏感性。

🔑 关键词速览

Imperfective Paradox未完成体悖论:指进行体描述(如“正在建造”)与完成体描述(如“建造完成”)之间的语义关系问题,即进行体是否蕴含事件完成。
Teleological Bias目的论偏见:模型倾向于从进行体描述中推断出事件完成(终结)的倾向,可能源于对事件目的性的过度假设。
Aspectual Reduction体貌还原:一种概念性错误,指在基准构建或分析中简化或忽略体貌(如进行体与完成体)的语义差异,导致误导性结论。
Sufficiency Bias充分性偏见:模型在推理中认为简单过去时假设足以成立,而不需要明确肯定终结事件,从而影响NLI判断的模式。
Surface-form Attraction表面形式吸引:模型倾向于基于输入文本的表面词汇形式(而非深层语义)选择答案,导致推理错误。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅