本文提出Neo-Classic,一个用于评估大语言模型在古典中文诗歌中语言审美推理能力的基准。针对现有基准难以区分模型是真正具备可迁移的审美推理,还是依赖预训练中熟悉的模式,该基准采用建构主义式的样本外数据集,由当代专家创作严格符合格律的诗作,以降低直接检索的可能性,并设计了一组逆向理解探针。研究评估了Qwen3-Max、Gemini-3-Pro、DeepSeek-V3.2等先进模型在五项行为探针上的表现,发现两个主要局限:一是模型从历史文本迁移到当代文本时性能下降20%至50%;二是在篇章级排序任务上表现极差,标准准确率仅为0%至13%。即便引入专家级提示,推理增强模型也仅提升至36%,与人类专家仍有明显差距。这表明当前模型虽能捕捉局部形式模式,却难以完成稳健审美推理所需的全局层级规划。
| Neo-Classic | 一个用于评估中国古典诗歌语言审美推理的基准,包含当代专家创作的格律诗和逆向理解探针。 |
| Out-of-Sample (OOS) | 样本外数据,指模型训练时未见过的新数据,用于测试泛化能力而非记忆。 |
| Linguistic-Aesthetic Reasoning | 语言审美推理,指模型理解和生成符合语言美学与格律约束的文本的能力。 |
| Hierarchical Constraint Satisfaction | 层次约束满足,指在多个层级(如字词、句法、篇章)上同时满足形式与语义约束。 |
| Discourse-level Ordering | 语篇级排序,指在篇章层面合理安排句子或诗行的顺序以形成连贯整体。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅