本文提出 ModelLog,一个用于大语言模型预训练评估的声明式概率框架。该框架将评估目标表示为对词元级预测的符号约束,并衡量模型分布满足这些约束的程度,从而使模型行为的语义结构显式化。作者围绕否定、互斥性和一致性设计了一套新任务,发现模型存在系统性失败,而这些问题仅靠词元似然或答案准确率难以刻画。研究进一步表明,这些评估分数可解释为损失,其梯度反映逻辑强度、信息量和变量级敏感度,从而通过共享语义将评估与学习联系起来。该工作为诊断模型行为、理解学习信号的语义结构提供了新的形式化工具。
| ModelLog | 本文提出的声明式概率评估框架,将评估目标表示为对词元级预测的符号约束。 |
| 声明式概率评估 | 一种通过符号约束和概率分布来显式定义评估目标的方法,而非仅依赖词元似然或准确率。 |
| 词元级预测 | 语言模型对序列中每个词元(token)的预测分布,是模型行为的基本单元。 |
| 符号约束 | 用逻辑或数学符号表达的对模型预测的约束条件,如否定、互斥等语义关系。 |
| 梯度反映逻辑强度 | 评估分数作为损失函数时,其梯度大小和方向体现了约束的逻辑强度、信息量及对变量的敏感性。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅