仅微调81个加法对,就能测出语言模型置信度是真实掌握还是虚构记忆!
Technical Manual for Toolkit for Confidence-Corpus Consistency via Fine-Tuning on a Fabricated Corpus
arXiv CL (cs.CL) 重要 #置信度#微调#可解释性 🕐 今天 12:00

📖 AI 总结

本文是一份技术手册,介绍了一套开源工具包,用于检验语言模型对答案的置信度是否真能反映其知识掌握程度。该工具包的核心方法是:先让一个小型因果语言模型在预训练阶段对81组个位数加法的真实答案形成置信度,再通过在一个伪造语料库上微调,使模型对每组加法都一致地输出同一个虚构答案,随后用完全相同的测量流程,对比微调后模型对虚构答案的置信度与微调前对真实答案的置信度。手册逐一说明并论证了流水线的各个环节,包括事实空间生成、考虑词元长度的置信度测量、基线验证、语料构建、微调以及配对的前后对比,并阐明了每个环节旨在排除的混淆因素,例如单位数与双位数答案之间的分词不对称,以及答案仅是失去优势与被主动压制之间的区别。需要强调的是,本文属于方法与实现参考,只记录工具本身,不报告也不解读任何具体运行的结果。工具包及其固定依赖环境已另行归档并分配持久标识符,供后续产生和解读实证结果的研究作为工具引用。

🔑 关键词速览

因果语言模型一种仅根据左侧上下文预测下一个词的语言模型,常用于生成任务。
微调在预训练模型基础上,使用特定数据集进一步训练以适配下游任务的过程。
令牌化不对称性指不同长度的答案(如单数字与双数字)在分词后令牌数量不同,可能影响置信度测量。
事实空间生成系统性地生成所有待测试的事实性问答对的过程,例如所有单数字加法组合。
配对前后比较对同一模型在微调前后对同一问题的置信度进行配对比较,以控制个体差异。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅