小模型也能自我纠错!语义熵路由让准确率飙升50个百分点
Do small language models know what they don't know?
arXiv CL (cs.CL) 重要 小模型不确定性评估 🕐 今天 12:00

📖 AI 总结

这篇论文探讨参数量低于30亿的小型语言模型能否识别自身知识的边界。作者在7组模型对和5个自然语言理解基准上评估了七种基于熵的置信度方法,发现token级熵在小型模型中几乎失效:91%的数据集与模型组合中,无论答案对错,平均token熵都接近零,无法作为可靠信号。相比之下,通过多次采样、按语义聚类答案并测量分布不确定性的语义熵,能够恢复有效的置信度信号。利用语义熵将不确定查询路由至更大的专家模型,准确率最高可提升50个百分点;跨模型家族路由平均提升22.0%,远高于同家族路由的6.8%,说明专家模型质量比架构兼容性更重要。研究的意义在于,熵方法在小型模型中的价值不在于节省算力,而在于智能分配算力,把更多token用在真正需要的地方。

🔑 关键词速览

Small Language Models (SLMs)参数量通常少于30亿、可在消费级硬件上运行的小型语言模型。
Token-level entropy基于单个词元预测概率分布计算的熵,用于衡量模型对下一个词元的不确定性。
Semantic entropy通过生成多个答案样本、按语义聚类后计算分布不确定性得到的熵,能更好地反映模型对整体语义的置信度。
Uncertainty-aware routing根据模型对查询的不确定性程度,将查询动态分配给不同规模或能力的模型进行处理。
Cross-family routing将查询路由到与原始模型不同架构家族(如不同系列)的更大专家模型。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅