这篇论文探讨参数量低于30亿的小型语言模型能否识别自身知识的边界。作者在7组模型对和5个自然语言理解基准上评估了七种基于熵的置信度方法,发现token级熵在小型模型中几乎失效:91%的数据集与模型组合中,无论答案对错,平均token熵都接近零,无法作为可靠信号。相比之下,通过多次采样、按语义聚类答案并测量分布不确定性的语义熵,能够恢复有效的置信度信号。利用语义熵将不确定查询路由至更大的专家模型,准确率最高可提升50个百分点;跨模型家族路由平均提升22.0%,远高于同家族路由的6.8%,说明专家模型质量比架构兼容性更重要。研究的意义在于,熵方法在小型模型中的价值不在于节省算力,而在于智能分配算力,把更多token用在真正需要的地方。
| Small Language Models (SLMs) | 参数量通常少于30亿、可在消费级硬件上运行的小型语言模型。 |
| Token-level entropy | 基于单个词元预测概率分布计算的熵,用于衡量模型对下一个词元的不确定性。 |
| Semantic entropy | 通过生成多个答案样本、按语义聚类后计算分布不确定性得到的熵,能更好地反映模型对整体语义的置信度。 |
| Uncertainty-aware routing | 根据模型对查询的不确定性程度,将查询动态分配给不同规模或能力的模型进行处理。 |
| Cross-family routing | 将查询路由到与原始模型不同架构家族(如不同系列)的更大专家模型。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅