这篇论文审视了思维链(CoT)令牌熵这一常用指标的实际含义。作者指出,对下一个令牌分布的熵计算实际上混合了三种不同选择:是否输出连接性“脚手架”词、选择哪个连接词、以及实质内容的延续方向。通过划定脚手架词汇子集,研究者将这三类信号在熵、KL散度和一阶熵速度上精确分离。关键发现包括:在二十三种配置中,脚手架通道最多占据原始高熵集合的41%;在匹配分词器阶梯上,耦合仅在数学语料步骤发生变化,而脚手架的熵占比在蒸馏过程中持续增长;基于单一通道相关性的闭式预测能在54点范围内以五点误差追踪选择保留率,且无需拟合。在压缩任务中,内容约定在所有单元格中均优于原始惊奇度。此外,答案泄漏审计修正了作者自身的主要对照结果:重新输入的思维链有四分之一的准确率来自重复陈述的答案,剥离后没有任何令牌评分器能胜过随机连续块。该研究揭示了CoT熵指标的内在混杂性,对策略梯度分配、令牌剪枝和崩溃检测等下游应用具有重要警示意义。
| Chain-of-Thought (CoT) | 思维链,一种让语言模型在给出最终答案前生成中间推理步骤的技术。 |
| Entropy | 熵,在信息论中衡量概率分布的不确定性或随机性。 |
| Kullback-Leibler Divergence | KL散度,衡量两个概率分布之间差异的非对称度量。 |
| Softmax Policy | Softmax策略,一种在强化学习中根据动作价值生成动作概率分布的策略。 |
| Scaffold Vocabulary | 脚手架词汇,指用于构建推理结构(如连接词)的令牌子集。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅