该研究指出,仅从大语言模型评判者首个生成token的logits读取判定结果,虽然无需完整生成、成本低廉,却会系统性扭曲位置偏差的测量。作者发现评判者并非总以判定token开头,在三个Qwen3模型中有12%至49%的样本对如此,Llama-3.1-8B和Phi-3.5-mini则低于3%;对这些样本强制读取,得到的往往只是先展示的回复而非真实判断。在924个未主动给出判定的样本对中,交换回复顺序后强制读取的结果有89.7%发生翻转,而完整生成后读取仅为47.5%。这种扭曲具有针对性:位置偏差被移动达42个百分点,而评判准确率在十种条件中的七种变化不足一个百分点,因此主要误导的是审计者而非使用者。作者建议在报告位置偏差时,一并披露评判者以判定token开头的比例,该指标仅需一次前向传播且无需标注。
| 位置偏差 (Position Bias) | 评判器倾向于偏好或惩罚在提示中出现在特定位置(如第一个或第二个)的响应,而非基于内容质量做出判断。 |
| 受限解码 (Constrained Decoding) | 一种生成方法,通过限制模型输出必须符合特定格式(如仅允许特定token),常用于从首个token直接提取结构化结果。 |
| 似然评分 (Likelihood Scoring) | 通过计算模型对候选答案的似然概率来进行评估或选择,而非生成完整文本。 |
| 裁决token (Verdict Token) | 评判器在生成响应时首先输出的、直接表明其判断结果(如选择哪个响应更好)的token。 |
| 前向传播 (Forward Pass) | 神经网络中从输入到输出的一次完整计算过程,此处指无需生成完整文本即可获得模型输出。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅