该研究针对多专家标注场景中标签不确定性的建模问题提出新方法。当多位专家对同一观测给出不同但合理的区间标注时,监督信号中同时包含标签内部不精确性和专家间分歧两类不确定性,而现有方法往往将二者割裂处理:多专家方法倾向于合并为共识标签,区间目标方法通常只输出单一预测,预测不确定性方法则很少用实际专家分歧来验证其估计。为此,作者提出保留每位专家的独立区间,将标签内部不精确性与专家间差异分离建模,并验证相应的预测不确定性分量。方法包括:将异构标签词表统一到共同概率标签空间,以区分编码差异与专家判断;用Beta混合分布保留个体区间,并以适当的Cramér距离目标训练;将预测不确定性分解为组内、组间和模型不确定性,并引入分解匹配机制使预测分量与标签侧来源对齐。在海冰浓度数据上,该方法较硬标签降低31%的平均绝对误差,并优于聚合、区间分布和区间回归等基线。
| 多专家区间目标 | 指多个专家对同一观测提供区间形式的标签,而非单一精确值,从而同时包含标签内不精确性和专家间变异。 |
| 标签内不精确性 | 单个专家报告的区间所固有的不确定性,反映该专家对自身判断的不精确程度。 |
| 专家间变异 | 不同专家对同一观测给出的标签之间的差异,可能源于真实分歧或模糊性,而非标注错误。 |
| 混合Beta分布 | 一种概率分布模型,用于对区间标签进行建模,能够保留不同专家报告的区间信息。 |
| 分解匹配 | 一种将预测不确定性成分与标签侧不确定性来源对齐的方法,确保预测成分对应其预期的标签不确定性。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅