本研究探讨如何利用大语言模型之间的分歧来优化大规模文本标注中专家资源的投入。研究提出,先用早期版本的编码手册让多个LLM对数据进行标注,识别出模型间分歧较大的案例,再针对性地引入专家反馈,从而加速编码手册的修订。研究比较了三种专家反馈方式:编辑LLM生成的修订内容、回答关于模型分歧的问题、以及为分歧案例标注并给出理由。在数千份辅导会话转录文本上的实验显示,理由标注方式取得了最高的标注准确率(64.9%),优于专家直接修订编码手册的效果(57.8%),最佳问答设置也达到60.5%。这表明,LLM可用于策略性地引导专家注意力,将原本耗时数月的编码手册修订缩短至数天,同时不牺牲标注性能。
| 编码手册(Codebook) | 指导标注者如何对文本进行分类或标注的规则和定义集合。 |
| 跨模型分歧(Cross-Model Disagreement) | 不同大型语言模型对同一数据给出不同预测或标注的现象,可用于识别需要专家关注的模糊案例。 |
| 理由标注(Rationale Labeling) | 专家不仅标注分歧案例的类别,还提供做出该标注的理由或解释。 |
| 编码手册验证(Codebook Verifying) | 专家对LLM基于跨模型分歧生成的编码手册修订进行编辑和验证的过程。 |
| 问答(Question Answering) | 专家回答关于LLM分歧的具体问题,以提供反馈来改进编码手册。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅