该研究评估了五种大型语言模型(LLMs)作为零样本标注工具,在英文歌词中测量四种社会建构(自尊、自我控制、归属寻求和认可寻求)时的可靠性。通过对大规模歌词语料库进行重复标注,研究者考察了三个关键属性:重复运行间的一致性、跨模型的收敛性,以及共识标签向监督分类的迁移能力。结果显示,LLM测量在不同建构上的可靠性并不均匀——自尊的重复测量信度最强,认可寻求最不稳定,而自我控制和归属寻求则表现中等且依赖具体模型。下游分类实验表明,共识标签包含可学习的信号,但迁移性本身并不能确立建构效度。研究建议,在将LLM标注作为文化分析中的可扩展测量手段之前,应报告重复测量稳定性和跨模型收敛性指标。
| Large Language Models (LLMs) | 大型语言模型,如GPT系列,能够处理和理解自然语言文本的深度学习模型。 |
| Zero-shot annotators | 零样本注释器,指模型在没有针对特定任务进行训练的情况下直接对文本进行标注。 |
| Social constructs | 社会构念,指如自尊、自我控制等由社会和文化定义的心理或行为概念。 |
| Repeated-measurement reliability | 重复测量可靠性,指同一测量工具在多次重复使用中产生一致结果的程度。 |
| Consensus labels | 共识标签,指多个模型或注释者对同一文本标注后,通过某种聚合方式(如多数投票)得到的最终标签。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅