LLM测长文本价值观新突破:TEF方法准确率提升4.5个点
Count Evidence, Not Sentences: Tempered Evidence Fusion of LLM Judgments for Long-Text Value Measurement
arXiv CL (cs.CL) 重要 #价值测量#决策融合#长文本 🕐 今天 12:00

📖 AI 总结

该研究针对大语言模型从长篇社交媒体文本中测量公共价值取向的任务,指出此类文本常混杂背景、引用与让步性表述,真正承载立场的句子很少。现有方法要么直接预测文档级标签而过度自信,要么对句子级预测做多数投票或软投票,将不确定句与决定性句等同对待。为此,作者将长文本价值测量建模为决策融合问题,提出免训练的“缓和证据融合”(TEF)规则,依据广义贝叶斯后验,以归一化信息增益对每个句子的对数几率加权,使不确定句的融合贡献趋近于零,同时保留决定性证据的贝叶斯最优权重。作者还构建了MIND基准,包含8358条中英文帖子,覆盖五年公共事件与六个价值维度。实验显示,在五种LLM和两种语言上,TEF相较直接预测、多数投票和软投票中的最强基线,平均提升4.5个准确率点和4.6个宏F1点。

🔑 关键词速览

Tempered Evidence Fusion (TEF)一种无需训练的决策融合规则,通过归一化信息增益加权句子对数几率,以抑制不确定句子的影响。
Multi-event Insight Network Dimensions (MIND)一个用于长文本价值测量的基准数据集,包含8,358条中英文帖子,覆盖五年公共事件和六个价值维度。
log-odds对数几率,即事件发生概率与不发生概率之比的自然对数,常用于表示证据强度。
normalized information gain归一化信息增益,衡量一个句子对减少预测不确定性的相对贡献,用于加权证据。
macro-F1宏平均F1分数,对每个类别分别计算F1后取平均,适用于类别不平衡的多分类评估。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅