仅用9B模型,UO-FIE拿下事实性推理评测第一,宏观效用0.8316!
UO-FIE: Combining Exact-Label Supervision with Graded Utility for Factivity Inference
arXiv LG (cs.LG) 重要 #事实性推断#类别不平衡#NLP评测 🕐 今天 12:00

📖 AI 总结

本文提出UO-FIE系统,用于FIE2026中文事实性推理任务,该任务要求将中文上下文-假设对分类到九个有序事实性区间,评测指标同时奖励精确预测与接近正确区间的预测。由于566条训练样本中64.1%属于同一类别,初步实验中mDeBERTa分类模型大多只预测主导类别,而Huber回归基线虽能给出更接近正确区间的预测,但精确匹配较少。UO-FIE通过预测九类分布,融合硬标签监督、基于效用的软目标、调度类别权重和序数损失,并采用期望效用解码与基于折外预测的序数校准。基于Qwen3.5-9B结合LoRA,该系统在微调赛道以0.8316的宏效用排名第一;另有一个基于提示的集成方法在非微调赛道以0.8450的宏效用排名第三。

🔑 关键词速览

Factivity Inference事实性推理,指判断给定上下文是否蕴含或预设某个命题为事实的任务。
UO-FIE面向效用的事实性推理系统,结合精确标签监督和分级效用进行事实性区间分类。
mDeBERTa多语言DeBERTa模型,一种基于Transformer的预训练语言模型,常用于多语言自然语言理解任务。
LoRA低秩适应,一种参数高效微调方法,通过低秩矩阵注入减少可训练参数。
Ordinal Loss序数损失,用于处理有序分类问题的损失函数,考虑类别之间的顺序关系。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅