少样本提示碾压微调编码器!宏F1飙至0.642,推理延迟降三个数量级
Fine-Grained Emotion Classification from Mobile App Reviews: An Empirical Study with Large Language Models
arXiv CL (cs.CL) #情感分类#LLM应用#需求工程 🕐 今天 12:00

📖 AI 总结

本研究探讨如何利用大语言模型从移动应用评论中自动提取细粒度情感,以支持超越简单极性判断的需求工程任务,如基于情感的问题优先级排序和面向功能的反馈分析。研究基于Plutchik情感分类体系的人工标注数据,在严重类别不平衡条件下比较了编码器微调(多标签与二元集成)、解码器零样本与少样本提示,以及多种不平衡缓解策略。结果显示,少样本提示的宏F1达0.642,明显优于基线微调编码器(多标签0.387、二元集成0.450);但将最佳多标签编码器与生成式数据增强和正例加权损失结合后,性能提升0.204,接近提示方法水平,且推理延迟低至前者的千分之一,稀有情感类别提升尤为显著。研究表明,大语言模型使细粒度多标签情感分类在需求工程流程中具备可行性,但最佳方案依赖模型骨干与具体任务形式。

🔑 关键词速览

细粒度情感分类将文本情感划分为比正面/负面更细致的多种具体情绪类别(如喜悦、愤怒、悲伤等)的任务。
多标签分类允许一个样本同时属于多个类别标签的分类任务,此处指一条评论可包含多种情绪。
类别不平衡数据集中不同类别的样本数量差异悬殊,导致模型偏向多数类而忽略少数类的问题。
生成式数据增强利用生成模型(如大语言模型)合成新的训练样本,以扩充数据并缓解类别不平衡的技术。
宏F1一种评估指标,先计算每个类别的F1分数再取平均,对少数类别的性能给予同等权重。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅