法国新闻分类新基准:CamemBERT全文模型召回率0.799,碾压三大零样本LLM!
FrenchNews-7: Benchmarking Cross-Publisher French News Editorial Desk Classification
arXiv CL (cs.CL) #评测基准#新闻分类#多语言 🕐 08-20 12:00
👨‍💼 主理人解读 · 为什么值得关注
构建跨出版商法语新闻编辑部分类基准,结合URL与LLM标注实现高精度分类。

📖 AI 总结

该研究提出了FrenchNews-7,一个跨出版商的法语新闻编辑部分类基准,涵盖多来源语料库、七类URL衍生分类体系及微调的CamemBERT分类器。标签通过混合管道生成,结合URL路径与LLM标注处理结构模糊案例,并经人工与LLM的评分者间研究验证(成对κ≥0.766,人工间κ=0.806)。实验评估了词汇、多语言及法语专用分类器在分布内和留出出版商设置下的表现,并与三种零样本LLM基线对比。最强模型为基于全文的CamemBERT-base,其总体召回率达0.799,优于标题输入、泛化至未见来源,且超越所有LLM基线,差距集中在经济和社会等边界模糊类别。跨出版商评估显示边界稳定性不均:体育、文化娱乐和国际类别迁移良好,而经济(召回率0.517)接近盲评人工一致性(0.55),社会(精确率0.577)吸收边界歧义,表明差异源于编辑惯例而非分类器可提升空间。模型、数据集及可靠性分级指南已公开。

🔑 关键词速览

FrenchNews-7一个跨出版商的法语新闻编辑部栏目分类基准,包含语料库、分类体系和分类器。
CamemBERT一个针对法语优化的预训练语言模型,基于BERT架构。
LLM大型语言模型,如GPT、Mistral和Llama,用于零样本分类和标注。
kappa (κ)衡量标注者之间一致性的统计指标,值越高表示一致性越好。
zero-shot模型在未见过特定任务训练数据的情况下进行预测的能力。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅