这篇论文对广泛使用的ISOT/Kaggle假新闻语料库进行了可复现的审计,指出在该数据集上报告的0.98以上准确率和F1分数存在严重的捷径学习问题。作者通过透明的TF-IDF与线性分类器流程,从三个泄漏渠道和两种分布偏移协议展开检验。关键发现包括:仅凭主题元数据字段即可达到F1=1.000,因为两类样本的主题完全不相交;即使移除元数据、新闻源标签和重复文档等全部泄漏渠道,F1仅下降1.21个点,剩余信号来自弥散的编辑风格而非个别特征词;在主题不相交协议下,平均精度从0.9995降至0.9475,部署F1从0.9905降至0.8067,而微调后的DistilBERT在分布内更强但主题偏移下退化更严重。迁移至独立LIAR基准时,所有模型均接近随机水平。研究结论是,此类语料库上的高分反映的是来源与主题的可分性,而非真实性判断能力,并建议采用仅元数据、小样本和主题不相交基线作为低成本诊断工具。
| ISOT/Kaggle Fake and Real News Corpus | 一个广泛使用的假新闻检测数据集,包含真假新闻文章,但存在来源和主题偏差。 |
| TF-IDF | 词频-逆文档频率,一种常用的文本特征提取方法,用于衡量词语在文档中的重要性。 |
| Leakage Channels | 数据泄漏通道,指训练数据中与标签相关但不应被模型利用的虚假特征,如元数据、来源标签和重复文档。 |
| Distribution Shift | 分布偏移,指训练数据和测试数据分布不一致的情况,如主题或时间上的变化。 |
| DistilBERT | 一种轻量级的预训练语言模型,基于BERT蒸馏而来,用于文本分类等任务。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅