该论文介绍了BharatGather数据集,专门用于检测印度大型公共活动(如宗教节日、政治集会和文娱聚会)中的虚假信息。研究指出,现有自动假新闻检测基准未能充分捕捉印度语境中的社会文化细微差别和事件特定动态。该数据集包含14,646条记录,通过系统性抓取事实核查平台、提取多媒体转录文本,并利用大语言模型进行合成增强来构建,以确保叙事多样性。这项工作为开发具有文化感知力的虚假信息检测系统提供了定制化资源,也为评估这些系统在高风险公共环境中的表现建立了严格基准,对维护公共安全和社会凝聚力具有重要意义。
| BharatGather | 本文提出的一个专门针对印度公共事件错误信息检测的基准数据集。 |
| Misinformation | 错误信息,指不实或误导性的信息,可能无意或有意传播。 |
| Fake News Detection | 虚假新闻检测,利用自动化方法识别和分类虚假新闻内容。 |
| Large Language Model (LLM) | 大型语言模型,如GPT等,用于生成或增强文本数据。 |
| Synthetic Augmentation | 合成增强,通过生成新数据来扩充数据集,以提高多样性和鲁棒性。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅