制药出海必看!AI评测FDA和EMA法规冲突,101对数据F1最高0.511
RegDivergence-101: An LLM Benchmark for Cross-Jurisdiction Regulatory Contradiction Detection in Life Sciences
arXiv AI (cs.AI) 重要 大模型医疗数据集 🕐 09-01 12:00

📖 AI 总结

该论文提出了跨司法辖区监管分歧检测任务,旨在自动识别美国FDA与欧盟EMA对同一药物研发主题要求的异同,将其分类为一致、分歧或沉默三种关系。作者发布了RegDivergence-101基准,包含101对专家标注的监管要求样本,标注一致性达0.85。研究系统比较了四类基线方法:词法启发式(宏F1为0.511)、NLI交叉编码器(0.233)、义务级图检索(0.663)以及扁平LLM判断器(0.830),显示大语言模型在该任务上表现最优。关键发现包括:沉默关系难以被蕴含式方法捕捉,而图结构方法虽优于词法但不及扁平LLM上下文。该基准为制药行业跨区域监管合规的自动化奠定了基础,并规划了扩展至更多监管领域的路线图。

🔑 关键词速览

RegDivergence-101一个包含101对FDA和EMA监管要求对的试点基准数据集,用于评估跨司法辖区监管分歧检测任务。
cross-jurisdiction regulatory divergence detection跨司法辖区监管分歧检测,即自动分类FDA和EMA对同一主题要求之间的关系(一致、分歧或沉默)。
SILENT指一个监管机构对另一机构监管的要点未作规定的情况,具有方向性(SILENT_FDA或SILENT_EMA)。
Graph-RAG基于图的检索增强生成方法,此处用于义务级图构建以改进监管文本的推理。
NLI cross-encoder自然语言推理交叉编码器,一种用于判断文本间蕴含关系的模型,但在此任务中表现不佳。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅