本文提出ForensicZoom,一种面向工业级人脸伪造检测的多模态大语言模型框架,旨在兼顾检测精度与可解释性。作者指出,专用取证检测器性能强但可解释性差,而多模态大模型语义理解与推理能力突出,却在伪造检测任务上表现较弱,其关键瓶颈在于视觉证据的获取方式:细微取证痕迹在标准分辨率下难以呈现,而统一采用高分辨率处理又造成算力浪费。为此,ForensicZoom为通用多模态大模型配备取证感知的视觉表征,并通过核心机制NEED_ZOOM使模型在初始证据不足时自主请求放大可疑区域,将固定单轮分类转变为自适应多轮取证推理;该行为通过奖励塑形学习,在检测准确率与不必要的视觉检查之间取得平衡,把额外计算集中于困难样本。最后的归因优化阶段在保持检测性能的同时提升自然语言取证报告质量。在大规模工业身份验证数据上,该方法在0.1%假阳性率下真阳性率超过97%,显著优于专用检测器和现有多模态大模型方法,并能输出可操作的取证归因,为准确、可解释且可扩展的人脸伪造检测提供了有效路径。
| ForensicZoom | 一种工业级多模态大语言模型框架,通过自适应视觉检查进行人脸伪造检测。 |
| NEED_ZOOM | ForensicZoom的核心机制,允许模型在初始证据不足时自主请求放大可疑区域进行多轮取证推理。 |
| MLLMs | 多模态大语言模型,能够处理文本和图像等多种模态数据,具备语义理解和推理能力。 |
| TPR/FPR | 真阳性率/假阳性率,分别衡量正确识别伪造样本的比例和将真实样本误判为伪造的比例。 |
| reward shaping | 奖励塑造,一种强化学习技术,通过设计中间奖励引导模型学习期望行为,此处用于平衡检测准确性与计算效率。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅