🔥 今日值得一读 让多模态大模型秒变鉴伪专家!新方法性能碾压现有模型
From Sharp Eyes to Expert Mind: Internalizing Expert Knowledge in MLLMs for Tampered Text Detection
arXiv CV (cs.CV) 🔥 重点 #多模态#篡改检测#文档安全 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
可用于文档真伪鉴别,把专家取证能力注入MLLM,开发者能构建更鲁棒的防篡改检测系统。

📖 AI 总结

本文针对篡改文本检测(TTD)任务,探讨如何将专家取证能力内化到多模态大语言模型(MLLM)中。作者指出,现有专家模型虽能捕捉细微篡改痕迹,但跨领域泛化能力差;MLLM语义理解与迁移能力强,却对细粒度取证伪影不敏感。研究识别出阻碍二者结合的双重错配:粗粒度视觉标记与微小篡改区域间的空间精度错配,以及语义导向预训练与低层取证感知间的感知粒度错配。为此提出专家知识内化框架EKI,分两阶段渐进式转移取证专长:第一阶段通过文本聚焦与图像聚焦策略建立对小型文本区域的精确空间关注;第二阶段提出取证—通用表示对齐损失,将LLM浅层表示与预训练取证专家对齐,使模型在细粒度线索被深层语义抽象稀释前获得伪影感知能力。在多个域内与跨域基准上,EKI均取得最优性能与更强泛化性,且专家仅在训练阶段需要,推理时无需外部专家,效率与原始模型几乎一致。

🔑 关键词速览

Tampered Text Detection (TTD)篡改文本检测,旨在识别文档图像中被恶意修改的文字区域,用于保障文档真实性。
Multimodal Large Language Model (MLLM)多模态大语言模型,能够同时处理文本和图像等多种模态信息的大规模预训练模型。
Double Mismatch双重错配,指空间精度错配和感知粒度错配,是阻碍专家取证感知内化到 MLLM 的两个根本问题。
Expert Knowledge Internalization (EKI)专家知识内化,本文提出的两阶段框架,将取证专家的知识逐步迁移到 MLLM 内部。
Forensic-General Representation Alignment (FGRA)取证-通用表示对齐损失,用于对齐浅层 LLM 表示与预训练取证专家的表示,使模型获得细粒度伪影感知。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅