本文介绍了莫斯科国立大学团队在ACM MM 2026 GenText-Forensics挑战赛中的技术方案。该挑战赛针对文档文本伪造已从像素级篡改演变为同时改变外观与语义、并攻击OCR与LLM处理管线的趋势,要求系统不仅判断多语言文本图像是否被伪造,还需定位篡改位置、识别攻击类型并生成可读的取证报告。团队提出一种分解式思维链流水线,将文档篡改检测器与两个经LoRA适配的Qwen3-VL-32B视觉语言模型相结合:检测器生成篡改概率图并转化为候选区域,第一个模型负责验证区域并给出初步伪造类型,第二个模型合并并重新定位有效区域,捕捉像素级检测器无法发现的纯语义异常,最终撰写报告。两个模型均通过从可访问真实掩码和报告的Qwen3-VL-235B教师模型蒸馏思维链轨迹进行训练。该方案在挑战赛中获得第三名,报告还详述了数据准备、测试时增强、区域渲染、蒸馏协议与训练配置,并给出检测器阈值、提示设计和流水线分解的消融实验。
| GenText-Forensics | ACM MM 2026 挑战赛,专注于检测和定位多语言文本图像中的伪造,并生成取证报告。 |
| Chain-of-Thought (CoT) | 思维链,一种通过逐步推理中间步骤来提升复杂任务性能的提示或训练方法。 |
| Document Tampering Detector (DTD) | 文档篡改检测器,用于生成像素级篡改概率图以定位可疑区域。 |
| Qwen3-VL-32B | 通义千问系列的大型视觉语言模型,参数量为320亿,用于多模态理解与生成。 |
| LoRA | 低秩适应,一种参数高效微调技术,通过注入低秩矩阵来适配大模型到特定任务。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅