这篇论文系统探讨了深度学习中后门攻击对自然语言处理(NLP)和视觉-语言模型(VLM)构成的安全威胁,并提出了相应的防御与效率优化方案。研究聚焦两大方向:一是安全性,通过分析、检测和设计后门攻击机制,揭示模型在训练数据被污染时的脆弱性;二是效率,针对临床和医学影像应用,开发先进的多模态表示学习方法。论文强调了可信AI的重要性,指出后门攻击可在模型推理阶段被恶意触发,导致错误输出,尤其在医疗等高风险场景中后果严重。通过结合攻击检测与高效表示学习,研究旨在提升模型鲁棒性,同时保持多模态任务的处理性能。该工作为构建更安全、可靠的AI系统提供了理论依据和实践路径,对推动可信AI在关键领域的落地具有参考价值。
| Backdoor Attack | 一种恶意攻击方式,通过在模型中植入隐藏的触发器,使模型在正常输入时表现正常,但在特定触发条件下产生错误输出。 |
| Natural Language Processing (NLP) | 自然语言处理,是人工智能的一个分支,专注于使计算机能够理解、解释和生成人类语言。 |
| Vision-Language Models (VLMs) | 视觉-语言模型,能够同时处理图像和文本信息,实现跨模态的理解和生成任务。 |
| Trustworthy AI | 可信人工智能,强调AI系统的安全性、可靠性、公平性和透明度,确保其在实际应用中值得信赖。 |
| Multimodal Representation Learning | 多模态表示学习,旨在从多种数据类型(如图像、文本、音频)中学习统一的特征表示,以提升模型在跨模态任务中的性能。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅