黑盒检测LLM不安全输出新方法:Koopman动态系统+提示嵌入,检测违规提升显著!
Enforcing LLM Safety through DMD-based Classification of Prompt-Response Embedding Dynamics
arXiv AI (cs.AI) 重要 #安全对齐#动态系统#黑盒检测 🕐 08-21 12:00
👨‍💼 主理人解读 · 为什么值得关注
用DMD分析提示-响应嵌入动态,黑盒检测LLM不安全输出,高效识别有害内容。

📖 AI 总结

该研究提出了一种基于动态模态分解(DMD)的黑盒方法,用于检测大语言模型(LLM)的不安全输出。研究者将提示词和响应映射至高维嵌入空间,分别为安全与不安全场景拟合Koopman预测模型,并通过比较两类模型预测误差的差分残差分数来分类新输出。其关键创新在于同时纳入提示词与响应的嵌入动态,使Koopman算子能够捕捉二者间的交互模式。在三个安全基准上结合三种嵌入模型的评估显示,引入提示词嵌入可带来一致性的性能提升,尤其对依赖交互的违规检测效果显著(如搭配Llama-3等因果解码器时);而仅依赖响应的违规则更受益于稠密语义嵌入表示。该工作开辟了以动力系统分析AI系统的新方向,而非沿用AI建模动力系统的传统范式。

🔑 关键词速览

Koopman算子一种线性算子,用于将非线性动态系统转化为高维空间中的线性表示,便于预测和分析。
黑盒方法一种无需访问模型内部参数或结构,仅通过输入输出进行检测或分类的方法。
嵌入动态将文本映射到向量空间后,这些向量随时间或序列变化的模式,用于捕捉语义交互。
差分残差分数一种度量,通过比较安全与不安全模型预测误差的差异来分类新样本。
因果解码器一种自回归语言模型架构,如Llama-3,生成时仅依赖前文信息。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅