该研究提出了一种基于动态模态分解(DMD)的黑盒方法,用于检测大语言模型(LLM)的不安全输出。研究者将提示词和响应映射至高维嵌入空间,分别为安全与不安全场景拟合Koopman预测模型,并通过比较两类模型预测误差的差分残差分数来分类新输出。其关键创新在于同时纳入提示词与响应的嵌入动态,使Koopman算子能够捕捉二者间的交互模式。在三个安全基准上结合三种嵌入模型的评估显示,引入提示词嵌入可带来一致性的性能提升,尤其对依赖交互的违规检测效果显著(如搭配Llama-3等因果解码器时);而仅依赖响应的违规则更受益于稠密语义嵌入表示。该工作开辟了以动力系统分析AI系统的新方向,而非沿用AI建模动力系统的传统范式。
| Koopman算子 | 一种线性算子,用于将非线性动态系统转化为高维空间中的线性表示,便于预测和分析。 |
| 黑盒方法 | 一种无需访问模型内部参数或结构,仅通过输入输出进行检测或分类的方法。 |
| 嵌入动态 | 将文本映射到向量空间后,这些向量随时间或序列变化的模式,用于捕捉语义交互。 |
| 差分残差分数 | 一种度量,通过比较安全与不安全模型预测误差的差异来分类新样本。 |
| 因果解码器 | 一种自回归语言模型架构,如Llama-3,生成时仅依赖前文信息。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅