该论文提出了一种名为“潜在诊断分类法”的框架,用于构建分类器并诊断其决策的可信度,特别应用于提示注入检测任务。框架包含三个核心步骤:通过交叉验证优化嵌入维度以构建分类器;识别约占总训练样本29%的潜在支持向量,用于定位能改变预测标签的关键令牌;基于这些令牌及其攻击强度构建诊断分类法。该分类法将提示分为四类:可安全依赖分类器决策、需标记启发式偏差与覆盖、以及需人工复核的上下文不足案例。实验发现,分类器约77%的自信决策在移除单个令牌后不再稳健,且这种脆弱性可分为置信度校准失败和可利用捷径两种模式。论文为每个诊断区域提供了修复策略,为提升分类器鲁棒性和可解释性提供了系统性指导。
| Latent Diagnostic Taxonomy | 一种框架,通过潜在支持向量和攻击标记构建诊断分类法,用于评估分类器决策的可信度。 |
| Prompt Injection Detection | 检测针对大语言模型的提示注入攻击的任务,即识别恶意构造的输入以操纵模型行为。 |
| Support Vectors | 训练样本中影响分类器决策边界的关键数据点,此处指对预测标签有显著影响的提示。 |
| Heuristic Bias | 分类器依赖表面特征而非真正语义的决策模式,导致对特定扰动敏感。 |
| Confidence Calibration | 分类器预测概率与实际正确率的一致性,校准失败意味着高置信度但低准确性。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅