本文研究部署带弃权选项的二元分类器时,主体应如何选择弃权查询,并揭示了一个核心矛盾:面对已知分类器、试图跨越决策边界操纵特征的博弈型对手,在边界附近弃权是最优策略;但面对不了解分类器的学习型对手,同样的规则却最危险,因为每次弃权都暗示边界就在附近,足以支撑二分搜索来重建边界。作者证明,固定比例弃权与边界附近弃权这两种防御在Blackwell意义下不可比较,且重建边界至误差ε所需查询数分别为d/ε量级与d log(1/ε)量级(d为分类器族的VC维),前者是查询分布上的最坏情形且无法在该分布上缩小差距。研究刻画了两类防御目标间的帕累托前沿,并在表格、图像和语言模型特征等七项二元分类任务上验证了两种速率,显示标签加反事实访问相比已发表的仅标签基线可将边界提取查询数减少最多200倍。
| 弃权选项 (Abstention Option) | 分类器在不确定时选择不给出预测的机制,常用于避免高风险错误。 |
| 博弈型对手 (Gaming Adversary) | 已知分类器内部信息并主动操纵特征以欺骗分类器的攻击者。 |
| 学习型对手 (Learning Adversary) | 不知道分类器但通过查询响应逐步学习其决策边界的攻击者。 |
| Blackwell不可比较 (Blackwell-Incomparable) | 指两种信息结构之间不存在一方优于另一方的关系,无法通过后处理相互模拟。 |
| VC维 (VC Dimension) | 衡量分类器族复杂度的指标,表示能被该族打散的最大点集大小。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅