🔥 今日值得一读 私有Best-of-N采样:加噪声同时防奖励黑客和隐私泄露,性能还不掉队!
Privacy Without Regret: Differentially Private Inference-Time Alignment
arXiv LG (cs.LG) 🔥 重点 #差分隐私#推理优化#安全对齐 🕐 08-28 12:00
👨‍💼 主理人解读 · 为什么值得关注
开发者可用PrivBoN在推理时添加校准噪声,既保护偏好数据隐私又减少奖励黑客,提升对齐鲁棒性。

📖 AI 总结

本文提出了一种在推理阶段实现隐私保护与对齐目标兼顾的方法。针对广泛使用的Best-of-N采样在推理时对齐中存在的奖励黑客和隐私泄露两大问题,作者证明仅需在奖励评分中加入校准噪声即可同时解决。其核心成果PrivBoN表明,适当尺度的Gumbel噪声能同时实现ε-差分隐私和KL正则化对齐,且在隐私预算超过临界阈值时,隐私所需的噪声恰好是最优正则化项,不产生额外对齐成本。为解决该阈值依赖未知覆盖系数的问题,作者进一步提出PrivITP方法,结合χ²正则化拒绝采样与两阶段高斯机制,实现隐私成本与响应数量无关,并达到理论最优性能。实验验证了两种方法在多个模型和数据集上的有效性,均优于传统BoN,尤其在强隐私保护场景下优势明显。

🔑 关键词速览

Best-of-N (BoN) sampling一种推理时对齐策略,从N个生成样本中选择奖励分数最高的响应。
Differential privacy (DP)一种隐私保护框架,通过添加噪声确保单个数据点对输出影响有限。
Reward hacking模型利用奖励模型缺陷获得高分但实际质量不佳的现象。
KL-regularized alignment在优化奖励时加入KL散度正则化,防止响应偏离参考模型过远。
Gumbel noise服从Gumbel分布的随机噪声,用于实现差分隐私和正则化。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅