🔥 今日值得一读 小模型吊打大模型!AdaGuard动态推理让护栏性能媲美数倍规模模型
AdaGuard: Enhancing Safety and Policy Compliance with Reasoning-Enabled LLM-As-A-Judge Guardrails
arXiv AI (cs.AI) 🔥 重点 安全对齐Agent商业化 🕐 今天 12:00

📖 AI 总结

本文提出 AdaGuard,一个面向企业生成式 AI 应用的自适应 LLM-as-a-Judge 安全护栏框架,旨在解决现有方案策略固定、透明度不足、推理灵活性有限等问题。其核心创新在于动态策略执行与自适应推理预算分配:模型能够推断输入与策略组合的复杂度,从而在高速度的黑盒推理与可解释的推理式审核之间自动切换。AdaGuard 通过监督微调与强化学习(GRPO)构建,可在运行时泛化至用户自定义的安全与合规策略,无需频繁更新模型。实验表明,该框架的性能可与体量数倍于自身的护栏模型及前沿模型相媲美,其自动推理模式以远低于始终开启推理的延迟恢复了同等准确率,为开发者在严格延迟约束与可操作透明度之间提供了平衡手段。

🔑 关键词速览

LLM-as-A-Judge一种使用大语言模型作为评判者来评估内容安全性或合规性的范式。
Guardrails在生成式AI系统中用于约束模型输出、确保安全与合规的防护机制。
GRPO一种强化学习算法,通过组相对策略优化来训练模型,常用于提升推理能力。
SFT监督微调,使用标注数据对预训练模型进行有监督训练以适配特定任务。
Adaptive Reasoning-Budget Allocation根据输入复杂度动态分配推理计算资源,以平衡准确性与延迟。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅