本文提出 AdaGuard,一个面向企业生成式 AI 应用的自适应 LLM-as-a-Judge 安全护栏框架,旨在解决现有方案策略固定、透明度不足、推理灵活性有限等问题。其核心创新在于动态策略执行与自适应推理预算分配:模型能够推断输入与策略组合的复杂度,从而在高速度的黑盒推理与可解释的推理式审核之间自动切换。AdaGuard 通过监督微调与强化学习(GRPO)构建,可在运行时泛化至用户自定义的安全与合规策略,无需频繁更新模型。实验表明,该框架的性能可与体量数倍于自身的护栏模型及前沿模型相媲美,其自动推理模式以远低于始终开启推理的延迟恢复了同等准确率,为开发者在严格延迟约束与可操作透明度之间提供了平衡手段。
| LLM-as-A-Judge | 一种使用大语言模型作为评判者来评估内容安全性或合规性的范式。 |
| Guardrails | 在生成式AI系统中用于约束模型输出、确保安全与合规的防护机制。 |
| GRPO | 一种强化学习算法,通过组相对策略优化来训练模型,常用于提升推理能力。 |
| SFT | 监督微调,使用标注数据对预训练模型进行有监督训练以适配特定任务。 |
| Adaptive Reasoning-Budget Allocation | 根据输入复杂度动态分配推理计算资源,以平衡准确性与延迟。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅