本文提出"策略即技能"(Policy-as-Skill,PaS)框架,旨在解决组织在政策、合规、风险及运营决策中应用大语言模型时面临的证据验证、审核路由、版本控制与可审计性等治理需求。PaS将上述功能封装为可执行、可版本化的模块化运行时策略能力。研究基于固定的Gemma4后端,在600项开发任务上评估了13种方法。结果显示,PaS+Audit取得53.8%的精确准确率、0.346的宏F1、0.854的审核F1、1.000的引用精确率、0.984的策略引用召回率以及1.000的审计完整度,在多数治理与审核指标上优于LLM+RAG方案。引入确定性控制后,总体准确率提升至61.2%,但效果高度依赖具体任务,表明基于规则干预应选择性而非普遍性地应用。该工作为受治理的LLM决策支持提供了兼顾证据、可控性与可审计性的可行路径。
| Policy-as-Skill (PaS) | 一种模块化运行时框架,将政策、合规等治理功能封装为可执行、带版本的能力单元。 |
| LLM+RAG | 结合大语言模型与检索增强生成的方法,通过检索外部知识来辅助模型生成回答。 |
| Deterministic Control | 确定性控制,指在决策流程中引入基于规则的确定性干预机制,以提升结果的可预测性和一致性。 |
| Audit Completeness | 审计完整性,衡量系统记录和追踪决策过程及依据的完备程度。 |
| Macro-F1 | 宏平均F1值,对每个类别分别计算F1值后取平均,用于评估多分类任务的综合性能。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅