本文研究联邦检索增强生成(RAG)场景下的拜占庭鲁棒性问题。在联邦RAG中,各节点基于本地私有文档为候选答案打分,由中心节点汇总,但部分节点可能被攻陷或受文档中隐藏指令误导而报告任意分数。现有方法或假设所有节点诚实,或仅保护校准阶段。作者发现诚实节点在校准与查询两个阶段是同一批,据此提出对齐校准与固定成员共形预测方法:中心让所有节点对同一组校准问题打分,仅当存在某个规模不超过声明上限的合理诚实节点组在两步中均支持某候选答案时才保留它。理论证明该方法在有限样本下能以指定概率包含正确答案,且在同信息条件下集合最小。模拟实验涵盖医学考试等真实问答任务,结果显示在拜占庭节点不超声明上限时,该方法始终达到目标覆盖率,而简单平均法可能失效,且其预测集明显小于同等保护下的简化方法,表明采用保守的节点上限代价很小。
| 联邦RAG (Federated RAG) | 一种分布式检索增强生成框架,各节点保留自己的文档集合并独立评分,中央枢纽汇总评分以生成答案。 |
| 拜占庭节点 (Byzantine nodes) | 在分布式系统中可能被攻陷、故障或恶意误导,从而报告任意错误信息的节点。 |
| 保形预测 (Conformal prediction) | 一种统计框架,通过校准步骤设定截断值,返回以指定概率包含正确答案的预测集合。 |
| 校准步骤 (Calibration step) | 使用已知答案的问题来调整预测阈值的过程,以确保预测集合的覆盖概率。 |
| 固定成员保形预测 (Fixed-Membership Conformal Prediction) | 本文提出的方法,假设诚实节点集合在校准和查询阶段保持不变,从而提供拜占庭鲁棒性保证。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅