开放权重模型谁先谁后?新方法用第三检查点当见证,176个LLM上95.3%定向成功!
Witeness Overlap: Directional Provenance Inside Open-Weight Model Families
arXiv AI (cs.AI) 重要 开源论文方法安全对齐 🕐 今天 12:00

📖 AI 总结

本文提出了一种面向开放权重模型家族的"方向性溯源"方法,旨在解决现有模型溯源技术只能判断两个检查点是否相关、却无法确定谁先谁后的局限。作者指出,传统方法多依赖表示相似度、权重相似度或行为指纹等对称性证据,本质上无法为关系定向。为此,论文引入"见证重叠"(Witness Overlap)机制:不再直接比较两个检查点,而是引入同家族的第三个检查点作为"见证",通过比较两端点周围的局部几何结构,判断哪一个更像分支父节点。该方法无需提示词、无需训练,属于白盒测试。在来自16个家族的176个LLM检查点上,单见证测试使用Frobenius余弦相似度成功定向了95.3%的父子判定。研究还评估了根节点识别、同级区分、向视觉语言模型与扩散模型家族的泛化能力以及链式排序,并发现该信号对权重噪声和稀疏剪枝具有鲁棒性,其中基于SVD的权重降维变体比Frobenius余弦更为稳健。该工作为开放权重生态中的模型谱系审计提供了可行的方向性判定工具。

🔑 关键词速览

Witness Overlap一种通过引入第三个同族检查点作为见证,比较局部几何结构来推断模型检查点之间方向性溯源关系的方法。
Directional Provenance确定模型检查点之间谁先谁后(即父子关系方向)的溯源分析。
Open-Weight Model权重公开可获取的模型,允许他人下载、修改和重新发布。
Frobenius Cosine基于Frobenius内积的余弦相似度,用于比较权重矩阵或向量的相似性。
SVD Weight Reduction利用奇异值分解对权重进行降维或压缩的变体方法,用于提高方向性溯源信号的鲁棒性。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅