🔥 今日值得一读 只用输出logits就能挖出微调模型的隐藏训练目标!Diff Mining框架让模型行为指纹无所遁形
Diff Mining: Logit Differences Reveal Finetuning Objectives
arXiv LG (cs.LG) 🔥 重点 #微调#可解释性#安全对齐 🕐 08-28 12:00
👨‍💼 主理人解读 · 为什么值得关注
开发者可用此方法检测微调模型是否学到意外行为,提升模型安全审查效率。

📖 AI 总结

该论文提出了一种名为Diff Mining的框架,用于识别微调语言模型所学到的行为。其核心方法是通过比较微调模型与基础模型在参考语料上的输出logits差异,提取被放大的显著token,以此作为微调目标的“指纹”。该框架包含两个模块化阶段:提取逐上下文的logit差异,以及通过Top-K频率或非负矩阵分解(NMF)方法聚合信号,形成可解释的token集合。实验表明,Diff Mining在微调领域检测任务上显著优于现有模型差异方法,能有效识别相关token并提升下游性能;在注入偏见的模型中,无需定向探测即可识别出超过三分之一的偏见。该框架仅需访问输出logits,无需模型内部信息,可扩展至大型模型,为开发微调目标审计工具提供了有前景的路径。

🔑 关键词速览

Diff Mining一种通过比较微调模型与基础模型的 logits 差异来识别微调目标的方法。
logits模型输出的未归一化分数,表示每个 token 或类别的相对可能性。
Non-negative Matrix Factorization (NMF)一种矩阵分解技术,用于将数据分解为非负成分,此处用于将多个微调目标分离为不同的 token 簇。
model diffing比较不同模型(如微调前后)以识别其行为差异的技术。
finetuning objectives微调过程中模型被训练去实现的具体目标或行为。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅