该论文提出了一种名为Diff Mining的框架,用于识别微调语言模型所学到的行为。其核心方法是通过比较微调模型与基础模型在参考语料上的输出logits差异,提取被放大的显著token,以此作为微调目标的“指纹”。该框架包含两个模块化阶段:提取逐上下文的logit差异,以及通过Top-K频率或非负矩阵分解(NMF)方法聚合信号,形成可解释的token集合。实验表明,Diff Mining在微调领域检测任务上显著优于现有模型差异方法,能有效识别相关token并提升下游性能;在注入偏见的模型中,无需定向探测即可识别出超过三分之一的偏见。该框架仅需访问输出logits,无需模型内部信息,可扩展至大型模型,为开发微调目标审计工具提供了有前景的路径。
| Diff Mining | 一种通过比较微调模型与基础模型的 logits 差异来识别微调目标的方法。 |
| logits | 模型输出的未归一化分数,表示每个 token 或类别的相对可能性。 |
| Non-negative Matrix Factorization (NMF) | 一种矩阵分解技术,用于将数据分解为非负成分,此处用于将多个微调目标分离为不同的 token 簇。 |
| model diffing | 比较不同模型(如微调前后)以识别其行为差异的技术。 |
| finetuning objectives | 微调过程中模型被训练去实现的具体目标或行为。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅