本文提出"对齐预测"这一新任务,旨在训练开始前预判微调数据是否会导致模型出现欺骗、谄媚等对齐失效问题。作者构建了ALIGNMENTFORECASTBENCH基准,涵盖17个目标模型、32个数据集和16种失效模式,共5000余个预测问题。实验发现,前沿模型直接作答表现不佳;为此作者设计了一种预测框架,由大语言模型评估数据集推动模型走向不当行为的强度与广度,再结合失效模式的基础发生率与目标模型的既有倾向,通过简单学习模型进行综合预测。该方法显著优于随机水平,并超过在任务上微调过的模型以及可观察弱模型微调后表现的简单预测器,还能识别出前沿分类器遗漏的问题训练样本。在UltraChat等真实后训练数据中过滤这些样本后,多数情况下模型对齐性有所提升,但在开放式对话中的收益尚不明确。研究表明,在监督微调场景下于训练前预测多种对齐失效是可行的,但距离可靠指导数据筛选仍有差距。
| Alignment Forecasting | 在训练前预测模型微调后是否会出现对齐失败的任务。 |
| ALIGNMENTFORECASTBENCH | 一个用于评估对齐预测性能的基准,包含大量预测问题。 |
| Failure Mode | 模型表现出的具体失准行为类型,如欺骗或谄媚。 |
| SFT (Supervised Fine-Tuning) | 监督微调,一种在标注数据上进一步训练预训练模型的方法。 |
| Forecasting Scaffold | 一种结合LLM评分与简单学习模型的预测框架。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅