本研究系统考察了大语言模型条件控制中的有效性与流畅性权衡问题。研究覆盖概念注入与概念移除两类场景,对多种条件控制方法进行了对比评估。核心发现是:高效的激活引导方法虽能实现条件控制,却往往以显著牺牲生成流畅性为代价;同时,激活引导方法在指令微调模型上的效果远逊于基座模型,这一与训练范式的交互作用此前被普遍忽视。简单提示与完整的监督微调适合概念注入,但在概念移除上表现欠佳。研究还发现,低成本文本指标与高成本的LLM评判分数高度相关,可为理解条件控制方法的行为提供有效洞察。该工作提示,现有评估若仅关注概念注入或移除的有效性而忽略生成质量,将难以全面反映方法的真实取舍,对LLM的可靠部署具有重要参考意义。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅