文章指出,尽管大语言模型在理论上能够像人类一样多样化地写作,但经过后训练和安全对齐后,其文本仍可被检测出来。Pangram公司的CTO Bradley Emi解释,ChatGPT、Claude等系统在训练中习得了避免危险输出或审查政治言论的行为规则,这大幅压缩了模型的表达范围,导致“模式坍缩”现象——模型倾向于固定使用某种偏好措辞,而非覆盖人类语言的多样性。相比之下,未经后训练的基座模型或针对特定风格微调的模型,其输出更具变化性,因此不易被检测器识别。但该结论仅适用于无水印的AI文本,水印技术仍能有效标记AI生成内容。这一发现揭示了安全对齐与文本自然度之间的权衡,对AI内容检测和生成技术均有启示意义。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅