这篇论文提出并验证了一种新型的AI文本检测规避方法:配备基础语言模型的编码智能体可以通过直接编排写作过程、拼接基础模型的文本样本来生成连贯且高质量的输出,从而绕过AI检测。研究显示,Claude Opus 5在Claude Code框架下调度本地320亿参数的OLMo-2基础模型时,在创意写作、事实性、健康问答和指令遵循等基准测试中任务准确率损失很小,同时基础模型token使用率最高可达90%。这种方式使事后检测器Pangram v4的检测率从77%降至24%,并可将预先施加的软水印检测率在低误报率下压低至约10%。不过,该规避策略需要消耗大量输入输出token,API定价下每次查询成本最高增加30倍。该工作揭示了一类针对AI文本检测的新型对抗攻击,并建议检测服务商将基础模型输出纳入训练数据。
| 基础语言模型 | 未经指令微调或对齐的大规模预训练语言模型,通常生成多样但可能不连贯的文本。 |
| 编码智能体 | 能够编写和执行代码、调用工具以完成复杂任务的AI智能体。 |
| 语义漂移 | 在多次改写或生成过程中,文本的原始含义逐渐发生偏离或丢失的现象。 |
| 软水印 | 在AI生成文本中嵌入的不可见统计模式,用于事后检测AI生成内容。 |
| 事后检测器 | 在文本生成后进行分析以判断其是否由AI生成的工具或模型。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅