该研究针对大语言模型生成文本的水印检测问题,提出了一种名为模式稳定性评分(PSS)的新型检测框架。现有水印检测器在多次改写和短文本场景下性能显著下降,PSS通过结合全局与局部z-score特征、游程模式的高阶统计量、自相关信号以及跨改写深度的稳定性评分,有效提升了检测鲁棒性。研究在PG-19、CNN/DailyMail和WikiText三个基准数据集上,使用Llama-3-8B、Qwen2-7B等模型进行最多八轮改写压力测试,结果显示该方法相比传统z-score阈值和部分深度学习方法,在不同文本长度下AUC提升超过10-15个百分点。此外,跨领域实验表明,单一通用分类器无需重新训练即可在不同LLM、改写器和文本域间泛化,即使所有组件与训练时不同,AUC仍保持在87.8%以上。该研究为机器生成文本检测提供了更稳健的解决方案。
| Pattern Stability Score (PSS) | 一种新颖的检测框架,利用局部统计特征和跨改写变体的稳定性动态来检测机器生成文本。 |
| z-score | 一种标准化统计量,用于衡量数据点相对于均值的偏离程度,在此用于文本特征分析。 |
| AUC (Area Under the Receiver Operating Characteristic Curve) | 接收者操作特征曲线下面积,用于评估分类器性能的指标,值越高表示检测能力越强。 |
| paraphrasers | 用于改写文本的模型或工具,在此用于测试水印检测的鲁棒性。 |
| run-length patterns | 游程模式,指文本中连续相同元素(如字符或词)的长度序列,用于提取高阶统计特征。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅