该研究提出了SinoGlyphBench,一个专门用于评估中文内容审核系统在字形级混淆攻击下表现的诊断基准。研究通过识别标签关键语义锚点,构建了文本和图像两种模态下配对的原版与混淆版输入,并区分了锚点扰动、背景扰动及全范围扰动三种情形。基于176,916次对12个大语言模型和多模态模型的配对评估,研究发现字形混淆使有害内容的假阴性和假阳性率分别上升6.1和4.7个百分点,四分类准确率下降5.0个百分点。模型仅保留了75.7%在原版输入上判断正确的决策。全范围扰动影响最大,锚点扰动比背景扰动更具破坏性,跨文字替换在文本模态中尤为困难。分析表明,模型在字形识别、意图恢复和最终安全判断环节均存在明显失误,对非规范汉字书写的恶意内容仍缺乏鲁棒性。
| SinoGlyphBench | 一个用于评估中文字形级混淆对语言模型审核性能影响的诊断基准。 |
| glyph-level obfuscation | 通过改变字形(如使用异体字、同音字替换)使文本对人类可读但难以被机器识别。 |
| label-critical semantic anchors | 在文本中决定内容有害性标签的关键语义片段,扰动它们会影响模型的判断。 |
| LLM | 大型语言模型,如GPT系列,用于处理文本任务。 |
| MLLM | 多模态大型语言模型,能够处理文本和图像等多种输入模态。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅