该研究评估了大语言模型生成的网络欺凌对话在多大程度上忠实再现了真实互动的社会动态。作者构建了一个综合评估框架,从互动结构(轮流发言、权力动态、修复行为)、语言与风格真实性(代词使用、幽默)、情感与行为标记(欺凌类型、脏话、毒性)以及时间升级动态等维度,对比了真实对话与GPT、Grok和LLaMA生成的合成对话,并辅以人工评估。结果显示,LLM生成的数据能一致地保留高层互动结构,如角色参与模式、方向性权力不对称和行为标记的总体分布,但所有模型都系统性地扭曲了更细粒度的社会现象,包括行为强度、角色特定分配、类别分布和时间动态。这些扭曲具有明显的模型依赖性:GPT抑制有害内容,Grok放大攻击行为,LLaMA提供最均衡的近似但模糊了角色区分。研究表明,合成网络欺凌数据适用于建模全局互动结构,但在行为真实性和社会动态至关重要的场景下,仍无法完美替代真实对话。
| Cyberbullying (CB) | 网络欺凌,指通过电子媒介反复故意伤害他人的攻击行为,常伴随权力不平衡。 |
| Large Language Models (LLMs) | 大型语言模型,基于海量文本训练、能生成自然语言的人工智能模型,如GPT、Grok和LLaMA。 |
| Synthetic Data | 合成数据,由算法或模型人工生成、而非真实采集的数据,常用于数据增强和基准测试。 |
| Social Realism | 社会真实性,指数据或对话在多大程度上忠实反映真实社会互动中的结构、动态与行为特征。 |
| Temporal Escalation Dynamics | 时间升级动态,指网络欺凌互动中攻击行为随时间推移而加剧或演变的模式。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅