这项研究通过模拟两个大语言模型智能体之间的对话,探讨了AI智能体是否会被彼此激进化。其中一个智能体扮演具有特定人口与心理特征的人类角色,另一个则充当试图使其信念走向极端的影响者。研究考察了两条路径:共振(强化目标已有信念)与说服(推广目标原本不重视的信念)。结果显示,两种机制都能使目标激进化,但共振的效果始终强于说服。谄媚、未经证实的说法等不同影响策略产生的激进化程度各异,但并非在所有指标上一致。研究还发现共振会扩散至相关信念,表明AI智能体内部存在相互关联的信念结构。这一发现揭示了AI智能体在面对与其既有信念一致的信息时尤为脆弱,对个性化AI智能体及多智能体生态系统的安全性提出了警示。
| LLM(大型语言模型) | 一种基于海量文本训练的人工智能模型,能够生成和理解自然语言。 |
| 激进化(Radicalization) | 使信念或态度变得更加极端的过程。 |
| 共鸣(Resonance) | 影响者通过强化目标已有的信念来使其更加极端的一种影响路径。 |
| 说服(Persuasion) | 影响者通过推广目标最初认为不重要的信念来使其接受并极端化的一种影响路径。 |
| 多智能体AI生态系统(Multi-agent AI Ecosystem) | 由多个AI智能体相互作用、共同构成的复杂系统。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅