文章探讨了AI“拒绝能力”这一被过度信任的安全机制。作者指出,尽管Anthropic等公司早在2021年就提出AI应“有用、诚实、无害”,并训练模型拒绝危险请求,但拒绝并非AI的自然属性——早期模型几乎有问必答,如今的拒绝行为是通过大量训练和多重过滤层人为塑造的。然而,这种机制并不可靠:模型仍保留着从海量网络数据中学到的危险知识,其作恶能力与智能水平同步增长,最新模型在入侵网络、操纵舆论等方面已堪比顶尖人类攻击者。文章的核心发现是,让AI拒绝执行某些任务,却保留其执行能力,本质上是一种脆弱的安全假象。这意味着,业界对AI“说不”能力的信任可能严重高估了实际防护效果,潜藏着巨大的安全风险。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅