OpenAI于2026年9月披露,其识别并阻断了一场有组织的模型蒸馏攻击活动,最早活动可追溯至7月初。攻击者并未突破加密或入侵数据库,而是通过操纵模型交互,以规模化方式诱导模型输出受保护的内部推理内容,从而试图复制其能力。7月24日至25日出现高峰,涉及逾4000名用户的16000次请求,相关活动最终扩展至超过15000名用户的集群,并于7月28日被完全阻断。OpenAI将核心活动归因于特定行为主体,并指出此类对抗性蒸馏并非其模型独有漏洞,已通过前沿模型论坛与行业伙伴共享信息,以强化集体防御。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅