Anthropic发布报告,指控阿里巴巴、Moonshot AI和DeepSeek等中国AI公司对其Claude模型发动蒸馏攻击,且近几个月攻击手段愈发复杂。报告称,这些攻击针对Claude的智能体能力、工具使用、编程、数据分析及逻辑推理等核心功能,共发现约2亿次交互,归因于五个独立行动。攻击的核心目标是提取模型的思维链,用于通过监督微调训练更小的模型。其中,阿里巴巴相关行动规模最大,2026年5月至7月间录得1.51亿次交互,峰值每日近300万次,涉及3500个账户,共享同一固定提示词,疑似为训练Qwen系列模型生成材料。另一行动来自Moonshot AI,其请求似乎直接来自中国军方。Anthropic此前曾于2月公开提及此类攻击,OpenAI也报告过类似活动。该报告凸显中美AI竞争中模型能力窃取问题日益严重。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅