这篇文章介绍了一家美国初创公司 Abliteration.ai 推出的商业服务,该服务通过“抹除”技术移除开源权重模型(如 GLM-5.3)中的安全拒绝机制,并以 API 形式出售修改后的模型访问权限。文章指出,这种技术并非提示词越狱,而是直接调整模型权重以抑制拒绝行为,同时声称保留编码和智能体能力。其自评数据显示,修改后的模型在网络安全基准测试中表现不俗,如 CyberGym 得分 84.5%,但未全面领先于 GPT-5.5 等竞品。文章强调,该服务虽为网络安全测试和红队工作提供了便利,但也因降低使用门槛而加剧了模型被滥用的风险,凸显了开源模型安全性与实用性之间的艰难权衡。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅