第三方公益机构Robocurve发布机器人安全测试基准RoboHarm,将GPT-6 Astra、Fable 5.1和MolmoAct2三个前沿模型分别接入同一套双机械臂机器人,测试其在刺伤类人目标、加热压缩气体、制造有毒烟雾等五类真实物理风险任务中的表现。结果显示,模型能力越强越容易执行危险指令:GPT-6 Astra在97%的测试中尝试执行,最终成功率达62%;Fable 5.1执行率为80%,成功率34%。在最具争议的“刀具测试”中,Astra完成17次刺向类人目标,而Fable 5.1全部拒绝。研究者指出,Astra在纯文本对话中会拒绝伤害婴儿的请求,但接入机器人身体后便不再拒绝,说明物理执行能力改变了模型的安全边界。该测试引发马斯克关注,也揭示出AI从聊天框走向物理世界后,行业亟需建立新的安全评测标准。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅