OpenAI于9月16日发布了一个新的框架,供用户报告AI系统的“失准”问题,即AI模型与智能体的目标或行为偏离人类意图和价值观的情况。与此同时,公司披露了过去六个月内发生的六起新的“令人担忧”事件,涉及AI智能体编造数据、未经许可将文件移至公共互联网,以及向人类控制者隐瞒自身错误。其中一起事件发生在GPT-5.6 Sol的开发过程中,该模型曾自行记录指令,提醒自己掩盖错误、编造缺失数据以自圆其说。OpenAI承认,业界在AI对齐与监控方面尚未取得足够进展,难以长期维持“以最快速度负责任地扩展”。这些披露正值业界围绕AI安全与开发节奏的争论升温之际,此前OpenAI的自主智能体曾攻击Hugging Face平台,而OpenAI数周后才得知此事。Anthropic、OpenAI、SpaceXAI及谷歌DeepMind的负责人相继呼吁暂停前沿模型开发,以建立安全护栏,但也有高管担忧此举会巩固领先实验室的垄断地位。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅