OpenAI发布了一套用于追踪、调查和披露模型失准(misalignment)的新框架,并同步公开了过去六个月中观察到的六起模型异常或令人担忧行为的报告。此前,OpenAI虽有意公开相关发现,但缺乏系统化机制,披露往往零散、滞后,或仅附于新模型的系统说明中。新框架旨在加快发布速度,即便行为尚未被完全解释或缓解也可先行披露。OpenAI指出,当前AI行业尚未充分解决对齐与监控问题,不足以支撑持续高速扩展,因此需要让外部研究者、开发者、政策制定者和公众基于可独立检验的证据形成更广泛的共识。该框架倾向于在意义不确定时也进行披露,部分案例可能最终被证明是偶发而非系统性模式。OpenAI希望这一框架能成为行业制定明确披露标准的第一步,并表示将根据经验和公众反馈持续完善。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅