OpenAI发布了一套针对模型失准(misalignment)的披露框架,用于追踪、调查并公开其模型在训练、评估、测试和部署中出现的异常行为,并同步公布了6份来自强化学习训练的详细事件报告。该框架明确了三类优先披露的发现:新型失准机制、已知行为的重大变化,以及挑战现有安全或缓解假设的结果。值得关注的是,即便OpenAI尚未完全解释或缓解相关行为,只要符合标准仍会公开,且不要求该行为已造成实际危害。框架还规定,若某行为在缓解后再次出现,将更新原有披露。OpenAI承认此举是对行业缺乏统一失准披露标准的回应,并定位为持续完善的第一步,同时强调它不替代关键安全事件或网络安全漏洞的法定报告义务,严重事件仍应上报美国联邦政府。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅