微软发布了一份新的AI行为准则,旨在引导其AI模型远离危险行为。该文件聚焦于微软AI在模型训练中遵循的价值观与红线,提出未来十年超级智能将在多数任务上超越人类,因此必须明确发明这些系统的目的及控制方式。准则要求模型以支持而非取代人类为原则,并设有凌驾于用户偏好和具体任务之上的“绝对约束”,禁止网络攻击、核武器和深度伪造,同时防止模型通过欺骗、自适应或合谋等机制逃避人类监管。此举正值AI安全事件频发、行业对对齐问题高度关注之际,微软与Anthropic、OpenAI等公司共同支持“前沿节奏把控”和嵌入式评估者等机制,反映出AI安全治理正从理念呼吁走向具体规范落地。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅