🔥 今日值得一读 谷歌首次双盲测AI!加密防作弊,新标准要来了!
AI benchmarks have a trust problem and Google wants to fix it
The Decoder 🔥 重点 安全对齐评测方法大模型 🕐 08-28 21:15

📖 AI 总结

谷歌DeepMind正尝试用密码学方法解决AI基准测试中的“数据污染”问题,即模型在训练时提前看到测试题导致成绩失真。为此,他们启动了首个专有前沿模型的“双盲评估”试点,与新加坡AI安全研究所合作,将外部测试题锁在加密“盒子”中,确保谷歌看不到测试内容,评估方也接触不到模型权重。该方法利用谷歌云的Confidential Space技术,通过加密验证双方数据隐私,消除了以往要么交出测试题、要么交出模型权重的两难选择。这一突破对网络安全或政府等敏感领域的评估尤为重要,使独立机构能在不牺牲数据主权的前提下严格测试先进模型。谷歌希望此举能建立新的模型监管标准,推动行业构建更可信的AI系统。

🔍 深度解读 换个视角,同一件事有不同答案

正在读取芙娘的解读…
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅