谷歌DeepMind宣布,首次对专有前沿AI模型进行双盲评估,利用加密技术防止模型提前看到测试问题,从而解决AI基准测试中的信任问题。试点项目与新加坡AI安全研究所合作,测试对象为Gemini Flash Lite模型。
AI基准测试面临的核心问题是“基准污染”:如果模型在训练时已经接触过测试题目,那么即使取得满分,其结果也毫无意义。谷歌DeepMind通过云机密计算中的Confidential Space技术,将外部测试数据锁定在加密“盒子”中,确保模型无法针对特定测试进行优化。
此前,高度敏感的外部评估往往需要在两种妥协中二选一:要么评估方交出测试提示,让模型提供商提前看到问题;要么提供商交出模型权重,面临知识产权泄露风险。例如,Anthropic的Fable 5模型在ARC-AGI基准测试中的评估被推迟,正是因为该公司对其最强模型执行30天数据保留政策。
双盲评估旨在消除这种权衡。Confidential Space通过密码学验证,确保外部测试数据和模型各自保持私有:评估方无法看到Gemini模型权重,谷歌也无法看到测试提示。此前,零日志协议和合同保障仅能保证外部提示的机密性,而技术加密保护是安全模型评估的一大进步。
谷歌DeepMind表示,这种方法在高度敏感的评估中尤为重要,例如网络安全测试或政府机构进行的评估。独立组织可以在不放弃数据主权或安全性的前提下,对先进模型进行严格测试。谷歌希望这一努力能为模型监管树立新标准,帮助行业构建更可靠、更受信任的AI系统。
谷歌DeepMind已在技术报告中详细阐述了方法论和结果。