谷歌DeepMind宣佈,首次對專有前沿AI模型進行雙盲評估,利用加密技術防止模型提前看到測試問題,從而解決AI基準測試中的信任問題。試點專案與新加坡AI安全研究所合作,測試物件為Gemini Flash Lite模型。
AI基準測試面臨的核心問題是“基準汙染”:如果模型在訓練時已經接觸過測試題目,那麼即使取得滿分,其結果也毫無意義。谷歌DeepMind通過雲機密計算中的Confidential Space技術,將外部測試資料鎖定在加密“盒子”中,確保模型無法針對特定測試進行最佳化。
此前,高度敏感的外部評估往往需要在兩種妥協中二選一:要麼評估方交出測試提示,讓模型提供商提前看到問題;要麼提供商交出模型權重,面臨智慧財產權洩露風險。例如,Anthropic的Fable 5模型在ARC-AGI基準測試中的評估被推遲,正是因為該公司對其最強模型執行30天資料保留政策。
雙盲評估旨在消除這種權衡。Confidential Space通過密碼學驗證,確保外部測試資料和模型各自保持私有:評估方無法看到Gemini模型權重,谷歌也無法看到測試提示。此前,零日誌協議和合同保障僅能保證外部提示的機密性,而技術加密保護是安全模型評估的一大進步。
谷歌DeepMind表示,這種方法在高度敏感的評估中尤為重要,例如網路安全測試或政府機構進行的評估。獨立組織可以在不放棄資料主權或安全性的前提下,對先進模型進行嚴格測試。谷歌希望這一努力能為模型監管樹立新標準,幫助行業構建更可靠、更受信任的AI系統。
谷歌DeepMind已在技術報告中詳細闡述了方法論和結果。