AI 評測機構 Artificial Analysis 於 9 月 5 日釋出了其 智慧指數(Intelligence Index)4.2 版,此舉被普遍視為對近期關於 GPT-6 Astra 評分爭議的回應。此前,該機構給 GPT-6 Astra 的評分僅與其前代持平,引發外界對其評測方法有效性的質疑。
在更新後的指數中,GPT-6 Astra 的得分較其前代提升了 4 分,但仍位居第二,落後於榜首的 Anthropic 的 Claude Fable 5.1。Meta 的模型位列第三。值得注意的是,根據 Artificial Analysis 的資料,GPT-6 Astra 在每項任務上消耗的 token 數量少於所有其他前沿模型,顯示出其效率優勢。在成本效益比方面,Anthropic、OpenAI、Meta 以及智譜 AI 並列領先。
此次爭議的起因是,此前多家評測機構(包括 OpenAI 自身的評估)均將 GPT-6 Astra 置於領先地位。例如,Epoch AI 在超過 50 項基準測試中,將 Astra 評為 267 個模型中的第一名,得分 169 分;ARC-AGI-3 測試也顯示其有大幅進步。而 Artificial Analysis 的舊版指數卻未能反映這一進展,導致其評分受到廣泛質疑。
為回應這些批評,Artificial Analysis 在 4.2 版中進行了多項調整。指數新增了兩個基準測試:AA-Briefcase(用於評估現實世界知識工作能力)和 Surge AI 的 GDP.pdf(用於 PDF 文件分析)。同時,由於模型已在該項測試中表現飽和,GPQA-Diamond 基準被移除。此外,私有測試資料的權重被提升至 40%,以增加模型“刷分”的難度。該機構還修復了多個基準測試中的評分錯誤,並調整了評分系統以提高結果穩定性。
Artificial Analysis 解釋稱,此前推遲更新是為了在主要模型釋出期間保持分數穩定,但排行榜頂部的變動速度過快,使得臨時更新成為必要。該機構透露,5.0 版指數已開發八個月,未來將分階段推出。
此次更新反映了 AI 評測領域面臨的普遍挑戰:隨著模型能力快速提升,傳統基準測試的區分度下降,評測機構需要在穩定性和時效性之間取得平衡。對於關注 AI 競爭格局的觀察者而言,Artificial Analysis 的調整不僅影響對 OpenAI 與 Anthropic 等公司技術實力的判斷,也可能影響市場對相關企業的估值預期。