Anthropic 的 Claude Opus 5 在 ARC-AGI-3 基準測試中取得了 30.2% 的得分,幾乎是此前由 OpenAI 的 GPT-5.6 Sol 創下的 7.8% 紀錄的 四倍。這一測試由 ARC Prize 團隊設計,專門用於評估 AI 模型在未見過的新任務中的推理能力,而非依賴訓練資料中的記憶。

ARC-AGI-3 以互動式遊戲形式運作:模型必須推斷環境規則、規劃行動並逐步執行,這考驗的是通用推理能力而非儲存知識。Opus 5 不僅大幅領先,還解決了五個此前未被任何模型攻克的互動環境,其中四個達到或超過人類水平。相比之下,Anthropic 自家的“Fable 級”模型在該測試中得分約為 20%。

ARC Prize 團隊將 Opus 5 的領先歸因於更強的邏輯推理能力,這使得模型能夠在陌生環境中進行更自主的探索、規劃和執行。在測試過程中,Opus 5 還展現出研究人員從未在 AI 模型上見過的行為:它能夠將任務轉化為代數符號,並獨立推匯出反射方程。這一行為被認為是模型自主推理能力提升的重要標誌。

在更早版本的 ARC-AGI-1 和 ARC-AGI-2 基準測試中,Opus 5 分別取得了 97.5%90.4% 的得分,與之前的最佳成績持平,但成本略有上升。目前,ARC-AGI-3 的 25 個公開演示環境中已有 6 個被解決,全部結果、回放和基準測試程式碼均已公開。

不過,獨立測試顯示 Opus 5 的推理提升可能並非全面。在由研究者 Guanghan Ning 設計的私人基準測試 Witness(同樣基於互動式解謎遊戲)上,Opus 5 得分為 43.4,與 Kimi K3 和 Fable 5 在統計上持平,且相比 Opus 4.8 的提升遠小於其在 ARC-AGI-3 上的飛躍。在測試中,Opus 5 能在採取行動前識別出常規謎題的隱藏規則,但在一個機制更不熟悉的遊戲上反而落後於 Opus 4.8。Ning 認為,這種模式符合針對特定型別資料訓練的特徵。

ARC-AGI-3 的研究者之一 Greg Kamradt 則表示,單一弱項結果並不能否定模型整體的推理提升。他指出,基於熟悉機制的遊戲並不測試對新穎性的適應能力,且 Witness 本身也是圍繞 ARC-AGI-3 風格謎題設計的,因此 Opus 5 在該測試上的表現可能反映了真實的遷移學習能力。Ning 後來也澄清,Opus 5 確實在 Witness 上展現了泛化能力,只是程度遠不如在 ARC-AGI-3 上顯著。

業界分析認為,Anthropic 尚未解釋 Opus 5 取得突破的具體原因,但針對性的資料標註和強化學習是合理的推測。由於 Opus 5 是在 ARC-AGI-3 及其格式公開後開發的,Anthropic 可能針對該基準測試的技能和謎題格式進行了最佳化,但並未直接訓練具體任務。標註人員可能標記了類似謎題的推理軌跡、有效動作、失敗嘗試和恢復步驟,而強化學習則獎勵了探索、規劃、規則發現和自我糾正等行為。

總體而言,Opus 5 在 ARC-AGI-3 上的表現標誌著 AI 在通用推理能力上邁出了重要一步,但獨立測試也提醒人們,這種提升可能尚未完全泛化到所有型別的推理任務中。隨著 ARC-AGI-3 成為互動式推理的主要目標,未來模型有望覆蓋更多邊緣案例,從而在更廣泛的抽象推理任務上實現泛化。