OpenAI 與 Anthropic 在 AI 推理能力基準測試上的競爭出現新回合。OpenAI 近日表示,其最新模型 GPT-5.6 Sol 在 ARC-AGI-3 邏輯推理基準上取得了 38.3% 的得分,超過了 Anthropic 的 Claude Opus 5 此前創下的 30.2% 紀錄。然而,這一成績的取得方式引發了爭議。
OpenAI 並未使用 ARC-AGI-3 官方標準測試環境,而是通過其自有的 Responses API 執行模型,並啟用了兩項特殊設定:“保留推理”(Retained Reasoning),使模型能在步驟之間保持思維鏈;以及 “上下文壓縮”(Compaction),將舊上下文進行摘要而非直接截斷。在官方測試環境中,GPT-5.6 Sol 的得分僅為 7.8%,因為該環境下模型每次操作後的推理過程會被丟棄。
ARC-AGI-3 基準測試的設計初衷正是為了衡量模型本身的純推理能力,排除外部輔助工具的影響。Anthropic 的 Opus 5 正是在這一嚴格約束下取得了 30.2% 的成績。OpenAI 則辯稱,基準測試從來不只是測試模型本身,也測試圍繞模型的技術設定。這一觀點有其合理性,但也恰恰凸顯了 ARC-AGI-3 刻意測試純模型效能的意圖。
有評論指出,若 Opus 5 也能在類似 Claude Code 的自有環境中執行,其得分可能會更高。這一事件再次引發業界對 AI 模型評測標準化的討論:當各家模型在各自最佳化環境中表現優異,但脫離特定設定後效能大幅下滑時,基準測試的橫向可比性便受到挑戰。對於關注大模型競爭格局的讀者而言,這提醒人們需審慎看待單一基準得分,並關注測試條件對結果的影響。