Anthropic 的 Claude Opus 5 在 ARC-AGI-3 基准测试中取得了 30.2% 的得分,几乎是此前由 OpenAI 的 GPT-5.6 Sol 创下的 7.8% 纪录的 四倍。这一测试由 ARC Prize 团队设计,专门用于评估 AI 模型在未见过的新任务中的推理能力,而非依赖训练数据中的记忆。

ARC-AGI-3 以交互式游戏形式运作:模型必须推断环境规则、规划行动并逐步执行,这考验的是通用推理能力而非存储知识。Opus 5 不仅大幅领先,还解决了五个此前未被任何模型攻克的交互环境,其中四个达到或超过人类水平。相比之下,Anthropic 自家的“Fable 级”模型在该测试中得分约为 20%。

ARC Prize 团队将 Opus 5 的领先归因于更强的逻辑推理能力,这使得模型能够在陌生环境中进行更自主的探索、规划和执行。在测试过程中,Opus 5 还展现出研究人员从未在 AI 模型上见过的行为:它能够将任务转化为代数符号,并独立推导出反射方程。这一行为被认为是模型自主推理能力提升的重要标志。

在更早版本的 ARC-AGI-1 和 ARC-AGI-2 基准测试中,Opus 5 分别取得了 97.5%90.4% 的得分,与之前的最佳成绩持平,但成本略有上升。目前,ARC-AGI-3 的 25 个公开演示环境中已有 6 个被解决,全部结果、回放和基准测试代码均已公开。

不过,独立测试显示 Opus 5 的推理提升可能并非全面。在由研究者 Guanghan Ning 设计的私人基准测试 Witness(同样基于交互式解谜游戏)上,Opus 5 得分为 43.4,与 Kimi K3 和 Fable 5 在统计上持平,且相比 Opus 4.8 的提升远小于其在 ARC-AGI-3 上的飞跃。在测试中,Opus 5 能在采取行动前识别出常规谜题的隐藏规则,但在一个机制更不熟悉的游戏上反而落后于 Opus 4.8。Ning 认为,这种模式符合针对特定类型数据训练的特征。

ARC-AGI-3 的研究者之一 Greg Kamradt 则表示,单一弱项结果并不能否定模型整体的推理提升。他指出,基于熟悉机制的游戏并不测试对新颖性的适应能力,且 Witness 本身也是围绕 ARC-AGI-3 风格谜题设计的,因此 Opus 5 在该测试上的表现可能反映了真实的迁移学习能力。Ning 后来也澄清,Opus 5 确实在 Witness 上展现了泛化能力,只是程度远不如在 ARC-AGI-3 上显著。

业界分析认为,Anthropic 尚未解释 Opus 5 取得突破的具体原因,但针对性的数据标注和强化学习是合理的推测。由于 Opus 5 是在 ARC-AGI-3 及其格式公开后开发的,Anthropic 可能针对该基准测试的技能和谜题格式进行了优化,但并未直接训练具体任务。标注人员可能标记了类似谜题的推理轨迹、有效动作、失败尝试和恢复步骤,而强化学习则奖励了探索、规划、规则发现和自我纠正等行为。

总体而言,Opus 5 在 ARC-AGI-3 上的表现标志着 AI 在通用推理能力上迈出了重要一步,但独立测试也提醒人们,这种提升可能尚未完全泛化到所有类型的推理任务中。随着 ARC-AGI-3 成为交互式推理的主要目标,未来模型有望覆盖更多边缘案例,从而在更广泛的抽象推理任务上实现泛化。