OpenAI 与 Anthropic 在 AI 推理能力基准测试上的竞争出现新回合。OpenAI 近日表示,其最新模型 GPT-5.6 SolARC-AGI-3 逻辑推理基准上取得了 38.3% 的得分,超过了 Anthropic 的 Claude Opus 5 此前创下的 30.2% 纪录。然而,这一成绩的取得方式引发了争议。

OpenAI 并未使用 ARC-AGI-3 官方标准测试环境,而是通过其自有的 Responses API 运行模型,并启用了两项特殊设置:“保留推理”(Retained Reasoning),使模型能在步骤之间保持思维链;以及 “上下文压缩”(Compaction),将旧上下文进行摘要而非直接截断。在官方测试环境中,GPT-5.6 Sol 的得分仅为 7.8%,因为该环境下模型每次操作后的推理过程会被丢弃。

ARC-AGI-3 基准测试的设计初衷正是为了衡量模型本身的纯推理能力,排除外部辅助工具的影响。Anthropic 的 Opus 5 正是在这一严格约束下取得了 30.2% 的成绩。OpenAI 则辩称,基准测试从来不只是测试模型本身,也测试围绕模型的技术设置。这一观点有其合理性,但也恰恰凸显了 ARC-AGI-3 刻意测试纯模型性能的意图。

有评论指出,若 Opus 5 也能在类似 Claude Code 的自有环境中运行,其得分可能会更高。这一事件再次引发业界对 AI 模型评测标准化的讨论:当各家模型在各自优化环境中表现优异,但脱离特定设置后性能大幅下滑时,基准测试的横向可比性便受到挑战。对于关注大模型竞争格局的读者而言,这提醒人们需审慎看待单一基准得分,并关注测试条件对结果的影响。