AI 评测机构 Artificial Analysis 于 9 月 5 日发布了其 智能指数(Intelligence Index)4.2 版,此举被普遍视为对近期关于 GPT-6 Astra 评分争议的回应。此前,该机构给 GPT-6 Astra 的评分仅与其前代持平,引发外界对其评测方法有效性的质疑。

在更新后的指数中,GPT-6 Astra 的得分较其前代提升了 4 分,但仍位居第二,落后于榜首的 Anthropic 的 Claude Fable 5.1。Meta 的模型位列第三。值得注意的是,根据 Artificial Analysis 的数据,GPT-6 Astra 在每项任务上消耗的 token 数量少于所有其他前沿模型,显示出其效率优势。在成本效益比方面,Anthropic、OpenAI、Meta 以及智谱 AI 并列领先。

此次争议的起因是,此前多家评测机构(包括 OpenAI 自身的评估)均将 GPT-6 Astra 置于领先地位。例如,Epoch AI 在超过 50 项基准测试中,将 Astra 评为 267 个模型中的第一名,得分 169 分;ARC-AGI-3 测试也显示其有大幅进步。而 Artificial Analysis 的旧版指数却未能反映这一进展,导致其评分受到广泛质疑。

为回应这些批评,Artificial Analysis 在 4.2 版中进行了多项调整。指数新增了两个基准测试:AA-Briefcase(用于评估现实世界知识工作能力)和 Surge AI 的 GDP.pdf(用于 PDF 文档分析)。同时,由于模型已在该项测试中表现饱和,GPQA-Diamond 基准被移除。此外,私有测试数据的权重被提升至 40%,以增加模型“刷分”的难度。该机构还修复了多个基准测试中的评分错误,并调整了评分系统以提高结果稳定性。

Artificial Analysis 解释称,此前推迟更新是为了在主要模型发布期间保持分数稳定,但排行榜顶部的变动速度过快,使得临时更新成为必要。该机构透露,5.0 版指数已开发八个月,未来将分阶段推出。

此次更新反映了 AI 评测领域面临的普遍挑战:随着模型能力快速提升,传统基准测试的区分度下降,评测机构需要在稳定性和时效性之间取得平衡。对于关注 AI 竞争格局的观察者而言,Artificial Analysis 的调整不仅影响对 OpenAI 与 Anthropic 等公司技术实力的判断,也可能影响市场对相关企业的估值预期。