马斯克在社交媒体上置顶的帖子中表示,Grok 4.6最高思考模式下,于CursorBench基准测试中取得了第一名的成绩。这一消息由华尔街见闻快讯报道,但未提供具体分数或与其他模型的对比细节。

CursorBench是一个针对AI编程能力的基准测试,主要评估模型在真实编码场景中的表现。Grok 4.6是SpaceXAI(原xAI)旗下大模型的最新版本,此次登顶意味着其在编程任务上可能具备领先优势。

马斯克选择置顶该消息,凸显其对Grok系列模型性能的重视。此前,Grok系列已在多个基准测试中亮相,但不同测试的侧重点各异,单一基准的领先并不代表全面优势。

对于关注AI竞赛的观察者而言,这一成绩表明SpaceXAI在编程领域持续投入,并可能对开发者工具市场产生影响。不过,基准测试结果仅供参考,实际应用中的表现还需进一步验证。