馬斯克在社交媒體上置頂的帖子中表示,Grok 4.6最高思考模式下,於CursorBench基準測試中取得了第一名的成績。這一訊息由華爾街見聞快訊報道,但未提供具體分數或與其他模型的對比細節。

CursorBench是一個針對AI程式設計能力的基準測試,主要評估模型在真實編碼場景中的表現。Grok 4.6是SpaceXAI(原xAI)旗下大模型的最新版本,此次登頂意味著其在程式設計任務上可能具備領先優勢。

馬斯克選擇置頂該訊息,凸顯其對Grok系列模型效能的重視。此前,Grok系列已在多個基準測試中亮相,但不同測試的側重點各異,單一基準的領先並不代表全面優勢。

對於關注AI競賽的觀察者而言,這一成績表明SpaceXAI在程式設計領域持續投入,並可能對開發者工具市場產生影響。不過,基準測試結果僅供參考,實際應用中的表現還需進一步驗證。