美東時間8月12日週三,馬斯克旗下SpaceXAI正式釋出新一代大模型Grok 4.6。SpaceXAI稱,新模型相比Grok 4.5實現顯著提升,重點強化長時間執行的智慧體(Agent)、複雜程式設計、知識工作以及互動式和視覺任務能力。此次釋出最受關注的並非單純的模型迭代,而是Grok 4.6在SpaceXAI公佈的多項前沿模型測試中已經躋身第一梯隊,同時API起售價僅為2美元/百萬輸入Token、6美元/百萬輸出Token。SpaceXAI稱,其定價約為其他前沿模型的一半;該模型上線首周在Cursor和Grok Build中還提供2倍包含用量。

SpaceXAI公佈的測試資料顯示,Grok 4.6在Artificial Analysis Intelligence Index中取得61分,與OpenAI前沿模型GPT-5.6 Sol Max持平;在GDPVal-AA v2中則取得1753 Elo,超過GPT-5.6 Sol Max的1728分和Anthropic前沿模型Claude Fable 5的1741分。馬斯克隨後在社交媒體轉發有關Grok 4.6是巨大升級、在所有基準測試中得分均超過Grok 4.5 High的帖子,強調Grok 4.6評分達到1753 Elo,並自誇新模型“太牛了”。

從知識工作到程式設計,Grok 4.6此次升級的核心不再只是回答問題,而是讓模型能夠持續完成需要多步驟執行的複雜任務。SpaceXAI表示,Grok 4.6重點針對長時間執行的智慧體進行訓練,可以連續完成研究主題、分析資訊、處理程式碼庫,以及把一個模糊的產品想法轉化為可執行的應用或工作成果。公司還稱,新模型在更長的任務軌跡中開始表現出更多自主測試和驗證能力,會在繼續執行之前檢查此前的工作。

在訓練方面,Grok 4.6經歷了比Grok 4.5更長的補充訓練,加入經過篩選的模型生成推理資料、高質量工程資料,並改進最佳化器和訓練方案。隨後,SpaceXAI利用Grok 4.5生成覆蓋不同推理強度、智慧體框架以及STEM、軟體工程和知識工作的SFT軌跡,並進一步通過強化學習訓練模型完成通用程式設計、知識工作、核心最佳化、網頁開發和計算機輔助設計等任務。SpaceXAI特別強調,Grok 4.6在把“想法”變成“產品”方面有所提升。對於一個具體的產品構想,模型可以先研究陌生領域、設計應用結構、實現核心互動,再根據反饋進行多輪迭代;在視覺和互動式專案中,新模型也能夠更快形成較為完整的第一版成果。

低價策略直指開發者市場。SpaceXAI公佈的API價格從每百萬輸入Token 2美元、每百萬輸出Token 6美元起,另有速度更快、價格翻倍的版本。公司同時宣佈,Grok 4.6已經接入CursorGrok Build,並通過OpenRouterVercelCloudflare等合作伙伴提供。作為對比,SpaceXAI在公告中將Grok 4.6定位為“其他前沿模型的一半價格”。投資機構Atreides Management首席投資官Gavin Baker的評價更為激進:他認為,Grok 4.6的效能大致相當於Fable 5 Max,但輸入Token價格低80%、輸出Token價格低88%,因此在效能與成本的組合上具有明顯優勢。科技業分析師、Superintelligence Newsletter主編Kim Monnis也指出,Grok 4.6不僅比Opus 5和GPT-5.6 Sol便宜,甚至低於Sonnet 5,同時效能至少處於頂級模型水平。在他看來,這種“前沿效能+低成本”的組合才是Grok真正的護城河。需要指出的是,API單價並不能完全等同於實際使用成本。不同模型的Token消耗、推理強度和任務完成路徑存在差異,因此“便宜一半”主要是對公佈API價格的比較,而不是意味著所有具體任務的最終成本都恰好低50%。首周促銷也進一步強化了這一低價策略:SpaceXAI表示,Cursor和Grok Build使用者在首周可以獲得2倍包含用量,讓開發者可以低成本試用Grok 4.6。

從測試結果看,Grok 4.6的提升尤其集中在智慧體執行真實工作這一正在成為AI模型競爭核心的領域。SpaceXAI重點展示了Artificial Analysis推出的GDPVal-AA v2。該測試基於OpenAI的GDPval資料集,考察模型在真實世界、具有經濟價值的專業任務中的表現,覆蓋44個職業和9個主要行業;模型需要在智慧體環境中使用Shell和網頁瀏覽等工具完成任務,並通過盲測兩兩比較最終產出的檔案,由此形成Elo評分。在SpaceXAI此次公佈的對比資料中,Grok 4.6在GDPVal-AA v2取得1753 Elo,排名高於GPT-5.6 Sol Max的1728分和Claude Fable 5 Max的1741分,較上一代Grok 4.5 High的1526分大幅提高。與此同時,Grok 4.6在Artificial Analysis Intelligence Index中獲得61分,與GPT-5.6 Sol Max持平;該指數是由9項測試綜合而成,用於衡量模型在數學、科學、程式設計和推理等多個維度的綜合能力。

在SpaceXAI公佈的其他測試中,Grok 4.6同樣較上一代有明顯進步:CursorBench v3.269.9%(Grok 4.5 High為66.7%);FrontierCode v1.161.3%(Grok 4.5 High為56.6%);APEX-Agents57.5%(Grok 4.5 High為47.1%);APEX-SWE56.4%(Grok 4.5 High為53.6%);AA-Briefcase1577分(Grok 4.5 High為1313分);Harvey LAB15.8%(Grok 4.5 High為12.9%)。但Grok 4.6並非在所有測試中都佔據第一。例如在DeepSWE 1.1和Terminal-Bench v3.0中,SpaceXAI公佈的GPT-5.6 Sol Max成績仍高於Grok 4.6。因此,更準確的說法是,Grok 4.6已經在多項智慧體和知識工作測試中進入前沿模型第一梯隊,而不是全面擊敗所有競爭對手。值得注意的是,Artificial Analysis的GDPVal-AA v2排行榜本身會隨著模型新增和評測更新而變化,因此本文標題所稱的“力壓”特指SpaceXAI此次釋出時公佈的橫向測試結果,而非宣稱Grok 4.6在所有時間、所有評測體系中均排名第一。

Grok 4.6的釋出還顯示,SpaceXAI正在把競爭從單純的模型效能比拼,進一步延伸到開發者入口和應用生態。目前Grok 4.6已經同時進入Cursor、Grok Build和API,並接入OpenRouter、Vercel、Cloudflare等渠道。SpaceXAI希望藉助這些平台,讓開發者可以直接把Grok 4.6嵌入程式設計、網頁開發和智慧體工作流,而不只是通過Grok聊天產品使用模型。馬斯克本人也在X上密集為新模型站台。他先是宣佈“Grok 4.6 is now out”,隨後轉發有關1753 Elo排名的報道,並強調Grok 4.6在GDPVal-AA v2中取得第一;在另一條轉發中,他列出了Grok 4.6在AA-Briefcase、Harvey LAB、CursorBench、FrontierCode、APEX-Agents和APEX-SWE等測試中的排名,最後評價稱:“Grok 4.6 is a banger”。而Atreides Management的Gavin Baker則進一步把市場注意力引向下一代產品。他預計,Grok 4.7將是規模明顯更大的模型,並可能將Cursor和SpaceX資料納入預訓練。這一說法目前屬於投資人士的判斷,並非SpaceXAI此次釋出公告確認的產品路線。

如果Grok 4.6能夠在保持前沿模型級別能力的同時持續維持較低的Token價格,那麼其意義可能不僅是一代模型的效能升級,更可能成為AI大模型價格戰向智慧體時代延伸的一個新訊號:當不同廠商的模型能力差距逐漸縮小時,效能與推理成本之間的平衡,可能越來越成為開發者和企業選擇模型的關鍵。