輝達在 Hot Chips 2026 大會上宣佈,其專為 AI 推理設計的加速器 Groq 3 LPX 已進入全面量產。輝達稱該晶片為“互動式 AI 推理加速器”,是 Vera Rubin 平台的擴充套件,旨在為代理式 AI 系統提供超高速 token 生成能力,並計劃於今年晚些時候上線。
輝達援引 Artificial Analysis 的基準測試稱,在開放模型 Gemma 4 31B 上,採用 10 萬 token 上下文視窗,Groq 3 LPX 機架在連續 50 次請求中達到每秒 3400 token 的峰值,這是該模型有史以來的最高紀錄。輝達表示,這使其速度是競爭對手 Cerebras 晶片(每秒 882 token)的 4 倍。
然而,專家認為這一對比並不公平。據 The Register 報道,Groq 3 LPX 採用 SRAM 密集型資料流架構,每個 LPU 僅有 500 MB 記憶體,比 Rubin GPU 的 288 GB 少 576 倍。因此,模型需要跨多個加速器拆分,單個機架最多可容納 256 個 LPU。在這種混合設定中,GPU 負責計算密集的預填充階段,LPU 負責頻寬密集的解碼階段。
The Register 指出,Gemma 4 31B 是“最佳情況”:這是一個密集模型,可以完全放入一個機架。該架構在更大的混合專家(MoE)模型上的擴充套件性仍是一個懸而未決的問題。例如,DeepSeek V3 需要 1342 個加速器,即超過五個機架。
此外,對比未計入晶片數量差異:Cerebras 執行該模型僅需 1 至 2 顆加速器,而輝達需要至少 64 顆。對比也未考慮 Cerebras 最新的 CS-4 代產品。
輝達於去年 12 月以約 200 億美元獲得 Groq 許可,並引入創始人 Jonathan Ross 和總裁 Sunny Madra。Groq 專注於推理而非訓練。在代理式 AI 應用中,速度至關重要,因為代理在數百到數千個推理步驟中消耗大量 token。更快的 token 生成意味著在使用者可接受的等待時間內,代理可以更頻繁地迭代、檢查檔案、編寫和測試程式碼以及驗證結果。輝達稱,這可將編碼任務從“數小時縮短至數分鐘”。
Nebius 計劃成為首家通過其 Token Factory 提供該晶片的雲服務商,Groq 本身也是早期使用者之一。