輝達高階總監Dion Harris週一(8月24日)宣佈,Groq 3 LPX機架已進入全面量產階段,標誌著該公司史上最大規模收購案所獲技術正式商業化。該機架將與輝達的Vera中央處理器和Rubin圖形處理器一同部署在新型雲服務商Nebius的資料中心,並計劃於今年晚些時候上線。

這一舉措凸顯出低延遲推理的重要性日益提升。低延遲推理能讓AI智慧體更快響應,避免使用者長時間等待,在程式設計等應用中尤為關鍵。Harris表示,雲服務商可以針對這類token(詞元)收取更高費用,為對延遲極其敏感的使用者和客戶提供高階服務套餐。

Groq技術源自輝達去年12月與Groq達成的200億美元交易,輝達獲得晶片技術授權,多位核心員工加入,創始人Jonathan Ross擔任首席軟體架構師。今年3月,輝達釋出了為Vera Rubin平台研發的推理加速器Groq 3 LPX。Groq架構在晶片裸片上集成了500兆位元組的高速靜態隨機儲存器(SRAM),以減少記憶體瓶頸。

據悉,Groq晶片由三星製造,而輝達GPU由台積電生產。每個LPX機架可整合256顆Groq 3,輝達援引Artificial Analysis的基準測試稱,整合後的機架每秒可處理3400個token。

當前低延遲推理領域競爭激烈。AMD今年早些時候宣佈將機架級系統與Cerebras晶片整合,Cerebras近期上市,業務重點同樣是低延遲推理。OpenAI推出的“Ultrafast”模式承諾每秒處理750個token,由Cerebras提供支援。

不過,低延遲晶片並不能取代作為AI晶片主力的GPU。GPU既能訓練也能推理,靈活性高,可適應新技術和新模型。Groq這類晶片主要專注於模型服務中的“解碼”(decode)環節。Harris強調:“這並不是要取代GPU,而是要針對工作負載的不同環節,使用價格合適、處理能力合適的處理器。”

輝達正加快Vera Rubin系統的出貨。黃仁勳先前預計,到2027年,當前一代Blackwell晶片和新一代Vera Rubin系統的累計銷售額將達到1萬億美元。他計劃將面向程式設計應用的資料中心空間約四分之一分配給Groq晶片,其餘部分採用Vera Rubin。