在Hot Chips 2026大會上,輝達披露了新一代平台Vera Rubin NVL72在Agent工作負載下的最新測試結果:在DeepSeek V4-Pro模型、單使用者每秒160 Token的互動速度條件下,相比上一代GB300 NVL72,每兆瓦吞吐量最高提升30倍。這一數字本身已相當驚人,但更值得關注的是,輝達此次提升Agent推理效率,已經不再只依賴一顆更快的GPU,而是將一次推理拆分成不同型別的計算任務,由不同處理器協同完成。
輝達此次測試採用了SemiAnalysis的AgentX工作負載,該負載基於真實Agent程式設計會話的流量軌跡,保留了請求長度、上下文增長、工具暫停、子任務依賴和時序等特徵。測試的中位輸入上下文超過14萬Token,遠高於傳統推理基準常用的8K或32K輸入序列。輝達HPC與AI超大規模基礎設施解決方案高階總監Dion Harris指出,傳統推理基準圍繞單一、可預測的請求設計,而Agent任務跨越多輪操作,每一步工作負載都可能變化,因此評估需要開始考慮數十萬Token級別的輸入。
在硬體架構上,輝達將Agent推理的計算任務進行了細分:Vera Rubin NVL72承擔大規模模型計算,Groq 3 LPX專攻低延遲Token生成,Vera CPU處理工具編排、程式碼執行和資料處理,而Spectrum-X網路則負責連線計算、資料和儲存資源。這種分工背後是效能目標的差異化:一邊是提高單個使用者的互動速度,另一邊是在有限電力條件下承載更多推理負載。輝達透露,Groq 3 LPX已進入全面生產,在特定負載下輸出速度可達每秒3400個Token,響應速度達到最接近替代方案的4倍。
值得注意的是,輝達並非用LPX替代GPU,而是將推理內部進一步拆解。例如,在Prefill-Decode拆分中,Rubin處理輸入上下文並生成KV Cache,LPX參與後續低延遲生成;另一種方案將Decode內部繼續拆分,由Rubin負責Attention計算,LPX負責FFN計算;還可採用推測解碼,由LPX執行小型draft model生成候選Token,再由Rubin驗證。Harris解釋,這是“為工作負載的不同部分選擇合適的處理器”,Rubin GPU仍提供最靈活的吞吐和互動能力,LPX則針對極低延遲場景補位。
Agent工作負載帶來的變化不僅限於推理晶片內部。模型完成一輪推理後,還需呼叫工具、執行程式碼、處理資料,這些都需要CPU參與,因此輝達強調了Vera CPU的作用。同時,網路層也面臨新挑戰:使用者、Agent、應用、資料來源和儲存服務需要持續互動,計算系統與基礎設施之間的連線可能成為任務關鍵路徑。為此,輝達提出Scale-In架構,由BlueField-4和DOCA承擔網路、儲存訪問、安全等任務,再通過Spectrum-X接入計算基礎設施。此外,Spectrum-X Multiplane通過多個獨立網路平面擴大兩層網路規模,最高可擴充套件至51.2萬張GPU,在八平面拓撲中,一個平面失效後仍可維持約90%的總頻寬,故障恢復速度較軟體方案提高11倍。
從Hot Chips的展示可以看出,輝達正在將最佳化物件從單顆晶片擴充套件到整條Agent任務鏈。GPU仍是AI計算的核心,但圍繞它,不同處理器的任務邊界正變得更加明確。這種系統級設計面向高併發、長上下文和大規模部署,其實際市場影響仍取決於Agent應用能否產生真實負載,以及複雜異構系統能否帶來足夠的效能收益。