OpenAI 自研推理晶片 Jalapeño 今日公佈跑分資料,首次從規格表走向實際效能測試。結果顯示,在 GPT-OSS 120BDeepSeek R1 670BKimi K2.5 1T 等模型上,Jalapeño 的每瓦效能提升約 1.5~1.9 倍,端到端延遲降低約 1.7~3.6 倍,在互動速度要求較高的區間,效能提升達到約 2.1~4.1 倍。晶片額定功耗為 700W,這批負載中的持續功耗未超過 550W。這些資料迅速在 Reddit 引發討論,網友將其與 NVIDIA 的 Rubin 晶片對比,但結論並不一致。

Jalapeño 的跑分資料之所以圍繞 Token 展開,是因為大模型推理的負載特性與傳統訓練截然不同。推理分為 Prefill 和 Decode 兩個階段:Prefill 階段輸入大量 Token,可平行計算,矩陣較大,計算密度高;Decode 階段則需逐個生成 Token,並行度下降,但權重仍要讀取,Attention 還需訪問 KV Cache。因此,Prefill 更受計算能力限制,Decode 則更依賴記憶體頻寬和資料移動。OpenAI 在架構說明中明確區分了這兩類負載,並強調通過保持資料區域性性、協同計算與記憶體網路來最佳化。

Reddit 上的爭論聚焦於 Jalapeño 與 Rubin 的效率對比。部分討論引用 SemiAnalysis 的比較,認為 Jalapeño 在部分單位成本 Token 指標上已進入 Rubin 的區間,且未依賴 speculative decoding。另一部分則認為,公開測試負載相對規則,Rubin 的軟體最佳化方式不同,Jalapeño 尚未經過生產資格驗證和規模部署,複雜 Agent 型長上下文負載的資料也有限。還有人將比較物件擴大至 Rubin GPU 加 Groq 3 LPX 的組合。目前尚無統一結論。

Jalapeño 並非孤例。NVIDIA 在 Hot Chips 2026 上展示了 Groq 3 LPU 在 Vera Rubin 系統中的作用:GPU 負責 Prefill,低延遲 Decode 交給 LPU。一套 LPX 機架含 256 顆 LPU,僅有 128 GB SRAM,但聚合頻寬可達 40 PB/s,強調資料靠近計算單元。NVIDIA 還通過 FPGA 橋接 GPU 與 LPU 的非同步系統,形成異構架構。Google 則推出 TPU 8t(訓練)和 TPU 8i(推理)兩顆晶片,其中 8i 配備更多 HBM 和 SRAM,並支援更短網路路徑的 BoardFly(上限 7 hops,而 3D Torus 為 16 hops),以降低 Decode 延遲。

這些路線差異背後,是推理負載對硬體資源比例的不同需求。訓練時大 Batch 可攤薄權重讀取成本,低延遲推理則需更高 HBM 頻寬、更大 SRAM、更好的 KV Cache 區域性性和更短網路路徑。當兩類負載的“晶片配方”越拉越開,通用晶片的效率損失愈發明顯。因此,這輪硬體競爭的核心指標正從 FLOPS 轉向 Token 吞吐、延遲、每瓦 Token 數等 Token 經濟學指標。