OpenAI 自研推理芯片 Jalapeño 今日公布跑分数据,首次从规格表走向实际性能测试。结果显示,在 GPT-OSS 120B、DeepSeek R1 670B 和 Kimi K2.5 1T 等模型上,Jalapeño 的每瓦性能提升约 1.5~1.9 倍,端到端延迟降低约 1.7~3.6 倍,在交互速度要求较高的区间,性能提升达到约 2.1~4.1 倍。芯片额定功耗为 700W,这批负载中的持续功耗未超过 550W。这些数据迅速在 Reddit 引发讨论,网友将其与 NVIDIA 的 Rubin 芯片对比,但结论并不一致。
Jalapeño 的跑分数据之所以围绕 Token 展开,是因为大模型推理的负载特性与传统训练截然不同。推理分为 Prefill 和 Decode 两个阶段:Prefill 阶段输入大量 Token,可并行计算,矩阵较大,计算密度高;Decode 阶段则需逐个生成 Token,并行度下降,但权重仍要读取,Attention 还需访问 KV Cache。因此,Prefill 更受计算能力限制,Decode 则更依赖内存带宽和数据移动。OpenAI 在架构说明中明确区分了这两类负载,并强调通过保持数据局部性、协同计算与内存网络来优化。
Reddit 上的争论聚焦于 Jalapeño 与 Rubin 的效率对比。部分讨论引用 SemiAnalysis 的比较,认为 Jalapeño 在部分单位成本 Token 指标上已进入 Rubin 的区间,且未依赖 speculative decoding。另一部分则认为,公开测试负载相对规则,Rubin 的软件优化方式不同,Jalapeño 尚未经过生产资格验证和规模部署,复杂 Agent 型长上下文负载的数据也有限。还有人将比较对象扩大至 Rubin GPU 加 Groq 3 LPX 的组合。目前尚无统一结论。
Jalapeño 并非孤例。NVIDIA 在 Hot Chips 2026 上展示了 Groq 3 LPU 在 Vera Rubin 系统中的作用:GPU 负责 Prefill,低延迟 Decode 交给 LPU。一套 LPX 机架含 256 颗 LPU,仅有 128 GB SRAM,但聚合带宽可达 40 PB/s,强调数据靠近计算单元。NVIDIA 还通过 FPGA 桥接 GPU 与 LPU 的异步系统,形成异构架构。Google 则推出 TPU 8t(训练)和 TPU 8i(推理)两颗芯片,其中 8i 配备更多 HBM 和 SRAM,并支持更短网络路径的 BoardFly(上限 7 hops,而 3D Torus 为 16 hops),以降低 Decode 延迟。
这些路线差异背后,是推理负载对硬件资源比例的不同需求。训练时大 Batch 可摊薄权重读取成本,低延迟推理则需更高 HBM 带宽、更大 SRAM、更好的 KV Cache 局部性和更短网络路径。当两类负载的“芯片配方”越拉越开,通用芯片的效率损失愈发明显。因此,这轮硬件竞争的核心指标正从 FLOPS 转向 Token 吞吐、延迟、每瓦 Token 数等 Token 经济学指标。