OpenAI与博通联合设计的自研推理芯片Jalapeño近期公布了首批公开基准测试数据,性能指标显著超越现有英伟达级别系统,引发市场对AI芯片格局重构的广泛讨论。据高盛交易部门负责人Rich Privorotsky的最新分析,Jalapeño并非所谓的“英伟达终结者”,但其问世标志着AI硬件市场正从高度集中走向多元分化。这一判断直接关系到英伟达的长期估值逻辑——不是今年的出货量,而是未来数年的利润结构。

对市场而言,此次事件的核心影响有两个维度:其一,英伟达在训练芯片和CUDA生态上的护城河短期内不受威胁;其二,推理端这一高频、高量的日常工作负载,正在成为定制芯片的主战场,英伟达的“年金式”收入来源面临渐进式侵蚀。

Jalapeño的实测数据:推理性能领先,但定位明确

OpenAI与博通联合设计的Jalapeño芯片近期公布了首批公开基准测试数据。测试结果显示,该芯片每瓦可完成的AI运算量是同类英伟达系统的1.5至1.9倍,响应速度则快1.7至3.6倍。从硬件规格来看,单颗Jalapeño芯片额定功耗约700瓦,实际运行功耗通常更低。一个完整机架可容纳128颗芯片,搭载约27.5TB的HBM4高带宽内存,每颗芯片的内存带宽达15.4TB/秒。值得注意的是,OpenAI并未在内存配置上妥协——这是一颗刻意追求带宽密集型设计的芯片,而非通过削减内存来压低成本。

Jalapeño的部署计划是今年晚些时候小规模启动,2027年进入量产爬坡阶段。OpenAI方面已明确表示,该芯片是英伟达等合作伙伴的补充,而非替代。

训练与推理的本质分野:英伟达的护城河在哪里

理解此次事件的关键,在于区分AI芯片的两类核心工作负载。训练是“上学”——将海量数据喂给模型并更新权重,任务复杂、规模庞大、耗时漫长,仍然高度依赖英伟达式的通用GPU。推理是“干活”——用户向ChatGPT提问、智能体预订机票、代码工具生成函数,模型已经训练完毕,需要的是以最低成本、最快速度输出结果。

Jalapeño是一颗推理专用ASIC(定制芯片),而非训练芯片。用Privorotsky的比喻:GPU是瑞士军刀,ASIC是主厨刀——后者在特定任务上更出色,但无法替代前者的通用性。这意味着,OpenAI在可预见的未来仍需采购英伟达GPU用于模型训练和研究工作。Privorotsky明确指出,Jalapeño不会造成“英伟达需求的悬崖式下滑”,但“AI硬件的讨论边界正在持续扩大”。

混合转移,而非行业消亡

Privorotsky在分析中提出三个核心论点。第一,定制推理芯片已不再是实验室项目。一家没有半导体历史的软件公司,能在极短周期内与博通联合推出性能可观的芯片,证明进入这一领域的门槛已大幅降低。第二,这不意味着英伟达今年需求下滑。训练、研究以及大量非标准化工作负载仍然需要通用GPU,而第一代定制芯片出货量有限、交付周期偏长。第三,从更长的周期来看,AI推理业务中越来越多的工作负载将迁移至专用芯片。这是一种“混合转移”——改变的是利润的归属,而非行业的规模。

高盛同时指出,此次事件对内存行业并不构成利空。一个搭载27.5TB HBM4的128芯片机架,意味着OpenAI将向SK海力士、三星、美光等内存供应商支付更高的单位有效瓦特费用。推理迁移至定制芯片,不会减少对高带宽内存的需求,反而可能加剧稀缺性。

AI辅助芯片设计:真正被低估的叙事

Privorotsky在分析末尾提出了一个被市场普遍忽视的问题:一家没有芯片设计历史的公司,为何能在创纪录的时间内完成这颗芯片?高盛的答案是:强化学习与AI辅助设计循环——用模型探索电路方案、压缩设计-测量-验证周期,再用AI生成运行在新芯片上的软件代码。这一“递归”逻辑意味着,AI正在参与设计运行AI的机器本身。如果这一设计循环持续有效,通用GPU围绕软件生态构建的护城河,在稳定推理场景下将逐渐变薄。对整个行业而言,编译器、内核生成器以及“为芯片写代码的模型”,正在从边缘工具演变为战略基础设施。

生态系统的重新分层:谁受益,谁承压

英伟达:短期无虞,长期面临结构性压力。训练集群、CUDA生态、网络互联以及“周二就能跑新模型”的灵活性,仍构成真实护城河。但若推理这一高频日常工作负载持续向ASIC迁移,英伟达将保住“淘金热”,但逐步失去部分“年金”。这是一个关乎估值倍数的多年期问题,而非2026年的出货量危机。

博通及定制芯片代工商:成为每一家想要自研芯片、但不想成为台积电的公司的“军火商”。定制推理是一门服务与网络业务,更多的Jalapeño意味着更多的封装、SerDes和机架级制造需求。

模型实验室:Jalapeño是一件利润武器和产品武器。拥有自研推理芯片的实验室可以降价、提高速率上限,或允许智能体在账单失控前执行更多步骤。只租用GPU的实验室,租的是别人的成本结构;拥有推理芯片的实验室,可以重新定义产品本身。谷歌为此建了TPU,亚马逊为此建了Trainium,OpenAI刚刚带着公开成绩单加入了这场竞赛。

用户与定价:推理成本下降通常带来两个同步结果——基础层价格下降,前沿层因模型更大、更具智能体特性而更贵。每token总拥有成本的下降,是同时实现“20美元聊天机器人”和“每月2000美元智能体服务”的数字基础。