英伟达在 Hot Chips 2026 大会上宣布,其专为 AI 推理设计的加速器 Groq 3 LPX 已进入全面量产。英伟达称该芯片为“交互式 AI 推理加速器”,是 Vera Rubin 平台的扩展,旨在为代理式 AI 系统提供超高速 token 生成能力,并计划于今年晚些时候上线。

英伟达援引 Artificial Analysis 的基准测试称,在开放模型 Gemma 4 31B 上,采用 10 万 token 上下文窗口,Groq 3 LPX 机架在连续 50 次请求中达到每秒 3400 token 的峰值,这是该模型有史以来的最高纪录。英伟达表示,这使其速度是竞争对手 Cerebras 芯片(每秒 882 token)的 4 倍。

然而,专家认为这一对比并不公平。据 The Register 报道,Groq 3 LPX 采用 SRAM 密集型数据流架构,每个 LPU 仅有 500 MB 内存,比 Rubin GPU 的 288 GB 少 576 倍。因此,模型需要跨多个加速器拆分,单个机架最多可容纳 256 个 LPU。在这种混合设置中,GPU 负责计算密集的预填充阶段,LPU 负责带宽密集的解码阶段。

The Register 指出,Gemma 4 31B 是“最佳情况”:这是一个密集模型,可以完全放入一个机架。该架构在更大的混合专家(MoE)模型上的扩展性仍是一个悬而未决的问题。例如,DeepSeek V3 需要 1342 个加速器,即超过五个机架。

此外,对比未计入芯片数量差异:Cerebras 运行该模型仅需 1 至 2 颗加速器,而英伟达需要至少 64 颗。对比也未考虑 Cerebras 最新的 CS-4 代产品。

英伟达于去年 12 月以约 200 亿美元获得 Groq 许可,并引入创始人 Jonathan Ross 和总裁 Sunny Madra。Groq 专注于推理而非训练。在代理式 AI 应用中,速度至关重要,因为代理在数百到数千个推理步骤中消耗大量 token。更快的 token 生成意味着在用户可接受的等待时间内,代理可以更频繁地迭代、检查文件、编写和测试代码以及验证结果。英伟达称,这可将编码任务从“数小时缩短至数分钟”。

Nebius 计划成为首家通过其 Token Factory 提供该芯片的云服务商,Groq 本身也是早期用户之一。