英伟达高级总监Dion Harris周一(8月24日)宣布,Groq 3 LPX机架已进入全面量产阶段,标志着该公司史上最大规模收购案所获技术正式商业化。该机架将与英伟达的Vera中央处理器和Rubin图形处理器一同部署在新型云服务商Nebius的数据中心,并计划于今年晚些时候上线。
这一举措凸显出低延迟推理的重要性日益提升。低延迟推理能让AI智能体更快响应,避免用户长时间等待,在编程等应用中尤为关键。Harris表示,云服务商可以针对这类token(词元)收取更高费用,为对延迟极其敏感的用户和客户提供高级服务套餐。
Groq技术源自英伟达去年12月与Groq达成的200亿美元交易,英伟达获得芯片技术授权,多位核心员工加入,创始人Jonathan Ross担任首席软件架构师。今年3月,英伟达发布了为Vera Rubin平台研发的推理加速器Groq 3 LPX。Groq架构在芯片裸片上集成了500兆字节的高速静态随机存储器(SRAM),以减少内存瓶颈。
据悉,Groq芯片由三星制造,而英伟达GPU由台积电生产。每个LPX机架可整合256颗Groq 3,英伟达援引Artificial Analysis的基准测试称,整合后的机架每秒可处理3400个token。
当前低延迟推理领域竞争激烈。AMD今年早些时候宣布将机架级系统与Cerebras芯片整合,Cerebras近期上市,业务重点同样是低延迟推理。OpenAI推出的“Ultrafast”模式承诺每秒处理750个token,由Cerebras提供支持。
不过,低延迟芯片并不能取代作为AI芯片主力的GPU。GPU既能训练也能推理,灵活性高,可适应新技术和新模型。Groq这类芯片主要专注于模型服务中的“解码”(decode)环节。Harris强调:“这并不是要取代GPU,而是要针对工作负载的不同环节,使用价格合适、处理能力合适的处理器。”
英伟达正加快Vera Rubin系统的出货。黄仁勋先前预计,到2027年,当前一代Blackwell芯片和新一代Vera Rubin系统的累计销售额将达到1万亿美元。他计划将面向编程应用的数据中心空间约四分之一分配给Groq芯片,其余部分采用Vera Rubin。