英伟达宣布Groq 3 LPX全面投产,AI推理迈入“毫秒级”时代

来源:半导纵横发布时间:2026-08-25 14:00
英伟达
AI
生成海报
英伟达正在重新定义“AI响应速度”的标准。

近日,英伟达正式宣布Groq 3 LPX已实现全面量产。作为Vera Rubin NVL72机架平台的重要扩展组件,这套全新推理加速方案瞄准AI智能体的核心痛点,用全栈协同设计,重新定义AI工厂的推理能力。

打破单芯片突破的旧逻辑

和传统对话AI不一样,AI智能体需要反复调用工具、执行代码、处理海量文档,经常面对十万级Token超长上下文。每一步推理都会持续生成大量Token,微小的解码延迟,会在多轮任务中被不断放大。只依靠GPU,很难同时兼顾超大上下文处理与极速Token输出,这也是当下智能体规模化落地的一大瓶颈。

Groq 3 LPX并不是用来替代GPU,而是和Vera Rubin平台深度协同,分工协作:Rubin GPU负责处理海量的上下文输入,Groq 3 LPX专门接管对延迟极其敏感的 Token解码生成工作,一者负责“读”,一者负责“写”。整套系统把计算、网络、推理加速做一体化协同设计,打破硬件单独优化的局限。

在宣布量产的同时,英伟达还公布了一组第三方基准测试数据:在Artificial Analysis的测试中,Groq 3 LPX在10万token超长上下文中运行Gemma 4 31B模型,实现了每秒3400个Token的输出速度。单台机架最多可搭载256颗LP30加速器,通过芯片直连链路,组成确定性高吞吐推理引擎,兼顾响应速度与大规模并发能力,解决智能体交互卡顿的难题。

作为对比,OpenAI此前宣布的Ultrafast模式,每秒处理750个Token,而Groq 3 LPX的速度是它的4.5倍,直接把智能体的响应流畅度拉高了一个量级。

全球头部行业伙伴抢先落地

目前已有全球头部行业伙伴第一时间拥抱了这套全新的平台方案,覆盖从地面云端到太空轨道的多元场景:

首家AI云服务商Nebius成为首个接入Groq 3 LPX的云厂商,把加速后的模块整合进自家的Token Factory中,让开发者可以直接调用这种超高token生成速度的算力,大规模搭建高交互智能体、实时编码系统等AI应用。

基础设施服务商CoreWeave已经把Spectrum-X Multiplane部署到生产环境,依靠多并行交换机连接Vera Rubin机架,搭建出高带宽、零损耗的扁平化AI网络,支撑超大规模集群的稳定运行。

SpaceXAI更是宣布将采用英伟达Vera CPU支撑下一代智能体AI架构,这套方案的覆盖场景甚至从地球数据中心延伸到轨道卫星,专门加速智能体背后的编排调度、工具调用、代码执行、数据处理和仿真等CPU密集型工作。

打造面向未来的“Token工厂”

英伟达把专为智能体时代设计的新一代AI基础设施定义为“Token工厂”,而支撑这个工厂高效运转的核心,就是贯穿所有层级的极端协同设计思路:

在Vera Rubin架构下,Rubin GPU专门负责大规模长上下文处理,Groq 3 LPX作为低延迟推理加速器专门承接延迟敏感的token生成解码工作,两者协同把传统推理系统里速度和吞吐量不可兼得的固有瓶颈彻底打破,让智能体在复杂推理链条里不会因为微小延迟叠加出现响应卡顿。

同时,配套推出的Spectrum-X Multiplane网络架构,更是跳出了传统大规模集群必须新增第三层网络层级的老路,通过多平面拓扑实现了可扩展到51.2万GPU的扁平化无损网络,不需要额外增加网络层就能避免延迟波动、降低部署成本,整机群的AI算力输出直接提升1.6倍。

另外,再搭配新推出的Scale-In加速网络基础设施、NVLink Fusion开放互联框架,整套全栈体系已经形成了覆盖计算、网络、加速、开放互联的完整闭环。

目前整套Vera Rubin生态还在快速迭代中,后续和NVL72平台配对还会解锁更多模型优化、性能跃升的新能力。

本文转自媒体报道或网络平台,系作者个人立场或观点。我方转载仅为分享,不代表我方赞成或认同。若来源标注错误或侵犯了您的合法权益,请及时联系客服,我们作为中立的平台服务者将及时更正、删除或依法处理。

评论
暂无用户评论