Amazon再加码英伟达,300万GPU背后还有更大的算盘

来源:半导纵横发布时间:2026-08-27 11:52
GPU
亚马逊
英伟达
生成海报
Amazon一边加码英伟达GPU,一边继续推进自研芯片,AWS正在把不同路线的AI算力装进同一个平台。

AWS与英伟达再次扩大合作。

双方宣布,AWS将在2027年至2028年新增部署200万块英伟达GPU,使此前已经宣布的100万块GPU计划进一步扩大至300万块。与此同时,合作范围也从GPU进一步延伸到CPU、内存、网络、开放模型、数据处理和机器人等多个环节。

这不只是一次GPU扩容,更意味着英伟达正在进一步进入AWS的整套AI基础设施。

200万块GPU,需求已经超过预期

今年3月的GTC大会上,AWS曾宣布计划从2026年开始部署超过100万块英伟达GPU。如今仅过去几个月,双方又追加200万块,新增GPU将包括Blackwell Ultra、Rubin和Rubin Ultra,并部署到AWS全球基础设施中。

AWS表示,自3月公布计划以来,客户需求已经超过此前预期。随着AI工作负载从试验阶段进入生产阶段,算力需求也正在从模型训练和推理,进一步扩展到智能体AI、科学计算、企业自动化和物理AI等场景。

从规模来看,这已经是一笔相当可观的订单。两家公司没有公布具体财务条款,但考虑到GPU的价格和部署规模,这笔交易的价值预计达到数百亿美元。

其中,还有10万块GPU将用于AWS与英伟达面向美国政府建设的AI工厂,为联邦政府和国家安全相关工作负载提供安全算力,并支持Impact Level 6(IL6)及以上安全等级的应用。

但Amazon并没有放弃自研芯片

如果只看新增的200万块GPU,很容易认为Amazon正在进一步加深对英伟达的依赖。

但实际上,Amazon自己的芯片路线并没有改变。Amazon一直在发展Trainium等自研芯片,希望为AWS客户提供不同于英伟达GPU的AI计算选择。这次合作扩张同样强调,NVIDIA计算平台将与Amazon自研芯片形成互补。

也就是说,Amazon并不是在Trainium和NVIDIA GPU之间二选一,而是希望两条路线同时推进:一方面继续扩大NVIDIA GPU在AWS中的部署规模,另一方面继续发展自己的Trainium。

这一点从Trainium与NVIDIA技术的进一步合作也能看出来。此前,AWS已经宣布下一代Trainium将支持NVIDIA的NVLink Fusion高速芯片互连技术。此次双方又进一步合作,让Amazon旗下Annapurna Labs将NVLink Fusion与NVIDIA新推出的定制高带宽内存NVHBM结合起来,为Trainium提供更快、更高能效的内存。

通过这套组合,Trainium可以利用NVIDIA的定制内存和扩展架构,并让Trainium与NVIDIA GPU在共同的机架级架构中进行集成。

所以,这次合作并不是简单的“Amazon买了更多英伟达GPU”。更准确地说,Amazon继续发展自研芯片,而AWS则同时为客户提供NVIDIA GPU和Trainium等不同的计算选择。

英伟达Vera CPU也来了

此次合作还有一个明显变化,英伟达Vera CPU也将进入AWS。

过去几年,AI基础设施的关注点主要集中在GPU,但随着智能体AI发展,一个完整的AI任务并不只是GPU计算,还涉及通用计算以及不同环节之间的处理,因此CPU的重要性也开始上升。

AWS和NVIDIA目前正在合作,将基于Vera CPU的基础设施带到AWS,用于需要高性能CPU计算、同时又需要加速计算能力的智能体AI工作负载。

而按照英伟达CFO Colette Kress的说法,未来Vera既会有与Rubin集成的版本,也会有独立部署的版本。这意味着英伟达与AWS的合作正在从GPU进一步扩展到CPU,双方合作的范围也越来越接近完整的数据中心计算平台。

GPU之外,网络和内存也被纳入

随着AI集群规模不断扩大,单颗GPU的性能已经不是唯一决定因素。

大量GPU需要通过高速网络连接起来,内存也必须提供足够的带宽,否则计算资源很难充分发挥。因此,此次合作还涉及NVIDIA Spectrum网络、NVLink Fusion以及NVHBM等技术。

其中,NVLink Fusion负责高速芯片互连,NVHBM则面向AI工作负载提供定制高带宽内存。AWS希望通过这些技术,让Trainium和NVIDIA GPU能够在共同的机架级架构中进行协同。

双方还将继续把NVIDIA GPU和Trainium实例建立在AWS Nitro System之上,并通过Elastic Fabric Adapter(EFA)进行互连,以提升安全性、可靠性和网络性能。

换句话说,NVIDIA这次进入AWS的已经不只是计算芯片,而是在逐步进入计算、互连、内存和网络组成的整个AI基础设施。

模型和数据处理也开始整合

双方的合作还继续向软件层延伸。

AWS将继续在Amazon Bedrock和Amazon SageMaker上提供NVIDIA Nemotron系列开放模型。对于AWS客户来说,这意味着可以直接在AWS现有的模型服务体系中使用NVIDIA的开放模型。

在数据处理方面,AWS与NVIDIA还将利用cuDF和cuVS等CUDA-X库,加速Amazon EMR的数据处理以及Amazon OpenSearch的向量索引。

AWS表示,在特定工作负载下,基于Amazon EC2 G7实例和NVIDIA cuDF的数据处理速度最高可达到CPU方案的3.7倍,同时价格性能提升30%;而GPU加速的向量索引最高可以实现9倍的速度,并将成本降至原来的四分之一。

这也说明,AI基础设施的需求已经不只是“给模型更多GPU”。随着AI应用进入生产环境,数据处理、ETL、实时分析、向量数据库和检索同样会成为系统的一部分,AWS和NVIDIA正在把合作从计算环节向这些周边环节延伸。

Amazon的机器人也用上NVIDIA

合作甚至延伸到了Amazon自己的机器人业务。

Amazon Robotics正在与NVIDIA合作开发下一代机器人,并将集成NVIDIA Jetson平台、NVIDIA Omniverse库和NVIDIA Isaac开放式机器人开发平台,用于机器人仿真、合成数据生成、机器人训练、路径优化、功能安全以及真实环境验证。

对于Amazon来说,这一点尤其重要。Amazon本身拥有大规模仓储和物流自动化业务,机器人已经被广泛用于仓库中的搬运、分拣和配送等环节。

因此,NVIDIA此次进入的不只是AWS的数据中心,也包括Amazon自身的机器人业务。

NVIDIA卖的,已经不只是GPU

如果把这次合作拆开来看,最值得关注的其实不是200万颗GPU,而是NVIDIA正在向整个AI基础设施平台扩张。

过去,云厂商购买NVIDIA GPU,核心是获得AI计算能力。现在,NVIDIA提供的已经包括GPU、CPU、网络、内存、开放模型、数据处理软件和机器人平台。

与此同时,Amazon也没有因此放弃自己的芯片路线。Amazon继续发展Trainium和Graviton等自研芯片,而AWS则将这些自研芯片与NVIDIA的互连、内存和软件体系连接起来。

对AWS而言,这种模式可以扩大客户的硬件选择,同时保留Amazon自研芯片带来的成本和架构控制能力;对NVIDIA而言,则意味着其影响力不再局限于GPU本身,而是进一步延伸到整个AI数据中心。

这场AI芯片竞争,已经越来越不像简单的谁取代谁,而更像是不同芯片、不同架构和不同基础设施之间的重新组合。

本文转自媒体报道或网络平台,系作者个人立场或观点。我方转载仅为分享,不代表我方赞成或认同。若来源标注错误或侵犯了您的合法权益,请及时联系客服,我们作为中立的平台服务者将及时更正、删除或依法处理。

评论
暂无用户评论