
OpenAI、Meta、微软等企业纷纷推出自研人工智能专用芯片(XPU),这让不少人开始质疑英伟达对市场的掌控力。毕竟,如果各家都在自研芯片,还有谁会采购这家“AI军火商”赖以发家的图形处理器(GPU)?
但英伟达丝毫没有为此担忧,反倒向竞争对手抛出橄榄枝,邀请它们获取自家芯片知识产权的授权,尤其是高速互联相关技术。
周一,联发科成为最新一家选用英伟达NVLink Fusion高速互联技术、用于其刚起步的数据中心XPU产品的厂商。作为交换,英伟达将向联发科发行的可转换债券投资35亿美元。同时,这家GPU巨头还会继续在未来的DGX以及RTX Spark系列产品中,采用这家中国台湾芯片厂商的自研芯片方案。
上个月我们就曾分析过联发科布局数据中心芯片的野心。而这家以Arm架构手机、平板处理器闻名的厂商,只是众多计划接入该项技术的知名芯片企业之一。亚马逊、富士通、高通、安谋、迈威尔科技都在合作名单之上。
NVLink Fusion脱胎于英伟达GPU高速互联技术,于去年年初正式商用。最初这项技术分为两个版本:芯片直连(C2C),能够在内存一致性架构下实现CPUGPU(或XPU)互连;还有交换互联架构,可将多颗加速芯片拼接成一整个机架级的大型逻辑芯片。时至今日,它已经升级为英伟达对外输出半导体知识产权的综合性授权方案。博通等厂商耗费多年才研发出能够对标NVLink的竞品。因此联发科这类企业选择付费授权该技术,而非从零自主研发,或是依靠普通以太网搭载UALink这类替代互联方案,也就不足为奇了。
拿到NVLink Fusion授权之后,芯片厂商便可以专心打磨高性能加速芯片,不必再为大规模落地后的算力扩展难题费心。
与此同时,英伟达MGX机架方案属于开放计算项目(OCP),因此联发科及其合作伙伴不仅能用上英伟达成熟的算力扩展互联技术,还可以直接在现成的NVL72机架内插入自家的计算刀片。这将大幅降低从芯片流片到搭建完整AI机架,所需要的系统设计与硬件工程门槛。
这并非纸上谈兵。亚马逊就已经在自家Trainium系列AI加速芯片上落地了这套方案。此前报道提到,亚马逊去年推出基于Trainium3的机架系统时,就采用了英伟达MGXNVL72参考设计。而预计今年晚些发布的Trainium4芯片,则会放弃亚马逊自研的NeuronLink互联技术,转而使用NVLink Fusion。
英伟达为何愿意让竞品芯片厂商借力自己耗费巨大代价研发出来的互联技术?它得到的回报远不止授权费:这更是一种绑定客户、带动其余硬件产品销售的手段。
NVLink Fusion刚发布时,合作客户有两种搭配方案:可以把自家XPU搭配英伟达CPU,或是自家CPU搭配英伟达GPU。而如果想要发挥这套互联技术的大规模算力扩展能力,客户还必须采购英伟达NVSwitch交换芯片。也就是说,除了技术授权收入,英伟达还存在可观的硬件销售空间:每搭载两颗合作厂商的XPU,就有机会卖出一颗Grace或者Vera系列CPU;每72颗加速芯片,最多可配套9块NVSwitch交换芯片——这还仅仅只是单机架内的硬件。
既然已经用上了NVLink,客户很自然就会继续采购英伟达的InfiniBand,或是SpectrumX以太网设备,将一个个机架互连起来,支撑更大规模大模型的训练与推理业务。英伟达后续放宽了限制,如今仅依靠NVSwitch硬件销售收入加上NVLink Fusion授权费就已经满足其预期。如若不然,亚马逊就无法实现Graviton处理器与Trainium加速芯片的搭配使用。
英伟达高性能计算与AI超大规模基础设施高级总监迪翁·哈里斯于周一向媒体表示:“该平台最大的优势就是灵活、通用,可以适配客户各式各样的现有环境。厂商基于NVLink Fusion平台,可以按需选用全套技术栈:从CPU、GPU,到机架内算力扩展互联架构,再到依托SpectrumX与InfiniBand实现跨机架大规模组网;还能搭配DPU芯片完成南北向存储管理以及安全隔离。我们技术栈内五种不同的互联技术与拓扑方案,客户都能够通过NVLink Fusion获得使用权限。”英伟达暂未对外披露详细的授权收费模式,但哈里斯明确表示这项技术不会免费开放。
他说道:“英伟达NVLink Fusion属于英伟达自研技术,因此可以确定合作方需要支付相应授权费用。”
得益于AI浪潮,英伟达如今已是全球最大的数据中心以太网设备供应商。其单季度网络硬件营收现已突破150亿美元,而NVLink Fusion授权业务以及配套NVSwitch的销量增长,还将进一步拉高这项收入。但英伟达的知识产权版图远不止于此。
上周,英伟达公布了一项全新的知识产权产品:NVHBM,本质是一款集成内存控制器的专用基底芯片。据英伟达介绍,采用该方案后,芯片核心可以多出25%的面积用于算力运算,高带宽内存(HBM)功耗下降15%,有效带宽提升30%。
亚马逊旗下安纳普尔纳实验室,将率先在Trainium系列AI专用芯片上落地NVHBM。虽然亚马逊选用NVHBM对英伟达而言是一场重大胜利,但这项技术并非英伟达独有。据我们了解,博通、迈威尔也在研发功能相近的基底芯片方案。不过该案例也再次证明,英伟达正依靠强大的工程研发实力,从所有AI相关产业链环节赚取收益,哪怕是其他厂商自研的专用AI芯片,也能成为它的收入来源。
现阶段英伟达对外开放的知识产权项目品类尚且有限,但不难预见,在不远的将来英伟达会和博通这类竞争对手、联发科与迈威尔这类合作伙伴,在XPU芯片设计赛道展开正面较量。
后续局势演变之下,英伟达、博通、迈威尔、联发科很有可能变成亦敌亦友的关系。对博通、迈威尔而言,自研XPU芯片已是一门体量庞大的生意。但支撑芯片算力横向扩展所需的互联技术、以及推向市场必备的整套机架系统设计方案,依旧是英伟达手里一张王牌。
诚然,博通与迈威尔都有性能足以对标NVSwitch的以太网交换设备。即便如此,厂商仍然需要把交换机硬件整合进整套机架系统。而一块自研计算刀片插入通用NVL72机架就能开箱即用,这一优势很难被取代。
就算英伟达损失一部分交换机订单,只要NVLink Fusion能够帮助XPU芯片厂商卖出更多自研芯片,最终英伟达依旧可以收获净收益。英伟达显然十分清楚:如今自研专用芯片的门槛已经大幅降低,但如何把芯片算力高效扩展,依旧是最难攻克的一关。
本文转自媒体报道或网络平台,系作者个人立场或观点。我方转载仅为分享,不代表我方赞成或认同。若来源标注错误或侵犯了您的合法权益,请及时联系客服,我们作为中立的平台服务者将及时更正、删除或依法处理。
