
据报道,苹果正在开发基于自家 M 系列处理器的 AI 服务器,并正在评估用 NVLink Fusion 技术作为互连方案。报道称,这批机器预计将采用 M8 Ultra 处理器,并于 2029 年问世。目前,采用 NVLink Fusion 平台一事尚未正式敲定,苹果与 Nvidia 也均未确认。但如果苹果选择它、而非竞争方案,其市场影响将远不止“苹果用上了 Nvidia 的硬件”这么简单。
据报道,苹果正考虑至少两种服务器配置:一款配备两颗 M8 Ultra 处理器的小型机器,以及一款配备四颗 M8 Ultra 系统级芯片(SoC)的高端版本。尽管苹果自有 UltraFusion 技术,能把两颗高端 SoC 无缝缝合在一起,但该公司似乎缺乏一套合适的方案来处理其处理器的纵向扩展(scale-up)与横向扩展(scale-out)连接,而这正是 Nvidia 的 NVLink Fusion 登场的地方。
显然,苹果想在其服务器上使用 NVLink 基础设施,它不仅是一套互连协议,还包括交换机、用于增添 NVLink 连接能力的芯粒(chiplet)以及软件栈。据悉,该项目大约在一年前启动,并得到了当时执掌苹果硬件工程部门的 John Ternus 的支持。
报道称,苹果已为 Private Cloud Compute 自建服务器,用于处理那些对 iPhone 和 Mac 本地执行而言过重的 AI 工作负载。这些机器大多采用苹果内部开发的连接技术,据称该技术对大规模商用部署来说过于缓慢且成本过高,这正是苹果把目光投向外部的原因。
苹果有对“适合大规模部署的连接技术”的需求,但尚不明确是哪类连接,如果是把多台服务器连成更大的集群,那通常应是 Ethernet 或 InfiniBand 这类横向扩展技术的职责,而非 NVLink 这种纵向扩展的互连架构。
Nvidia 最初开发 NVLink 互连架构建,是为了纵向扩展其加速器的性能,因此该技术针对加速器到加速器的连接做了优化,能让一整个机架的 Nvidia GPU 像一个紧耦合的计算域那样协同工作。另有一种不同的实现叫 NVLink-C2C,是一种一致性芯片到芯片接口,用于把 CPU 连接到加速器、以及 CPU 到 CPU 的连接。
与此同时,现代的苹果 M Pro 与 M Ultra 处理器属于系统级封装(SiP),由一颗 CPU 芯粒和一颗 GPU/神经引擎芯粒组成,两者通过台积电的 SoIC-mH 技术缝合在一起。如果苹果继续沿用这一架构(可能性很大),那么一颗 M8 Ultra 处理器既可被视为 CPU,也可被视为加速器。不过,这也引出一个问题:苹果打算如何把 M8 Ultra 处理器接入 NVLink,以及 SiP 中的哪些组件会参与到 NVLink 域中。
一种可能是,苹果通过一颗 NVLink Fusion 芯粒,把 M8 Ultra 的加速器部分暴露给 NVLink——这实际上意味着苹果把它当作纵向扩展域中的一颗加速器来对待。另一种可能是,苹果正为其服务器开发一套不同的加速器架构,比如干脆把 GPU/NPU 芯粒放到一块独立的基板/中介层上,并为它配备自己的内存——不过目前还没有证据能证实这款离问世还有数年的芯片会采用这样的设计。
还有一点需要留意:苹果是 UALink Consortium 的成员,该组织负责制定行业标准的 UALink 加速器到加速器互连,最高支持 1024 颗加速器。虽然眼下可选的 UALink 交换机还比较有限,但到 2029 年,市面上将出现提供不同性能与能力的行业标准交换机,这也让“选择 NVLink 作为纵向扩展架构”显得更加耐人寻味。
一种可能的解释是,苹果感兴趣的远不止 NVLink 本身。NVLink Fusion 是 Nvidia 机架级与数据中心基础设施架构的一部分,它能将 NVLink 的纵向扩展连接,与 Nvidia 的 Spectrum-X Ethernet 或 Quantum-X InfiniBand 横向扩展网络组合在一起,其中还包括配备共封装光学(co-packaged optics)的交换机。因此,苹果有可能同时采用 Nvidia 的技术来承担纵向与横向扩展连接,而不必自研一整套数据中心网络栈。目前这还只是推测,但这样的做法实际上意味着:苹果正围绕 Nvidia 数据中心架构的相当一部分来构建 AI 服务器,同时保留自家处理器、且不使用 Nvidia 的加速器。
若果真如此,这将成为一项佐证——无论在用的是哪家的 AI 加速器与 CPU,Nvidia 如今都在为 AI 数据中心制定事实上的标准。
毫无疑问,Nvidia 是数据中心硬件领域的领先供应商,因此如果两家公司确实在苹果的数据中心平台上携手合作,那么苹果与 Nvidia 联手也是合乎逻辑的。
但苹果与 Nvidia 并算不上什么好搭档。两家的恩怨始于本世纪初,当时史蒂夫·乔布斯指控 Nvidia 侵犯了皮克斯的专利,Nvidia 则回应称自己拥有的图形 IP 比皮克斯更多、反过来可以起诉对方。此后,苹果与 Nvidia 又围绕后者供应的 GPU 设计决策产生过分歧。接着便是“Bumpgate”事件——Nvidia 在 2007 至 2008 年间向苹果及其他 PC 厂商供应了有缺陷的 GPU,既未承认问题,又抗拒足额赔偿苹果等 PC 厂商的维修费用,也正是从那时起,双方的关系变得格外紧张。
苹果继续使用 Nvidia 的 GPU 直到 2014 或 2015 年,随后转投 AMD 的 Radeon,最终彻底放弃了第三方独立 GPU。而最近,苹果又重新开始使用 Nvidia 的硬件。最新的 Siri AI 主要由 Apple Foundation Models 驱动,这套模型是与 Google 合作、基于 Gemini 技术开发而来。服务端推理通过苹果的 Private Cloud Compute 架构运行,其中不少工作负载就托管在 Google Cloud 的 Nvidia Blackwell GPU 上。不过,在云端使用 Nvidia 的硬件,与为自己的平台采纳其技术,是两回事。
本文转自媒体报道或网络平台,系作者个人立场或观点。我方转载仅为分享,不代表我方赞成或认同。若来源标注错误或侵犯了您的合法权益,请及时联系客服,我们作为中立的平台服务者将及时更正、删除或依法处理。
