Arm 正在将下一代 Neoverse CSS N4 平台推向云端:基于台积电 N3P 工艺打造,单晶粒最多集成 128 个核心。
Arm 的计算子系统(Compute Subsystem,简称 CSS)是一个半定制项目,允许客户基于 Arm 的 IP 设计芯片,按需配置核心数量、缓存容量、I/O 与互联等组件。从 Azure、谷歌云的 CPU,到英伟达和英特尔的 DPU,我们在各种产品中都能看到这一平台的身影。
Arm 表示,Neoverse CSS N4 支持 8 至 128 个 Neoverse N4 核心,最高频率 3.8GHz。可以推测,随着核心数增加频率会相应下调,但 Arm 没有说明各配置下的最高频率。在系统层面,Neoverse CSS N4 可以扩展到 128 核以上,支持多芯粒与多路插槽设计,通过芯粒间互联支持 UCIe 标准,同时支持“合作伙伴专属 PNY”。该平台支持 DDR5 或 LPDDR6 内存,单晶粒最多配备 256MB L3 缓存;本地缓存方面,每核最多 2MB L2,以及 64KB L1 指令缓存和 64KB L1 数据缓存。I/O 方面,支持最多 128 条 PCIe 7/6 通道和 CXL 4.0。
相比 Neoverse CSS N2 平台,这是一次显著升级,N2 最多只有 64 核、每核 1MB L2 缓存、64MB L3 缓存,搭配 DDR5 或 LPDDR5 内存和 64 条 PCIe 5.0/CXL 通道。
Arm 称,在 128 核、3GHz 运行、每核 2MB L2 的配置下,Neoverse CSS N4 的插槽性能是 Neoverse N3 的两倍,每瓦性能提升 1.25 倍,内存带宽提升 1.75 倍。

Arm 的 N 系列核心针对每瓦性能优化,V 系列核心则追求极致性能。Arm 自己的 AGI CPU 就使用了 Neoverse CSS V3 的构建模块,英伟达上一代 Grace CPU 采用 Neoverse V2(Vera CPU 使用的是定制核心);AWS 的 Graviton 芯片和谷歌云的 Axion 也都采用 Neoverse V 系列核心。N 系列核心通常不用于高性能 CPU,而是出现在性能定位较低的加速器中,比如英特尔基于 Neoverse N1 核心的 IPU Adapter E2100;也见于负载要求不那么高的云端场景,比如微软基于 Neoverse N2 的 Azure Cobalt 100——Cobalt 200 则已转向 Neoverse V3。
代号Dionysus的 Neoverse N4 核心目前公开信息不多。Arm 2024 年的路线图显示,Neoverse CSS V4(代号 Vega)也会推出。与英特尔、AMD 或 Arm 各合作伙伴的传统发布不同,Neoverse N4 核心短期内不会出现在市面产品中。这次发布面向的是基于 CSS 平台做开发的客户,他们利用 Arm 预先验证的构建模块,快速打造半定制芯片。Arm 尚未公布任何合作伙伴,但按惯例,CSS 只需要少数几个大额合同即可。

在发布 Neoverse CSS N4 的同时,Arm 还披露了其自研 AGI 芯片的新增部署情况,该芯片基于 Neoverse V3 核心构建。甲骨文和字节跳动将部署 AGI 芯片,此前已公布的部署方包括 Meta、联想、SAP、OpenAI、Cloudflare 等。
尽管 Arm 对 AGI 谈了很多,包括在 Hot Chips 上深入介绍过芯片架构,但至今没有看到实际性能数据。这在较新的 Arm 架构芯片中并不罕见,比如微软 Azure Cobalt 200 和 AWS Graviton5,公开信息也只有代际对比数据。Arm 对性能的表述相当模糊,只称 AGI“相比最新 x86 系统,每机架性能提升两倍以上”,且该说法基于内部估算而非实际基准测试。
AGI 是一款双晶粒 CPU,最多集成 136 个 Neoverse V3 核心、最多 272MB L3 缓存,频率最高 3.7GHz;采用 3nm 工艺节点,单芯片内存容量最高 6TB,速率可达 DDR5-880。与 AMD、英特尔最大的不同,或许是 Arm 决定把内存和 I/O 与计算放在同一晶粒上,据称由此实现了低于 100ns 的内存延迟。这是 Arm 首次尝试自研量产芯片,但它目前的定位仍是一块试验田,用于拓展 Arm 在数据中心的更广泛应用。微软、英伟达、Meta、谷歌云等厂商都在基于 Arm IP 打造定制芯片,即便有了 AGI,这看起来仍然是 Arm 的首要目标。
本文转自媒体报道或网络平台,系作者个人立场或观点。我方转载仅为分享,不代表我方赞成或认同。若来源标注错误或侵犯了您的合法权益,请及时联系客服,我们作为中立的平台服务者将及时更正、删除或依法处理。
