英伟达Vera CPU是英伟达首款采用自研核心架构的CPU。过去几个月,受Agentic AI需求推动,服务器CPU市场正在快速膨胀。
Vera并非要从AMD和Intel手中抢夺现有云市场份额,而是瞄准一个正在扩张的新兴市场——超大规模云厂商正在将AI基础设施拓展至传统云之外。因此,Vera的设计思路与英伟达的x86竞争对手截然不同,甚至在与一众Arm架构方案的对比中也具备独特的架构特征。
随着Vera向今年下半年正式上市逐步推进,英伟达陆续披露了更多细节。英伟达发布了Vera白皮书,并附带了一份非官方的SPEC CPU 2026基准测试结果,将Vera与AMD基于Turin架构的Epyc 9755进行了对比。
本文将拆解白皮书中的技术细节,包括Olympus核心架构以及英伟达运行的基准测试。
在Vera白皮书中,英伟达分享了SPEC CPU 2026的测试结果,具体是SPECrate整数测试套件,对比对象为AMD Epyc 9755,两颗芯片均采用双路配置。在深入结果之前,需要先说明SPEC测试的运行方式和报告标准的一些重要背景。
英伟达此次的测试并非官方结果。由于Vera尚未广泛上市(计划今年下半年正式发布),测试在参考平台上进行,因此英伟达无法正式提交结果。这就是部分图表中标注"估算值"的原因。值得注意的是,英伟达实际运行了SPEC CPU 2026,而非像AMD目前对待即将推出的Venice芯片那样进行外推预期。
SPEC CPU 2026分为四个套件,英伟达测试的是SPECrate整数套件,专注于基于整数工作负载的系统吞吐量。"Rate"结果衡量的是在特定时间内完成多少工作量。测试中系统每个线程运行一份工作负载副本,得分为这些工作负载完成所需的时间,线程数更多的芯片天然具有优势。
以下是整体结果:

英伟达未公布所测9755的具体分项结果,仅透露总体得分为898。以此计算,Vera领先9755约3%。值得注意的是,Vera在核心线程数处于劣势的情况下仍取得了领先。双路Epyc 9755系统898的总体得分与公开提交的SPEC CPU 2026结果相比并不离谱,尽管已有更高的成绩被公布。SPEC CPU以源代码形式发布,测试者需使用自选编译器编译,这会对结果产生重大影响(尤其是使用厂商专用编译器时)。英伟达在两个系统上均使用GNU 15.2编译器。

上图为Vera与9755的对比,但并非直接数值比较。英伟达对每核心性能进行了归一化处理,这并非SPECrate结果的标准呈现方式。根据总体数值,Vera在相同时间内完成的工作量仍然更多,尽管线程数处于劣势,但领先幅度并非上图暗示的70%或80%。
仅凭英伟达提供的信息,无法反向推算Epyc 9755的各项得分。英伟达表示:"满载插槽下的每核心性能非常重要,因为Agentic AI和强化学习会并发运行多个沙箱,而每个Agent步骤仍然是顺序执行且对延迟敏感的。该指标衡量的是每个核心在共享电源、内存、缓存和互联架构资源竞争中所维持的性能。因此我们按物理核心进行归一化,两个系统均启用SMT。"
英伟达在此标注的"Agentic"工作负载主要是代码编译和解释类任务——这正是AI Agent常做的事情:查询代码仓库依赖并编译源代码。接下来是数据科学工作负载(或称探索性数据分析),再往下是SQLite数据库管理等数据处理类工作负载。这些结果与英伟达对Vera的整体定位一致:在数据密集型后端操作中表现出色。
虽然英伟达分享的是每线程结果,但坚持认为SPECrate仍是正确的测试方式。此处的每线程结果是在满载插槽的上下文中呈现的。白皮书中的解释如下:"这一指标对Agentic AI和强化学习系统具有重要意义,这些系统中许多沙箱、工具和环境并发运行,而非作为孤立的单线程测试。满载每核心性能衡量的是每个核心在共享插槽级电源、内存带宽、缓存和互联架构资源时维持吞吐量的能力。"





除了运行工作负载,英伟达还分析了代码执行情况以获取架构级基准数据,如上图所示。英伟达声称:相比Turin,IPC总体提升最高达1.9倍,每周期分支预测数提升最高2.3倍,已执行分支数提升最高3.5倍,每周期指令取指操作数提升最高2.4倍。

除SPEC之外,英伟达还分享了几项突出Olympus核心能力的基准测试。首先是PageRank——谷歌最初用于网页排名的算法,能够充分体现Olympus预取引擎的能力。英伟达将此工作负载扩展到更高核心数量,结果显示Vera在扩展到32核时仍保持大部分单核性能,而Turin芯片在20核左右即遇到瓶颈。
此外,英伟达还分享了一些Vera内存系统与Turin的对比测试。这些微基准测试适合验证英伟达的规格参数,但反映的是架构性能而非应用性能。架构优势会转化为性能优势,但转化方式并非总是线性或可预期的。
英伟达内存测试使用的是内部开发的工具,但已在GitHub上开源供任何人运行。

首先是加载内存延迟测试,随着带宽使用增加对内存子系统施加压力。Vera的整体带宽明显更高,但可以看到Turin芯片在达到最大带宽之前就遭遇了延迟墙——英伟达将此归因于非一致性内存访问(NUMA)域遍历和CCD间通信延迟。

在每核心带宽方面,英伟达声称Vera提供的带宽是AMD 9755的四倍以上。言下之意是"真实世界"每核心带宽甚至比英伟达的规格参数更好。

最具实质意义的测试是上图的核间延迟测试。众所周知,AMD基于Chiplet架构的芯片在跨CCD通信时会产生较大的延迟惩罚。在我们的Ryzen 9 9950X3D评测中也能看到这一现象,而且随着CCD数量增加,延迟惩罚会叠加。
公平地说,基于Chiplet的设计本身就不是为跨CCD遍历优化的,其设计理念是让工作负载尽量本地化,优化核心密度。Vera的设计目标显然是在整个芯片上保持延迟一致性,为此牺牲了核心密度。英伟达Ian Buck在我们近期访问英伟达总部时表示,这一设计取舍"将以传统工作负载为代价"。
这一背景至关重要。英伟达并非要抢夺AMD和Intel现有的市场份额,而是在一个扩张中的市场里抢占地盘——赶在AMD和Intel之前。包括摩根士丹利和美国银行在内的一些金融机构预测,到2030年服务器CPU市场规模可能翻倍甚至更大。这一背景之所以重要,是因为市场对Vera未能优化的工作负载仍会持续存在需求。AMD和Intel将如何应对这一动态——既要守住传统客户基本盘,又要进军扩张后的新市场——值得关注。
英伟达对扩张后的市场有着清晰的愿景。为此,英伟达并未公布SPEC CPU浮点测试结果。推测原因在于SPEC的向量化套件主要面向HPC工作负载,而英伟达聚焦于其认为关键的基于整数的Agentic工作负载。Vera确实配备了支持SVE的向量引擎,但这似乎并非英伟达的重点。
在端到端的英伟达系统中,这些向量化工作负载将被卸载到Rubin GPU上。不过,我们目前仍未看到Vera的任何向量测试结果。
本文转自媒体报道或网络平台,系作者个人立场或观点。我方转载仅为分享,不代表我方赞成或认同。若来源标注错误或侵犯了您的合法权益,请及时联系客服,我们作为中立的平台服务者将及时更正、删除或依法处理。
