过去很长一段时间,大众聊AI算力,几乎都将目光聚焦在GPU上,似乎谁的GPU更多谁就能赢,而CPU只充当简单辅助调度的配角。但随着智能体AI(Agentic AI)快速落地,行业正在迎来一个颠覆性变化:真正的性能瓶颈,悄悄转移到了CPU身上。
2026年5月,英伟达超大规模与高性能计算副总裁Ian Buck亲自带队,将首批NVIDIA Vera CPU系统交付给Anthropic、OpenAI、Oracle Cloud Infrastructure和SpaceXAI四大顶级AI实验室。由此,英伟达首款专为智能体AI设计的CPU正式从发布走向生产。
现如今,官方又公布了更详细的架构规格,这标志着英伟达在构建“AI工厂”基础设施上完成了关键拼图,正式确立了CPU在智能体AI时代的核心地位。
过去几年,AI产业的发展逻辑被深度绑定在GPU这个单一硬件维度上。市场普遍形成了一种共识:无论是大模型的预训练,还是后续的推理部署,GPU被视为解决所有算力瓶颈的万能钥匙,其地位近乎于AI时代的“硬通货”。
然而,随着产业进入2026年,这种“GPU中心主义”的叙事正在发生结构性松动与重构:在智能体工作流中,GPU确实承担着大模型的计算负载,但真正的瓶颈往往不在GPU,而在CPU上。
当AI代理调用外部工具、管理执行顺序、协调数据流动、处理上下文检索时,这些任务全部落在CPU身上。如果CPU处理速度跟不上,昂贵的GPU就会陷入“等数据”的空转状态——这就是英伟达从头设计CPU的根本原因,不是为了跟英特尔、AMD抢传统服务器市场,而是补上智能体AI时代算力体系最关键的那块短板。
于是,NVIDIA Vera CPU应运而生。

Vera CPU不仅是一款独立的处理器,更是英伟达极致协同设计(Co-Design)理念的集大成者,其技术细节揭示了针对智能体工作负载的深度优化。
根据官方公布的详细架构规格,Vera采用88颗自研Olympus核心,支持176线程。和当下主流的芯粒(Chiplet)方案不同,它选用单片计算裸片,把核心、缓存、内存控制器、一致性互联、I/O 全部集成在同一块芯片内,避免跨芯粒通信带来的延迟与性能波动。芯片搭载164MB三级缓存,搭配第二代可扩展一致性互联架构,提供3.4TB/s的对分带宽,保证多核心处理海量数据集时,不会出现内部传输瓶颈。
Olympus核心是一款宽幅乱序执行架构,每个周期最多可取16条指令、解码10条指令,搭配大容量分支预测器、64KB指令缓存、96KB数据缓存,每个核心独占2MB二级缓存。这套硬件配置专门针对Python运行、程序编译、代码分析、数据库、事件仿真、浏览器自动化这类不规则的CPU负载做深度优化,这些恰恰都是智能体AI高频使用的任务。
除了上述规格,Vera的另一大亮点是空间多线程技术。传统同步多线程,两个线程会抢夺硬件资源,容易出现“邻居干扰”,高负载下单核性能会明显下滑。而Vera直接把关键硬件资源在两个线程之间做硬性划分,牺牲一部分资源共享能力,换来性能隔离与运行结果高度可预测。官方数据显示,高负载下Vera单核性能几乎维持100%,对比传统CPU仅剩余67%的性能表现。预生产版本SPEC CPU测试中,Vera性能相比传统CPU提升1.2‑1.8倍,Python、GCC、LLVM、代码分析类任务收益最为突出。
至于内存子系统,同样走出了不一样路线。Vera没有采用常规DDR5内存,转而使用数据中心级LPDDR5X‑9600,单颗处理器最高支持1.5TB SOCAMM LPDDR5X内存,内存带宽可达1.2TB/s。官方数据显示,它每瓦能提供的内存带宽,是多款DDR5配置的五倍。既给每一颗核心充足的数据供给,又降低内存搬运带来的功耗,让芯片在高负载下依旧可以稳住运行频率。
Vera的外部互联能力也是拉满,芯片裸片外总带宽达到4.3TB/s。依靠NVLink‑C2C一致性接口,CPU和Rubin GP之间可以实现1.8TB/s高速互通;同时支持PCIe Gen6与 CXL3.1,带宽256GB/s,保障GPU、内存、存储、网络源源不断拿到待处理任务。在完整的Vera Rubin NVL72整机系统中,36颗Vera CPU,就负责驱动72块Rubin GPU,实现CPU‑GPU大规模协同。
另外,安全层面也不再局限单颗芯片内部。Vera内置机密计算可信执行环境、内存加密、受保护I/O,CPU与GPU之间一致性通信全部附带安全校验。配合BlueField数据处理单元与DOCA软件栈,安全防护直接覆盖整个机架,而非仅仅局限于处理器内部,满足智能体复杂业务的数据安全诉求。
黄仁勋对Vera寄予了厚望,他在财报会上透露,Vera将开启一个价值2000亿美元的市场,预计本财年末Vera收入将达到200亿美元,有望成为英伟达“第二大销售贡献者”。他甚至放话:“目前的订单量已注定它将成为公司历史上最快速、最成功的产品发布。”
智能体AI的完整链路,模型生成Token只是其中一步,智能体还需要解读输出结果、运行程序、调取上下文、对接各类服务、执行合规管控。整套流程环环相扣,只要CPU环节拖慢速度,整套系统就会卡顿,GPU算力再强也无从发挥。
因此,Vera的深层意义,并不只是一颗性能更强的CPU。英伟达跳出单独优化GPU的思路,开始做整套AI工厂的协同设计。自研核心、确定性多线程、高能效高带宽内存、CPU‑GPU高速一致性互联、机架级安全防护,把CPU视作决定AI整体性能的核心组件。
从卖GPU芯片到卖GPU+CPU整套系统,从硬件供应商到打造全栈AI工厂解决方案,英伟达的垂直整合正在一步步落地。当老黄把CPU这块最后短板也补上,未来的AI基础设施格局,可能真的要重新改写了。
本文转自媒体报道或网络平台,系作者个人立场或观点。我方转载仅为分享,不代表我方赞成或认同。若来源标注错误或侵犯了您的合法权益,请及时联系客服,我们作为中立的平台服务者将及时更正、删除或依法处理。
