专家圆桌会议:某半导体专业杂志邀请Arm全球云计算与AI基础设施芯片负责人 Satadal Bhattacharjee、Axiomise CEO Ashish Darbari、Cadence杰出工程师 Moshiko Emmer、Expedera首席科学家 Sharad Chole、Siemens EDA HPC开发负责人 Cameron Brunner,以及Synopsys战略市场总监 Sumit Vishwakarma,共同探讨AI数据中心架构正在发生的变化。以下为讨论内容节选。

由左至右:LR:Arm 的 Bhattacharjee;Axiomise 的 Darbari;Cadence 的 Emmer;Expedera 的 Chole;Siemens EDA 的 Brunner;Synopsys 的 Vishwakarma。
Brunner: 我们看到,硬件厂商和大型系统集成商正在围绕网络互连方式构建解决方案,而软件则能够根据这些互连结构部署工作负载,从而最大程度提高互连资源的利用率。此前我们没有过多讨论超大规模云服务商(Hyperscaler),但他们实际上已经很好地实践了这些理念,因此用户可以在其平台上构建符合这种架构的运行环境。大多数云平台都提供了放置组(Placement Group)的概念,会将多个虚拟机(VM)部署在拥有高速互连的服务器上。这最终会成为一个非常重要的问题,因为一旦计算需要跨越不同的机器,如果希望随着应用增加更多机器而仍然获得接近线性的扩展能力,就会面临很大的挑战。
Chole: 这很大程度上取决于工作负载。我长期从事NPU和AI相关工作。随着模型规模不断增大,内存成了计算中需要有效利用的关键瓶颈之一,因此HBM(高带宽存储)的成本以及HBM的利用效率,对GPU而言都变得至关重要。模型中既有相对静态的部分,例如模型参数,也有动态的部分,也就是上下文(Context)。例如,系统需要记住多少内容、需要处理多少信息,这些都与你想要处理的请求数量息息相关。在边缘侧,这个问题相对简单,因为通常一次只会收到几个请求。但在数据中心层面,目标是尽可能提高整个API层面的利用率,因此真正关注的是每秒能够处理多少个请求。当把这些因素综合起来考虑时,就会涉及不同的并行化范式,例如张量并行(Tensor Parallel)、数据并行(Data Parallel)、上下文并行(Context Parallel)以及流水线并行(Pipeline Parallel),而每一种并行方式对网络拓扑都有不同的要求。流水线并行更像是数据从A点流向B点,而张量并行则需要执行All-Reduce操作,再将数据广播(Broadcast)回各个节点。因此,在定义整个集群时,必须充分考虑这些通信模式。这也是为什么当系统需要扩展到张量并行拓扑时,NVLink会成为非常重要的一部分。同样,存储之间的连接方式,以及内存数据传输方式,也都需要遵循类似的原则。
回到CPU的利用方式。随着越来越多工具调用(Tool Calling)运行在CPU上,以及这些工具本身的使用方式发生变化,Agent处理工作负载的方式也发生了改变,因此理解这些工具是如何执行的非常重要。例如,如果数据中心运行的是一个完全基于Agent的工作流,就必须对整个流程进行编排(Orchestrate)。从某种意义上来说,这类Agent工作负载更像是一个云管理问题,工具应用需要提前部署,MCP(Model Context Protocol,模型上下文协议)服务器必须保持响应能力。如果某种工作负载涉及大量API,那么对整个集群进行优化就会带来明显收益,因此我们需要综合考虑各种可能的并行化策略,以实现更大的系统规模。如何让系统从1块GPU扩展到8块GPU之后,仍然能够获得接近8倍的性能提升,始终都是一个巨大的挑战。
Bhattacharjee: 没错。我们目前看到的一个重要趋势,是NVIDIA率先提出的,也就是对推理流程(Inference Pipeline)的解耦(Disaggregation)。在推理过程中,通常包含几个不同的阶段。首先是 Prefill(预填充)阶段,即用户输入提示词(Prompt)后,系统首先需要理解用户究竟提出了什么问题,以便确定后续应该执行哪些操作。预填充阶段计算密集度极高。近期,NVIDIA发布了用于预填充集群的 Groq 3 LPU(Language Processing Unit,语言处理单元),这表明,完成这类任务已经不仅仅需要GPU。随后是解码(Decode)阶段,在这一阶段,系统真正执行推理任务,并生成最终展示给用户的回复。随着AI Agent的发展,又增加了一个新的阶段,即工具调用(Tool Calling)或任务执行。例如,预订Uber、酒店预订等实际操作,都属于这一阶段。
目前我们看到,推理流程正逐渐走向解耦。一个集群配备特定的软件和硬件,专门负责预填充阶段,另一个集群负责解码阶段;还有一个完全独立的计算集群,负责Agent执行各种任务。这些集群被整合在一起相互连接,目前大概率还是依靠以太网(Ethernet)进行通信。但每个集群都会采用不同的软件和硬件组合,以发挥自己最擅长的功能。未来,这将成为一种更加普遍的架构模式。过去,几乎所有AI问题都依赖GPU来解决。而现在,整个行业逐渐认识到,并不是所有问题都能靠同一把“锤子”,也就是GPU,来解决。GPU非常擅长矩阵计算等数学运算,但推理阶段的工作负载特征与训练完全不同,因此需要更加多样化的硬件。这种架构可以称为异构集群(Heterogeneous Cluster)。与此同时,软件也必须能够理解异构集群。这意味着软件层面将面临巨大的挑战,因为这些硬件往往来自不同的公司,软件必须确保能够无缝地调用每一种硬件,让它们各自发挥最适合的作用。NeoCloud公司也参与其中。例如,DigitalOcean 宣布部署一种专门针对推理设计的五层架构,该架构专门针对底层异构集群进行了优化,并提到了 AMD 和 Nvidia 的产品。他们还表示,将会集成新的硬件。这是提高效率并降低代币成本的趋势。
记者: 如果在AI数据中心中,CPU开始承担越来越多智能体 AI 和 AI 推理相关的工作,例如复杂的推理循环、上下文维护、路由分支指令,以及其他难以并行化的任务,那么GPU除了执行矩阵乘法之外,还需要承担哪些新的工作?当CPU接手了这些工作之后,GPU是否会承担新的职责?
Bhattacharjee: 如果从推理过程来看,其中包含一个推理(Reasoning)阶段,需要根据用户输入的提示词判断下一步应该执行什么操作。推理阶段本身计算量极大,因此就需要各种加速器(Accelerator)参与。我这里更愿意使用“加速器”这个词,而不是GPU,因为承担这项工作的并不一定是GPU,也可以是专门用于推理的定制ASIC。这一阶段仍然需要大量矩阵乘法运算,而这正是加速器最擅长的工作。但当进入编排和工具调用阶段,也就是Agent真正开始执行各种操作时,这些任务完全可以运行在CPU上。整个过程会经过非常严格的协调与控制,明确哪些工作由CPU负责,哪些工作由NPU负责,而软件正是在这里发挥着至关重要的作用。
Brunner: 集群内部的异构化只会越来越普遍。当然,我们已经看到了这些应用场景,我也不想偏离主题太多。但在我们的环境中,我们还在研究如何把量子计算机整合进来,那将会非常令人期待。这意味着,又会出现一种完全不同的数据输入方式,以及新的集成模式。最终将会有一个通用的互联平台,把各种不同类型的计算资源连接起来,共同解决业务目标。而这正是我们今天讨论的核心——如何利用各种硬件来满足运营商的需求,让他们能够为自身业务和最终用户获得最佳结果。真正推动技术发展的仍然是业务需求。企业会不断寻找解决自身问题的最高效方案。
记者: NVIDIA已经推出了NVLink Fusion这一对外开放的能力。那么各种不同版本的以太网(Ethernet)协议是否会成为它的竞争者?还是说它们会分别应用于集群和机架等不同层级?
Bhattacharjee: 如果从互连架构来看,主要存在两类连接。第一类是加速器之间的互连(Accelerator-to-Accelerator),也就是一块GPU与另一块GPU通信,或者一块NPU与另一块NPU通信。第二类是主机与加速器之间的互连(Host-to-Accelerator),也就是CPU与加速器之间的通信。对于第一种情况,如果一块加速器不足以完成整个计算任务,就需要多块加速器协同工作。因此,加速器之间必须具备高速互连能力,才能避免因通信带来的性能下降。这也是NVIDIA推出NVLink的原因。如今,NVLink已经基本成为行业标准。但它只能运行在NVIDIA自己的生态系统内。正因如此,各大超大规模云服务商(Hyperscaler)都开始开发自己的加速器。Google推出了TPU,并采用光互连技术将多个TPU连接在一起,这套互连方案被称为ICI(Interchip Interconnect,芯片间互连)。Google在这方面做得非常出色,建立了一套完整且独有的TPU互连体系。再看看Amazon,它拥有自己的训练芯片;Meta拥有MTIA(Meta Training and Inference Accelerator,Meta训练与推理加速器);Microsoft也推出了自己的Maia。如今这些公司都需要具备类似的互连能力。没有任何一家企业愿意单独去解决互连的问题,因此大家都在推动行业形成统一标准。同时,NVIDIA也面临着越来越大的压力,需要进一步开放NVLink。因此,NVIDIA推出了NVLink Fusion。NVLink Fusion要求NVIDIA必须位于整个连接体系的一端。也就是说,要么使用NVIDIA的加速器连接其他厂商的CPU,要么使用NVIDIA的CPU连接其他厂商的加速器。在这两种情况下,NVLink Fusion都可以工作,因此NVIDIA仍然处于整个互连体系之中。与此同时,业内还有一个名为UA(Ultra Accelerator)联盟的组织,正在推动 UALink(Ultra Accelerator Link)标准,用于实现不同加速器之间的互连,目前已有众多公司参与支持。并且它还包含一个主机到加速器的链路,这基本上就是 CPU 到加速器的互连。如果把时间拉长到未来一两年,我们预计这些技术都会逐渐走向标准化。推动这一进程的主要力量仍然是各大超大规模云服务商,因为正是他们在定义未来AI基础设施的发展方向。同时,包括AMD在内的其他厂商也会积极推动这一标准的发展,因为AMD拥有 Instinct 系列产品,他们希望这些产品能够像GPU一样被超大规模云服务商广泛采用,而统一标准无疑将有助于这一目标的实现。总体来看,整个行业正朝着两个方向不断演进:一是建立统一的加速器互连标准,二是建立统一的CPU与加速器互连标准。
本文转自媒体报道或网络平台,系作者个人立场或观点。我方转载仅为分享,不代表我方赞成或认同。若来源标注错误或侵犯了您的合法权益,请及时联系客服,我们作为中立的平台服务者将及时更正、删除或依法处理。
