
过去几年,AI训练和推理能力不断提升,GPU、HBM、多芯粒(Chiplet)等技术快速发展,让芯片的计算能力实现了跨越式增长。但随着算力持续提升,一个新的瓶颈逐渐浮现——数据传输。
对于今天的大型AI芯片而言,真正影响性能的不再只是计算单元本身,而是数据能否以足够快、足够稳定的方式,在处理器、缓存、存储器以及多个Chiplet之间完成传输。如果说计算单元是芯片里的”发动机”,那么片上网络(Network-on-Chip,NoC)就是芯片内部的高速交通网络。当交通网络开始拥堵,再强大的发动机也难以跑出最高速度。
最早的NoC主要负责一颗芯片内部各功能模块之间的数据通信。过去,不同芯片之间主要依靠PCIe等标准接口进行通信,因此NoC只需要关注芯片内部的数据流动。
而进入Chiplet时代之后,这种边界开始消失。越来越多大型AI芯片由多个裸片共同组成,多个Chiplet之间需要像同一颗芯片一样共享缓存、访问内存、交换数据。这意味着NoC已经不能局限于单颗裸片内部,而需要跨越Chiplet,形成一个覆盖整个封装的统一互连网络。
真正困难的地方并不是物理连接,而是如何让多个Chiplet在逻辑上仍然像一个整体工作,包括缓存一致性、协议兼容以及数据访问规则等,都需要重新设计。例如Arm正在推动AMBA CHI C2C(Chiplet-to-Chiplet)一致性接口,希望让CPU能够更加自然地与GPU等计算芯片协同工作,就是这一趋势的体现。
随着NoC不断扩展,数据一致性(Coherency)成为设计过程中最复杂的问题之一。简单来说,一致性意味着多个处理器访问同一份数据时,所有人看到的内容必须保持一致。如果某个缓存中的数据已经更新,而另一个处理器仍然读取旧数据,就可能导致整个系统出现错误。
现实情况远比这个例子复杂。AI芯片内部既存在需要保持一致性的缓存访问,也存在无需一致性的普通I/O数据流。两种不同类型的数据会同时经过NoC传输,一旦调度顺序、缓存管理或虚拟通道分配出现问题,系统未必立即报错,却可能在后续运行过程中形成死锁,甚至直到芯片流片完成后才暴露出来。
相比普通功能验证,这类问题几乎无法依靠人工穷举测试覆盖所有场景,因此越来越多企业开始将一致性验证提前到设计早期,并结合约束驱动测试、硬件辅助验证以及仿真工具,提高验证覆盖率。
AI模型规模不断扩大,也让NoC面临越来越大的通信压力。传统CPU时代,大部分数据交换发生在芯片内部。现在大模型训练涉及大量GPU协同计算,芯片需要持续与HBM、高速网络以及其他计算节点交换数据,I/O已经成为系统架构中的核心资源。带宽密度、时延确定性、拥塞控制、服务质量(QoS)以及错误隔离能力,都开始成为系统设计阶段就必须考虑的问题,而不能等到后期优化。
同时,Chiplet互连规模也迅速增长。一个多Chiplet系统往往包含数量庞大的互连线路,需要对每一条线路进行建模和仿真,以验证不同工作负载下的数据传输是否稳定可靠。仿真的对象已经不仅仅是一颗芯片,而是整个封装系统。
NoC设计还面临另一个越来越重要的问题,即多物理场耦合。传统芯片仿真通常只关注电路本身,而Chiplet系统需要同时考虑热、电、机械等多种因素共同作用。例如,一个Chiplet产生的大量热量,会提高邻近Chiplet的工作温度;封装内部不同芯片之间还可能产生串扰、电磁干扰以及机械应力。
这些因素都会影响NoC的数据传输稳定性。
因此,现在越来越多企业开始采用覆盖芯片、封装乃至整个系统的联合仿真方法,希望在架构设计阶段就发现潜在问题,而不是等产品进入后期开发再进行修改。
面对越来越复杂的系统,仅靠传统仿真已经难以覆盖所有极端场景。形式化验证(Formal Verification)因此受到更多关注。
它最大的特点是不依赖大量测试用例,而是利用数学方法证明系统是否满足设计规则。
例如,可以验证:任意两个合法节点之间是否一定能够建立连接;数据包是否始终沿着合法路径传输;是否存在死锁风险;信用流控是否始终保持正确;Buffer是否可能溢出;路由器失效后网络是否仍能正常工作。
对于Chiplet系统而言,这类验证能够覆盖大量传统仿真难以触及的角落情况,大幅降低流片后的设计风险。
与此同时,先进封装方案也开始影响NoC设计。无论是CoWoS、EMIB还是混合键合,不同封装方式都会直接影响芯片布局、供电网络以及热设计,因此封装方案已经不能等到设计完成后再考虑,而需要从系统架构阶段同步规划。
不同应用对于NoC提出的要求也开始出现分化。
数据中心AI芯片更关注吞吐量、带宽以及能耗,希望数据能够高速流动,避免GPU因为等待数据而空闲。
自动驾驶汽车则更加重视可靠性和功能安全。车辆中的NoC不仅需要完成数据传输,还必须具备实时错误检测、冗余保护以及快速恢复能力。一旦检测到异常,需要在极短时间内通知控制系统,甚至依靠冗余逻辑继续运行。
虽然汽车芯片的规模远小于数据中心GPU集群,但对于数据传输可靠性的要求反而更加严格。
本文转自媒体报道或网络平台,系作者个人立场或观点。我方转载仅为分享,不代表我方赞成或认同。若来源标注错误或侵犯了您的合法权益,请及时联系客服,我们作为中立的平台服务者将及时更正、删除或依法处理。
