Cerebras塞满SRAM的晶圆级引擎(WSE)已经在AI模型服务领域闯出一片天地,主打极低延迟、高吞吐推理,支撑着OpenAI ChatGPT-5.6 Sol的Ultrafast档位等服务。在Hot Chips 2026上,该公司公布了晶圆级加速器路线图上未来两代产品,同时介绍了面向CS-4机架级加速器的全新Nexus机架设计,以及机架内三颗WS-3T晶圆级引擎的性能表现。
在一整片巨型硅片上集成一颗庞大的一致性处理器,是业内独有的成就。但这种方式也有局限。模型规模持续增长(其内存占用可以在多个推理会话之间分摊),加上存储在大型KV缓存中、越拉越长的上下文(每个推理会话各自独立),AI对内存的需求只增不减。
传统GPU厂商应对这些压力的办法,一是与内存厂商合作把HBM堆得更高,二是在每颗加速器上用更多HBM,扩充处理器近旁这一宝贵资源。但晶圆级设计的面积已经100%被逻辑和内存占满,想增加任何一种资源,就得放弃原本可作他用的面积。由于可预见的未来硅片生产仍将在300毫米晶圆上进行,Cerebras必须另辟蹊径来扩展处理器可用的片上资源。
Cerebras透露,从CS-6系统的WSE开始(目前在路线图上相隔两代),晶圆级引擎将走向堆叠设计。该公司将首次尝试在逻辑和SRAM晶圆之上3D堆叠DRAM,称此举能在缩减芯片整体所需面积的同时,保持公司在推理性能上的领先。
把晶圆级逻辑芯片与内存芯片上下堆叠,目标无疑宏大,但这只是CS-6系统中一项潜在的重要变化。Cerebras预期的面积缩减意味着公司或许能提高WSE的总产量——在晶圆需求持续攀升的当下,这可能缓解一个关键约束。
眼下,Cerebras正通过全新的CS-4机架级系统和Nexus机架设计提升现有晶圆级平台的性能。CS-4将三颗升级版WS-3T晶圆装入自包含的“背包”模块,把供电、scale-up组网和液冷设施集成在单一可插拔模块中。
Cerebras指出,由于这些模块自包含,未来采用该架构的晶圆级引擎可以直接换入,无需更换整个机架。
Cerebras首席系统架构师JP Fricker在描述Rubin NVL72每个机架内用于连接NVLink scale-up域的5000根线缆时毫不客气,称之为“一团糟”,并以此对比Nexus系统片上互连加自包含计算模块所带来的更整洁、故障点更少的设计。
Nexus背包设计还将WSE的I/O接口与背包其余组件解耦。两个I/O模块连接到晶圆边缘,既提供RoCE v2 RDMA连接以实现与其他系统的互操作,也提供到机架内其他晶圆的直连。这些模块同样可以互换,为未来升级提供了另一条独立于核心计算晶圆的路径。
Nexus设计为机架正面每个背包配备最多10个机架供电单元,每组都可根据运营者需求配置不同等级的冗余。机架还为需要风冷的背包组件提供风冷。
将晶圆级引擎垂直安装在背包模块中,让Cerebras得以省去承载晶圆全部配套设施的PCB或基板。取而代之的是,背包把为芯片供电的粗大铜排直接连接到芯片背面。这种紧密接触至关重要,它把供电途中的损耗降到最低——相比之下,BGA封装的GPU芯片安装在PCB模块上,所有供电电路都布置在晶粒周围。
Cerebras把由此省下的电力直接转化为WS-3T的性能。公司表示,Nexus背包设计避免的损耗使其能向晶圆级引擎输送两倍于以往设计的电力,直接带来更高的时钟频率,WS-3T性能最高可达WS-3的两倍。
每颗WS-3T采用与WS-3相同的基础硅片,稀疏FP16 petaFLOPS翻倍,SRAM提供的内存带宽也翻倍。但WS-3T整片晶圆仍限于44GB内存,一个CS-4机架三颗晶圆加起来也只有132GB,远少于Vera Rubin NVL72系统的20.7TB HBM和AMD Helios的31TB。
该公司不公布这些引擎的稠密PFLOPS数据,可能是因为芯片的数据流架构专为从稀疏性中榨取优势而设计,传统GPU通常做不到这一点。
无论如何,要容纳当下和未来更大的模型,Cerebras需要向上和向外扩展。但与其他依靠以太网进行scale-out的机架级系统不同,Cerebras可以直接用Nexus机架内连接晶圆级引擎的同一套晶圆间互换来连接多台CS-4系统。公司称,机架内每片晶圆享有2.4 Tb/s的直连scale-up带宽,芯片间总带宽达7.2 Tb/s,延迟2微秒。
Cerebras指出,在其架构下,只有模型激活值需要在晶圆级引擎之间传递,因此晶圆直连相对较低的带宽并不像拿它与Vera Rubin NVL72或AMD Helios那类系统每秒数百TB的scale-up带宽对比时看起来那样,是系统向外扩展的障碍。(无论如何,WSE-3T的片上互连结构拥有53.4 PB/s的带宽。)
CS-4系统架构为下一代CS-5加速器奠定了基础,后者将于2027年采用全新WSE硅片。公司表示,对于较小模型,下一代WSE每用户每秒可输出多达10000 token;而DeepSeek、OpenAI等实验室的大型前沿模型,也能跑到每用户每秒5000 token。
正如英伟达CEO黄仁勋所说,AI智能体没有耐心。借助CS-4这类专用加速器提供如此巨大的每秒token数,未来仍将是Cerebras与OpenAI、AMD等合作伙伴共同经营的重要利基。
本文转自媒体报道或网络平台,系作者个人立场或观点。我方转载仅为分享,不代表我方赞成或认同。若来源标注错误或侵犯了您的合法权益,请及时联系客服,我们作为中立的平台服务者将及时更正、删除或依法处理。
