Marvell携手SK海力士,CMM-Ax突破大模型内存墙

来源:半导纵横发布时间:2026-08-06 15:56
Marvell
SK海力士
存储
生成海报
双强联合!CMM-Ax解锁AI算力能效新高度。

破解长上下文LLM内存瓶颈:Marvell联合SK海力士推出CXL近内存计算方案CMM-Ax

随着长上下文大模型、生成式AI、云端推荐系统规模化落地,AI算力瓶颈早已不再单纯局限于GPU算力本身。在超长Token推理、海量向量检索等高负载场景中,频繁的数据搬运、显存不足、内存带宽浪费,成为制约AI服务器吞吐与能效的核心痛点。针对传统计算优先架构的先天缺陷,Marvell联合SK海力士基于CXL互联技术,推出软硬一体近内存计算方案CMM-Ax。方案依托Marvell Structera A内存卸载引擎实现计算下沉,大幅优化长上下文LLM推理效率,为数据中心向内存中心架构升级提供了可落地的技术路径。

当前主流AI业务普遍呈现“内存密集型”特征,尤其是大模型自回归解码过程中,KV缓存会随上下文长度指数级增长。传统GPU架构依赖显存承载全部模型参数与缓存,面对128K至100万Token超长文本场景极易显存溢出,只能通过降低推理批次保障稳定性,最终导致云端服务吞吐量大幅受限。与此同时,计算与内存之间频繁的数据迁移,也持续拉高系统延迟与整机功耗,硬件算力利用率长期偏低。

作为行业突破内存墙的核心技术,CXL不仅可以实现内存弹性扩容、资源池化,更关键的是支持计算任务就近卸载,从架构层面减少数据搬运。此次Marvell与SK海力士打通芯片、内存、软件全栈能力,跳出传统单纯扩容内存的优化思路,通过在内存端植入原生算力,就地处理数据密集型任务,从根源上提升AI整机处理效率。

Structera A:核心近内存引擎,重构内存处理逻辑

Marvell Structera A是整套方案的核心算力底座,区别于市场上仅提供容量拓展的普通CXL模组,其内置16颗Arm通用计算核心,具备完整的本地近内存处理能力。硬件端,卸载引擎与配套内存之间可实现最高200GB/s的超高带宽,依托CXL链路与主机CPU、AI加速卡建立低延迟通信,同时兼容新一代主流DRAM硬件规格。

该架构的核心优势在于计算就近落地:数据预处理、内存读写、注意力计算等高频、密集型任务,无需反复在GPU、CPU与内存之间迁移,可直接在内存子系统内完成处理。这一模式大幅释放了主机算力资源,降低CPU空载开销,显著提升GPU加速卡的实际利用率。

目前这套近内存架构可广泛适配三大核心AI场景:

  1. 长上下文大模型推理:通过CXL拓展大容量外接内存,承接溢出的KV缓存,突破物理显存容量限制,同时支撑超长上下文与高并发推理;
  2. 云端推荐系统:适配海量嵌入向量表、零散高频的内存访问特征,充分释放内存带宽潜力,降低检索延迟,适配超大规模云集群部署;
  3. 大规模数据分析:针对读取密集型业务,依托弹性内存架构,同步提升数据处理速度与整机能耗表现。

CMM-Ax软硬一体方案,精准解决LLM推理核心痛点

基于Structera A引擎,双方联合研发ASIC架构CMM-Ax(CXL内存模组加速器),打造通用型CXL近内存处理(CXL-PNM)解决方案。产品深度整合Marvell近内存计算单元、SK海力士高端DDR5内存,搭配双方联合优化的专属软件栈,实现软硬件垂直协同优化,专门针对AI内存瓶颈场景设计。

硬件层面,CMM-Ax搭载四路DDR5内存通道与高性能CXL控制器,构建统一一致性内存空间,彻底规避反复数据拷贝带来的性能损耗。软件端配套专属PNM开发库与专用API,支持CXL内存区域直接读写,摆脱传统中断、DMA传输的性能拖累。设备内置智能运行时调度模块,可按需为不同任务分配独立执行线程,依托16核并行能力最大化内存密集型任务吞吐量。

在最棘手的长上下文LLM推理场景中,传统GPU架构的短板尤为突出:解码阶段持续累积的KV缓存会快速占满显存,上下文越长,可支撑的推理批次越少,服务吞吐断崖式下跌。而CMM-Ax可将溢出的KV缓存分流至大容量CXL内存,同时在内存侧就近完成缓存相关运算,大幅减少跨设备数据交互,从架构上解决超长文本推理的性能与容量矛盾。

实测数据出炉:最高5.5倍推理吞吐,突破GPU原生上限

为验证方案性能,Marvell与SK海力士搭建NELSSA联合推理测试平台,采用Llama3-8B百万上下文模型开展实测,测试上下文覆盖128K–1024K Token,通过行业权威RULER基准完成精度校验。最终性能数据基于512GB量产规格推演(原型机为32GB),以解码Token吞吐量为核心评价指标。

测试结果显示,纯单GPU架构无法稳定运行百万Token超长上下文,会直接因显存溢出报错;而搭载CMM-Ax方案后,设备可稳定实现128K上下文8并发推理,同时支持100万Token超长文本单批次推理,彻底突破原生显存限制。

在常规负载下,新方案吞吐量可持平纯GPU架构;随着任务负载提升,近内存计算的效率优势持续放大,固定硬件开销被充分摊薄。规模化场景下,CMM-Ax整机推理吞吐量最高可达单GPU方案的5.5倍、双GPU架构的3.6倍,性能提升优势显著。

AI数据中心迈入内存中心计算时代

随着AI模型参数规模、上下文长度持续扩容,数据中心架构正在完成从“计算主导”向“内存主导”的迭代升级。单一算力硬件的性能红利已见顶,唯有通过内存、互联、算力的全栈协同优化,才能持续突破AI系统性能瓶颈。

CMM-Ax作为Marvell与SK海力士在CXL近内存赛道的标杆成果,结合了Marvell CXL芯片与近内存计算技术、SK海力士高端内存研发制造能力,精准适配大模型等内存受限型AI业务。未来双方将持续迭代软硬件方案,深化协同合作,持续布局下一代高效AI数据中心基础设施市场。

本文转自媒体报道或网络平台,系作者个人立场或观点。我方转载仅为分享,不代表我方赞成或认同。若来源标注错误或侵犯了您的合法权益,请及时联系客服,我们作为中立的平台服务者将及时更正、删除或依法处理。

评论
暂无用户评论