CXL复用旧内存削减25%服务器,Meta的路径能否复制?

来源:半导纵横发布时间:2026-08-13 11:37
存储
服务器
标准/协议
生成海报
全球范围内,除少数头部超大规模云厂商,绝大多数企业的CXL+DDR4复用仍停留在试点。

Meta正在数百万台服务器上部署基于计算快速互联(CXL)的内存扩展方案,复用从退役设备上拆下来的DDR4内存模组,而非直接将其报废。

Meta在上月发布的一篇论文中披露了该方案,并表示这套部署可将服务器数量削减25%,同时降低运营成本。在接受采访时,Marvell存储与内存子系统产品组合副总裁Khurram Malik表示:“超大规模云厂商把DDR4内存模组接入CXL控制器,以此延长内存的使用寿命。如果不这么做,当服务器切换到仅支持DDR5的新平台时,这些内存就会被直接废弃。”

行业推进这一技术的背景是,数据中心运营商正面临双重叠加压力。Malik称,服务器更新周期为4‑5年,而DDR内存的使用寿命通常可达10‑12年。这种时间错配意味着,服务器被替换时,拆下的DDR4模组往往还剩余大约一半的可用寿命。

与此同时,DDR5价格上涨,让内存复用的经济效益愈发凸显。直到去年,成本一直是CXL内存扩展落地的主要阻碍:很多企业发现,直接新增DDR5内存,比采购扩展硬件更加划算。但随着DDR5涨价,成本账已经发生改变,越来越多企业启动相关试点项目。

Meta的实际落地部署,最直观地体现出该技术已经从试点走向量产。

Meta的差异化做法

Meta的CXL内存复用方案之所以与众不同,是因为它掌控了大部分技术栈。芯片由Meta内部设计,固件自主编写,自研集群管理软件,电路板装配在自研服务器中,而非采购惠普、联想等厂商的整机。就连回收得到的双列直插内存模组(DIMM),也全部来自Meta自有基础设施。

凭借全栈垂直整合,Meta从硬件源头就把集群软件所需的遥测能力内置其中,无需联合专用芯片、板卡、服务器多家供应商,就能获取完整运行状态。Meta还运行定制化Linux内核,在内核中实现所需的CXL支持,之后再把相关改进回馈给上游开源社区。

Nvidia负责高速串行计算机扩展总线标准(PCIe)与CXL硅后验证工作的Ameet Sanghavi指出,绝大多数企业并不具备Meta这种掌控完整技术栈的优势。

企业想要复用自有内存模组,通常要基于手头可用的内存型号挑选第三方CXL控制器厂商,再联合独立板卡厂商完成组合验证。之后还要部署到另一家厂商(例如联想)提供的服务器中,每款服务器都有自身的基本输入输出系统(BIOS)以及CXL功能支持。

Sanghavi解释道:“一旦出现故障,排查问题根源就需要同时联动专用芯片厂商、板卡厂商和服务器厂商。工程团队对CXL尚且陌生,还需要熟悉可靠性、可用性、可维护性相关行为、固件以及集群管理软件的各项改动。”

Marvell的解决方案

Marvell将相关方案放在计算定制解决方案事业部下,产品系列命名为Structera。该产品系列分为三款:面向内存扩展的Structera X、面向近内存计算的Structera A、面向CXL交换的Structera S。

Structera X就是专门用于DDR4复用的控制器。它可直接连接CPU,同时支持DDR4与DDR5。Malik介绍,Marvell提供硬件压缩功能,会带来少量延迟开销,但 “根据业务负载不同,可将有效内存容量提升约2‑2.5倍”。

该技术的落地进度,不同受访者给出的判断差异很大。Sanghavi表示,少数投入重金的超大规模云厂商已经跨过试点阶段,实现CXL内存扩展的量产部署。他说:“除此之外,行业绝大多数企业仍停留在试点阶段。DDR5涨价,是推动更多企业开始评估这项技术的主要因素。”

Malik表示,经过检测、可用于复用的退役DDR4内存占比,取决于开展资质验证的超大规模云厂商,而非Marvell这类芯片企业。“我接触过的超大规模云厂商,计划尽可能回收利用自有DDR4库存,预计失效比例不会很高,不过确切数据需要由厂商直接给出。”

他称,Marvell只负责提供控制器技术;回收、设备退役由超大规模云厂商自行完成,复用内存模组在接入控制器之前,会由厂商完成全套资质验证与测试。

CXL内存扩展器工作原理

Sanghavi介绍:“假设系统本地DDR内存为8GB,接入一块1GB的CXL板卡,操作系统内核会直接识别出总内存9GB,不会区分哪一部分属于CXL设备。”

图片

CXL内存扩展器工作原理框图

CXL.io的行为和普通PCIe流量一致;CXL.mem是内存扩展设备所用协议,让CPU把板载内存视作系统主内存,而非I/O设备;CXL.cache面向加速器,用于实现与系统内存之间的缓存一致性。

进入内存复用场景后,DDR4与DDR5之间的技术差异,反而不如DDR4模组本身的硬件状态重要。

落地阻碍:内存模组匹配

Sanghavi表示,从操作系统、内核、BIOS、CXL链路层面来看,DDR4和DDR5两代内存没有区别。“系统只会识别CXL设备挂载的内存,差异体现在延迟上。DDR4运行速度低于DDR5,内核会自动适配这一点。带宽方面,扩展器整体吞吐量取PCIe链路与内存本身两者中更低的那一个。”

过去普遍认为成本是CXL扩展落地的阻碍,Sanghavi纠正称,真正的障碍是互操作性与成本。在使用回收内存时,这一点尤为突出。全新内存场景下,厂商选定内存模组,围绕模组设计板卡。而回收内存来自退役服务器,来源可能是美光、SK海力士、三星等多家厂商,取决于原有服务器集群的采购配置。

CXL控制器必须兼容各式各样的内存模组,同时适配不同BIOS版本、不同Linux内核版本。部分企业使用最新内核,另一些企业则绑定老旧企业版内核。

回收内存还存在速度等级差异,既有3200MT/s,也有2600MT/s;类型上分为无缓冲、寄存器型、负载降低型,rank配置也各不相同。

这些差异带来现实约束:同一块扩展板上所有内存模组必须保持一致。Sanghavi说:“一块搭载8个内存插槽的板卡,需要8个完全相同的模组,板卡配套的控制器,必须支持这批内存实际的速度、类型以及rank配置。”

“完整兼容各类组合,这件事的难度超过内存本身的底层技术。”

他形容实际设计流程是逆向推导:“不是先选定内存扩展器,再挑选适配的内存;运营商要先梳理退役设备库存,统计占大头的内存厂商与料号组合,之后再挑选、验证能够适配这批内存的控制器。”

他提醒:“一旦匹配出错,整套复用方案的经济效益就会直接崩塌。”

遥测与可靠性:规避错误风暴

除内存模组匹配之外,复用内存还面临全新内存不存在的可靠性难题。DRAM的典型使用寿命约10年。Sanghavi称,数据中心运行3‑4年后拆下来的内存,已经消耗接近40% 的预期寿命,且长期处于严苛工况。

“这会更容易出现电气裕量不足与物理缺陷。从退役服务器拆卸过程,还可能带来额外损伤。” 他引用谷歌与Meta的公开研究:DRAM可纠正错误会随着内存老化增多,老旧模组整体报错概率更高。

可纠正错误本身不会直接造成系统崩溃,系统可以完成恢复。但Sanghavi提到,反复出现的可纠正错误,最终会演变为不可纠正错误。“例如内存模组上某颗DRAM芯片彻底损坏,对应的内存区域就会完全失效。故障也可能出现在内存控制器或者内存通道本身。”

因此他表示:“对于复用DDR4,可靠性、可用性、可维护性(RAS)的重要性,不亚于延迟、功耗、原始性能。内存模组或者DDR控制器检测到错误,固件会通过PCIe以中断形式向上上报,操作系统再传递给上层软件。”

大规模部署会带来风险。“十万台设备部署场景下,如果每毫秒就产生一次这类中断,就会形成可纠正错误风暴,源源不断上报告警,而集群管理软件并没有设计能力消化这类海量告警。不可纠正错误也存在同类风险。”

这就对集群遥测监控提出要求,监控能力必须跟上部署规模,避免错误风暴。

Sanghavi表示,风险管控的责任由多方分担。“CXL控制器厂商必须在硬件和固件层面原生具备完善的RAS能力,实现错误检测、纠错、精准向上上报。之后集群管理软件负责处理告警,不被海量告警压垮;前提是控制器输出的诊断信息本身准确。”

他列举了适配复用内存的RAS功能,包括ChipKill、内存巡检纠错,这些功能可以提升部署可靠性。

功耗与散热约束

相比内存技术本身,功耗散热是容易被忽视的现实约束。PCIe插槽规范供电75W;扩展板上每颗内存模组功耗约10W,扩展控制器本身再增加10‑12W功耗。

Sanghavi称,一台服务器内如果配置4、6甚至8块扩展板,就必须重新评估服务器电源能力。每一块板卡都占用PCIe插槽,这些插槽原本可以安放网卡或者GPU。硬件密度提升,也给机箱散热与风道带来压力。CXL服务器与机箱设计,需要获得和内存技术同等程度的重视。

全球落地情况

Malik与Sanghavi均表示,CXL内存扩展市场仍处于发展阶段。Malik称Marvell会围绕超大规模云厂商对内存带宽、容量的需求持续迭代下一代产品,同时优化压缩吞吐与RAS特性。

Sanghavi关注由此催生的全新商业模式。他提出:“超微、联想、惠普这类服务器厂商,可以出厂就内置CXL内存扩展器,原生支持多种内存模组,而不是把集成工作全部交给运营商。”

他还提到第三方软件的机会,专门负责内存页放置,实时调度数据存放在DDR或是CXL内存中,同时提供集群级遥测能力。

“另一种可能性:内存扩展器厂商把固件拓展为完整应用层软件包,提供应用程序接口,让客户可以直接查看硬件状态,而不是全部交由客户自行开发。”Sanghavi补充,这并非Marvell独有,Astera、Montage或是其他厂商都可以实现。

从历史规律看,美国与中国会率先采用新一代内存技术,印度及其他地区跟进在后。Malik表示Marvell正在和印度少数企业开展合作。“相关沟通还处于早期,DDR4回收复用场景尤其如此。其中一部分企业自建数据中心,另一部分企业和第三方服务商合作。”

全球范围内,除少数头部超大规模云厂商,绝大多数企业的CXL+DDR4复用仍停留在试点。印度服务器集群更新周期尚未到来,还没有产生大量闲置DDR4,距离把回收内存纳入正式采购决策会更远。

Malik称,目前Structera产品最大需求来自美国,除超大规模云厂商之外,普通企业客户对DDR4回收与内存扩展的兴趣也在提升。“非头部的企业数据中心运营商,大多跟随超大规模云厂商的技术方向。超大规模云厂商是我们核心客户,他们的技术选型会带动整个市场。”

尽管CXL内存复用热度持续走高,Sanghavi再次强调前面提到的现实鸿沟:绝大多数企业无法像Meta一样掌控完整技术栈。但也出现利好行业的变化:CXL相关功能持续合入Linux主线内核。他认为,这件事带来的推动作用超过任何单一硬件,帮助整个生态建立一套所有人都可以使用的开源通用基础。

超大规模云厂商已经实现CXL内存扩展量产,而普通企业还在解决内存匹配、遥测监控、功耗预算等各类问题。这套通用开源软件基础,将决定两类参与者之间的差距能够以多快的速度缩小。

本文转自媒体报道或网络平台,系作者个人立场或观点。我方转载仅为分享,不代表我方赞成或认同。若来源标注错误或侵犯了您的合法权益,请及时联系客服,我们作为中立的平台服务者将及时更正、删除或依法处理。

评论
暂无用户评论