现代数据中心承载着规模持续扩张的各类AI业务,电力需求有增无减。单机架功耗已经接近1兆瓦,这就要求从供电侧到芯片端的电能传输具备更高效率。一种可行方案,就是用800伏直流(800VDC)替代传统的机架内48伏直流配电系统。
提升供电电压能够带来诸多好处。是德科技电力电子设计软件产品经理Steven Lee表示:“800V架构功率变换级数更少、损耗更低,整体效率更高。宽禁带器件技术对这类数据中心而言价值巨大。设备会选用性能最优的半导体材料,这类材料损耗更低,耐热能力也更强。和传统硅器件相比,氮化镓(GaN)可以在更高温度环境下稳定工作,不易失效。”
但电压抬升之后,安全与可靠性挑战也随之加大,尤其是运维人员为了避免业务中断,对服务器托盘进行热插拔作业的场景。英飞凌电源与传感器系统部门总裁Adam White谈道:“数据中心机架满负荷运行时,如果需要更换主板器件,最忌讳的就是业务中断。必须保证插拔主板的工作人员不会面临人身危险。随着电压带来的冲击电流大幅升高,这一点在未来会变得愈发关键。”

图1:数据中心服务器托盘热插拔(来源:英飞凌)
48V和800V存在巨大差异。Lee指出:“高电压的危险性要高得多。48V一般不会致人死亡,但800V有致命风险。数据中心的设计思路是,某一段线路故障时,可以通过热插拔更换设备、上电恢复,以此保障业务负载,这套逻辑和电网类似;电网局部故障时,会调用其他区域的电力保障用户供电。但800V系统如果热插拔操作不当,就会产生电弧,伴随巨大声响、火花,甚至器件烧毁、炸裂,高压系统确实存在显著安全隐患。”
隔离设计与热插拔电路等保护机制因此变得至关重要。德州仪器计算电源技术专家Pradeep Shenoy说道:“托盘需要取出检修再装回,热插拔电路可以实现防护,支持托盘安全拆卸与接入维护。电压提升后必须重视该问题,这和电动汽车的工况不一样,属于数据中心特有的难题。难点在于如何安全完成从48V向800V的升级。”
将安全纳入架构设计,工程师必须保证高压系统与低压系统之间留有最小安全间距,这也是数据中心整体设计需要考量的要点。
电压等级升高,系统复杂度也会同步上升。英飞凌绿色工业电源部门总裁Peter Wawer表示:“其中包含电流检测,用于掌握系统运行状态;还需要设置跳闸保护参数。机电类器件品类繁多,半导体方案则可以依靠软件完成定制。该特性未来会简化整个供应链。企业不必储备大量不同规格物料来满足各类需求,很多参数直接软件配置即可,部分高成本方案也会更快获得竞争力。”
西门子一份白皮书提到,800伏直流具备架构搭建简单、转换效率提升、无功功率降低,后备电源与其他能源接入灵活等优势。不过直流配电同样面临功率变换传输、电磁兼容、计量方面的难题。直流网络中分布大量电容,电容储存工作所需电能;发生故障时,电容会释放储存能量,造成故障电流急剧增大、直流电压扰动,带来安全风险,引发系统停机。
因此,数据中心直流配电防护,需要综合考虑布线接地、保护器件、保护协同、电弧抑制、接地故障保护等多项内容。

图2:简化版1兆瓦浮动800VDC系统框图,包含一路电源、四路负载(来源:西门子)
在保护器件方面,固态断路器(SSCB)相比机械断路器拥有多项优势:亚毫秒级故障保护、无电弧、寿命更长,还可以无缝对接物联网智能预警系统。
过去机械开关可以胜任工作,是因为交流电电流方向周期性变化,每秒多次过零;每次过零,产生的火花就会自然熄灭。但直流电方向恒定,不一定会经过0电位。如果带电直流回路断开机械开关,电能会持续击穿空气间隙,形成持续高温电弧,熔化开关甚至引发起火。固态断路器依靠电子方式在微秒级切断电流,不存在物理分离间隙,因此不会形成持续电弧。
是德科技的Lee说:“传统机械开关响应为毫秒级别,速度不足。而直流系统响应很快,800V工况尤其明显。直流电不一定过零,但固态开关、固态断路器可以检测电弧,断开回路的速度远高于机械器件,能够规避危险,这也是固态断路器受到重视的核心原因。”
固态断路器依靠物理特性完成检测。Lee介绍:“检测到短路,内部先闭合再迅速断开。它不算智能方案,但速度极快,完全基于物理机制,没有控制器或者机器学习芯片参与。器件会识别正常电压,一旦检测到电压归零,代表出现故障,就直接切断回路,全部依靠材料本身特性实现。”
业内普遍认为,对于800VDC架构,固态断路器比机电继电器、机械断路器更加合适。英飞凌Wawer表示:“机械器件可靠性尚可、价格低廉,但动作速度慢。故障发生时,很有可能还没完成保护动作,本该被保护的设备就已经损坏。半导体断路器把保护速度提升了数个数量级。”
断路器是电力系统的核心部件,覆盖宽广电压范围,既有63安培电机型微型断路器,也适配数千安培大电流场景。Wawer谈道:“每栋建筑地下室都会配置断路器室,用于建筑与馈线保护。机械、电气专业人员可以处理数千安培等级。相关产品覆盖分立器件,耐压70‑150V,也有上千伏乃至更高电压、更大电流规格的型号。”

图3:数据中心电源管理(来源:英飞凌)
西门子资料显示,还有一类方案叫固态混合断路器(SSHCB):导通阶段采用类似机械断路器的金属触点,分断保护则借鉴固态断路器的电力电子方案。电子保险丝(e‑fuse)属于智能固态过流保护器件,和固态断路器相近,但没有物理隔离间隙,因此不能作为分支回路保护器件。

图4:保护器件定性对比表(来源:西门子)
固态断路器同样可以用于车辆电池断路保护。英飞凌Wawer指出:“目前出于成本考量,汽车电池保护普遍采用爆破式保险丝。问题在于,保险丝一旦触发,车辆就需要进厂维修。固态断路器属于非破坏性保护,器件本身不会损毁。”
突发火花属于显性危险,但数据中心更普遍的挑战来自全系统发热。楷登电子高级首席产品工程师Hoa Tram表示:“大量GPU同时运行,会产生巨大热量,这就要求规划与运维手段更加全面主动。依靠温度阈值触发告警这类传统手段依旧必要,但还需要数字孪生等技术,可以提前数分钟乃至数小时模拟AI数据中心各处热状态。不仅可以更高效调度GPU集群工作负载,也能给运维、冷却系统留出充足时间,避免或者减轻热损伤。高密度GPU环境下,热损伤发展速度远快于传统架构数据中心。”
预测能力十分关键。是德科技Lee说:“大功率大电流变换器工作会产生热量。核心问题就是如何仿真预判发热量,设计散热系统把热量及时散出。很多电路板配备大型散热片,用于MOSFET散热;大型数据中心散热方案更加复杂,机架内部布置液冷管路。做这些设计必须明确边界条件,搞清楚需要应对的最坏发热工况。如果预测不准,设备过热,就会出现器件损坏、业务停机。”
出于效率与可靠性考量,汽车和数据中心之间出现技术互通,部分安全关键领域标准也开始向任务关键场景迁移。
Imagination Technologies产品管理副总裁Kristof Beets谈道:“汽车是我们深耕数十年的基础市场,数据中心属于较新的领域。我们发现,面向ASIL‑B甚至ASIL‑D等级开发的大量可靠性机制,对数据中心同样很有价值。硬件出现故障却没有被发现,会造成大量算力与时间浪费。故障检测速度越快越好,而很多故障都属于硬故障。数据中心环境温度高、辐射复杂,芯片容易失效,因此我们在硬件内部加入低成本持续自检功能。”
汽车领域要求在100毫秒内识别故障并上报。Beets说:“这在当下的数据中心很难实现。数据中心承载庞大业务,往往要等到执行运算时,才发现某块GPU已经故障,之后需要回滚排查问题、定位错误数据。我们的方案可以实现极快检测,受到数据中心客户关注,回滚窗口会大幅缩小。并且不只是完成故障识别 —— 还可以定位故障点位,直接把故障单元下线,其余GPU继续工作。不需要人员到场更换整机机架,只禁用故障计算单元即可。当然该芯片可信度下降,后续合适时机依然要做物理更换,但业务可以更快恢复,额外成本更低。”
数据中心的可靠性需求还在持续提升。楷登电子Tram提到:“我认为数据中心的可靠性要求甚至高于汽车。汽车系统尽可能做到相互隔离独立工作;和AI算力集群同步调度海量高功耗GPU相比,汽车的功率规模很小。汽车启动马达工作与否,不会影响车灯。车载负载由事件、人为操作或者路况触发,不存在集群层面算法同步驱动负载。”
大型AI训练集群中数十万颗GPU高度协同,矩阵运算阶段会同步达到算力峰值,同步、检查点阶段又同步回落。Tram解释:“不是单路负载冲高,而是一整套设备同步产生负载尖峰。局部电能质量问题,有可能演变为威胁电网稳定的事件,这是汽车电气工程师无需面对的情况。汽车电池不用担心瞬态吸能行为会造成区域性停电,影响大量人群。AI算力中心电力系统一旦发生灾难性故障,波及范围巨大,这也是数据中心引入数字孪生等先进监测仿真技术的重要原因。”
无论是新建还是改造的数据中心,一大现实阻碍是800VDC安全标准尚未完全成熟。Tram指出:“NFPA 70E原则上覆盖直流系统,但电弧闪络计算方法主要针对交流场景,用于直流时准确度有限。IEC 61439‑1:2020、UL 508A‑3rd涉及直流开关设备与控制柜,但没有专门针对800V数据中心规模。OSHA引用NFPA 70E作为电气安全依据,并未专门针对800VDC数据中心架构给出规范。”
汽车与数据中心的差异还体现在厂商认证要求。英飞凌Jim Pawloski表示:“汽车主机厂遵循AEC等标准,部分器件工作温度可达175℃。传统数据中心沿用工业标准,和车规标准并不相同。但现在数据中心的认证门槛正在抬升,部分要求甚至比车规更严苛,追求极高可靠性,不允许电源故障拖垮大量服务器。”
Synopsys应用工程总监Pavani Gottipati表示:“变压器、母排等功率变换与配电器件,必须适配AI数据中心波动的负载。这类器件最大挑战是高效工作、降低损耗。AI负载产生的谐波会造成局部交流损耗与热点,引发器件失效,导致机架停机,影响数据中心业务,严重时造成客户侧断网。先进多物理场仿真优化工具,可以帮助设计电气、热特性稳健的功率变换和配电方案。”
芯片封装同样需要纳入考量。Gottipati谈道:“高功率密度芯片提升AI计算性能,同时也要求芯片周边电气架构匹配更高功率密度。芯片和封装层面可以采用磁性材料提升功率密度,但芯片设计者需要把控,避免磁性材料集成到电路板后带来电磁干扰(EMI)问题。”
可靠性挑战不只局限于供电、封装,液冷AI机架内部各类器件,也需要满足可维护性要求。
现代高性能AI服务器对可用性、可管理性、可维护性、可靠性均有要求,内存也不例外。Rambus内存接口芯片产品营销副总裁John Eble表示:“AI基础设施规模扩张,数据中心运营商需要内存方案兼顾性能、能效,同时满足持续运行所需的可靠性与可维护性。例如SOCAMM2采用基于LPDDR的模块化内存架构,外形适配液冷环境,支持升级、现场更换,生命周期灵活;SOCAMM2芯片组提供遥测、配置、局部电源管理能力,保障大规模场景可靠运行。”
液冷系统本身也需要可靠性验证。德州仪器Shenoy说:“整套系统包含大量泵体、电机驱动,液体需要循环流动;换热器等部件带来泄漏检测等新课题。过去设备依靠风冷,现在液冷方案中,必须保证器件温度处于额定区间,否则会超温损坏。”
板级可靠性测试(BLR)可以开展温度循环验证。Shenoy介绍:“我们做温度循环测试,刻意把器件升温到高温,再降温至低温反复循环。”
虽然数据中心环境温度管控比汽车更稳定,但温度循环对两类设备都会造成负面影响。英飞凌Jim Pawloski表示:“冷热交替循环是电子器件一大杀手,会削弱芯片内部、芯片与封装之间的互连结构。认证测试环节,需要验证器件可以承受足够多循环次数,部分场景下数据中心的测试条件甚至比车规更严苛。”
不过汽车整体工作温度更高。Synopsys首席工程师Bryan Kelly表示:“数据中心属于固定设施,不会出现电动汽车、混动汽车那种大幅度、快速波动的电气负载;环境条件也会维持在受控最优状态。”
800VDC给AI数据中心带来更高效率,但也伴随更高安全风险,包含触电、电弧闪络、电池热失控、设备隔离难题。因此,从电网或备用电源,到功耗突破1兆瓦的高密度AI机架,配电系统每一个环节都要落实安全防护措施。
高压变换级数变少,高压电力距离处理器芯片更近,芯片可靠性同样是800VDC安全体系的一环。总体来看,随着AI应用持续拓展,为换取功耗节约与效率提升,这些风险具备现实承受价值。
本文转自媒体报道或网络平台,系作者个人立场或观点。我方转载仅为分享,不代表我方赞成或认同。若来源标注错误或侵犯了您的合法权益,请及时联系客服,我们作为中立的平台服务者将及时更正、删除或依法处理。
