近日,多位行业专家围绕热量对光子学的影响、瞬态特性以及系统可靠性展开讨论。参与讨论的嘉宾包括:Synopsys产品管理总监Lang Lin;Silvaco业务发展副总裁Jack Berg;Vinci半导体与电子业务负责人Satish Radhakrishnan;是德科技(Keysight Technologies)新市场管理总监Chris Mueth;西门子旗下Mentor产品管理高级总监John Ferguson。
从左至右:Silvaco Berg、Synopsys Lin、Vinci Radhakrishnan、是德科技 Mueth、西门子 Ferguson。
Mueth:光子技术有望缓解数据中心的瓶颈,但目前还无法规模化落地。构建大型网状交换网络需要大量器件,损耗也很高。因此我们需要重新审视光子学整套架构,采用全新设计思路,大概率要采用可扩展的模块化方案。另一个难题是热敏感性,必须实现温度稳定。但即便做到这一点,光子器件内部依然会集成加热器用于调控。如果搭建大型网状交换网络,所需的控制量会非常庞大。当芯片内有数千个加热器需要调控时,如何校准器件结构,保证性能达标?如果这个问题能够解决,将打开新的发展空间。但这依然无法消除光子芯片本身的损耗,该问题需要依靠模块化、可扩展架构来解决。
Radhakrishnan:共封装光学(Co-packaged optics)在一定程度上尝试解决这个问题,将硅光子器件集成到封装内部,缩小电子集成电路 / 光子集成电路(EIC/PIC)的体积,同时尝试做热隔离。但如果对整套系统做仿真,很容易缺失瞬态特性,而瞬态分析恰恰是必需的。如果器件布局距离较远,热量传导耗时更长;当ASIC迎来下一波负载时,前一轮的热量还未消散。哪怕微小的温度变化,都会改变环形振荡器的特性。我们需要能够对整套系统做联合瞬态仿真,确保器件电学与光学功能稳定可靠。对系统子模块开展瞬态仿真,是共封装光学技术落地与持续推进的关键。
Mueth:说得很有道理。不同模块的时间常数差异会严重干扰系统。在共封装光学方案里,电子集成电路驱动芯片通常紧贴光子集成电路、甚至直接置于其上方,会产生热串扰,进而影响光子器件性能。同时还会引入新应力,这类应力对光信号的影响甚至可能超过热效应。我们必须厘清各类取舍关系,纳入设计考量,充分发挥两种技术各自优势。仅仅调整器件位置,就有可能让性能变差,而非变好。
Mueth:可以在校准阶段完成验证。我们能在光子PIC内部增加检测回路,但会大幅提升器件复杂度。
Ferguson:我们可以调整器件布局,降低热量累积。但移动大型器件(尤其是光子器件)时,会引入新应力。应力对光信号的影响极大,甚至超过热效应。所以必须理清取舍关系,纳入设计考量,融合两项技术的优势。
Lin:硅光子可以看作一类模拟电路。模拟电路与数字电路的热行为差异巨大。数字晶体管依靠开关电流工作,电流用来控制晶体管通断,焦耳热效应相对温和。但硅光子与模拟器件会持续存在直流电流,且信号波动幅度大,电流会在波导这类互连结构中流动,产生大量热量。CPO的正常运转本身就需要这类热量,电子集成电路也依靠该热量工作。但大量加热器集中在一起会带来新问题:如何摆放加热器,既保障器件正常工作,又不会在加热器区域形成热点?应力也是硅光子稳定运行必须考虑的另一项难题。
Berg:光子集成电路(PIC)上的温度波动,通常会造成器件特性失配,相比电子集成电路(EIC)要严重得多。EIC相关的多物理场仿真、数字孪生与代理模型,放到光子IC场景,仿真需求基本会增至三倍,因为光子器件对翘曲与温度梯度更加敏感。激光器本身就是热源,可能带来可靠性隐患。因此光子学不仅需要电学、力学、热学的多物理场验证,还必须纳入光学分析。这意味着需要同时运行四类求解器,复杂度高于普通电子器件。这也是过去30年,光子学一直被称作半导体领域下一个重大突破方向的原因。从物理层面看,它远比大家预想的更复杂。
Mueth:传统半导体设计中,我们只关注有源器件的热问题,无源器件常被忽略。而光子系统里,无源器件同样会受到热效应影响。
Berg:设计时必须十分谨慎。
Mueth:没错。在架构设计阶段,就必须开展热仿真。其中一类极限场景就是高性能应用场景,需要从热、电、力学多维度仿真,这样在设计后期才能提升成功概率。这类仿真必须前置。
Ferguson:可以单独对每个变量做仿真,但无法获得完整系统信息。必须连续迭代仿真,也就是反复依次运行各类仿真,直到达到稳态,再确认稳态结果是否符合预期。最终结果取决于产品本身。
Radhakrishnan:观察AI芯片的发展方向,芯片既要支持训练,也要支持推理,目标是提升带宽。这也是芯片堆叠集成的驱动力,堆叠结构会改变器件特性。厂商需要掌握推理场景下的器件行为,而不只是峰值性能。瞬态工况下温度会升高多少?如果峰值发热仅持续纳秒级别,并且留有充足余量,或许可以短时提升功耗。但这个纳秒级峰值,是每毫秒触发一次,还是每微秒触发一次?允许开启峰值功率的频次是多少?可以在多大程度上突破热预算,让数据中心制定设计规则,例如 “推理场景允许每100毫秒出现一次毫秒级脉冲峰值”。这是全新的设计范式,可适配不同应用场景。所有设计都由终端用户需求,以及用户追求极致性能的目标驱动。
Lin:回到分层模型的话题。分层模型一方面支撑AI芯片的热仿真算力需求,另一方面也能构建多供应商协同的生态,各家按层级提供仿真模型。举例来说,HBM厂商需要提供HBM芯片模型,交付给系统集成商;集成商整合各类模型,搭建完整多裸片堆叠结构并开展热仿真。首先要评估供应商模型带来的热影响;其次完成整个系统的设计落地,作为最终产品交付方,他们需要保证所有模型对接、组装完成,并开展全系统仿真。分层模型是刚需,不只是为了解决仿真算力问题。行业正在推进相关工作,需要生态各方输出模型,同时建立统一标准,方便模型共享,便于集成商组装。
Radhakrishnan:现在很多裸片内部会嵌入温度传感器,用于监测老化。传感器必须集成在芯片上,用来追踪器件长期衰减,之后可以对芯片部分区域做降频处理。但芯片整体被封装,只能依靠软件读取传感数据,再做出调整。汽车芯片场景下该问题更严峻,芯片需要稳定工作10~15年。这类场景需要仿真,确认传感器摆放位置是否合理,能否采集有效数据,保障芯片长期稳定运行。行业正在朝着采集这类全维度信息的方向发展。
Berg:是的,沙特这类地区尤为典型。有一个简单经验公式基于阿伦尼乌斯方程(Arrhenius equation):温度每升高10℃,器件可靠性会大幅下降。准确把握这一点至关重要。
Lin:但行业内缺少能够精准预测热致老化的工具,存在明显缺口。我们需要配套对应方程的工具,预测老化效应并给出解决办法。传感器只能用来监测老化,而在设计优化层面,还没有面向老化感知的设计优化方案。
Radhakrishnan:本质是设计裕度取舍问题:设计不足或是冗余过度。理想状态下,相关策略需要随时间动态调整,这是一个巨大难题。
本文转自媒体报道或网络平台,系作者个人立场或观点。我方转载仅为分享,不代表我方赞成或认同。若来源标注错误或侵犯了您的合法权益,请及时联系客服,我们作为中立的平台服务者将及时更正、删除或依法处理。
