你是否认为一个图形处理器(GPU)与另一个GPU非常相似?那可就想错了。事实证明,即便是同一型号的芯片,实际性能也存在不小的差异。威廉玛丽学院、美国杰佛逊物理实验室和芯传国际(Silicon Data)的研究表明,从云服务提供商处租用GPU的时间是否能物有所值,完全是一场碰运气的博弈。
“这被称为硅片彩票。”跟踪GPU租赁价格和云计算性能基准的芯传国际公司创始人兼首席执行官卡门·李(Carmen Li)表示。
至少从2022年开始,人们就已经知道“硅片彩票”的存在,当时威斯康星大学的研究人员将其与依赖GPU的超级计算机的性能变化联系了起来。李和她的同事们认为,对人工智能云客户而言,这种影响更加明显。
因此,他们在11家云计算提供商随机选择的3500块GPU上运行了该指数公司6800个基准测试实例。这3500块GPU包括11个型号的英伟达GPU,其中最先进的是英伟达H200 SXM。(该团队并非特意针对英伟达,只是这家GPU巨头占据了租赁云市场的大部分份额。)
这项名为SiliconMark的基准测试旨在提供GPU运行大语言模型能力的快照。它测试了16位浮点计算性能(单位为万亿次/秒)和GPU内存带宽(单位为千兆字节/秒)。结果表明,所有型号的同规格GPU都存在性能差异,其中259块H100 PCIe GPU的差异高达34.5%,而253块H200 SXM GPU的内存带宽差异高达38%。

GPU的冷却方式、云服务运营商配置计算机的方式以及芯片的使用情况等方面的差异都可能导致相同型号芯片出现性能差异。但芯传国际的分析显示,真正的罪魁祸首是芯片本身的差异,这很可能源于制造问题。
研究人员认为,这种随机性会带来实实在在的经济后果,因为更昂贵、更先进的GPU有可能无法提供比旧型号芯片更好的性能。

那么,GPU租赁者应该怎么做?“最实用的方法是对实际租用的GPU进行基准测试。” 芯传国际的基础设施主管杰森·科尼克(Jason Cornick)表示,“通过运行基准测试工具(例如SiliconMark),他们可以将特定实例的性能与更广泛的数据库进行比较。”
本文转自媒体报道或网络平台,系作者个人立场或观点。我方转载仅为分享,不代表我方赞成或认同。若来源标注错误或侵犯了您的合法权益,请及时联系客服,我们作为中立的平台服务者将及时更正、删除或依法处理。
