
围绕 AI 基础设施的探讨,长期以来以算力为核心。 然而,来自 IDC 的最新全球研究揭示了各组织在AI规模化发展过程中必须面对的另一个关键因素:数据在单次算力周期结束后,依然持续留存和累积。
西部数据赞助的 IDC 白皮书《为规模化而生:HDD在AI时代的持久价值》(Built for Scale: The Enduring Role of HDDs in the AI Era)指出,在受访组织中,AI 正在推动数据存储需求出现结构性扩张。各类组织机构正在生成更多数据、赋予其更高价值、延长数据留存周期,并更频繁地将历史数据重新上线,以支持新的 AI 工作负载。
由此形成了一个持续复合增长的数据循环:AI 的运转需要数据,同时也会提升既有存储数据的潜在价值。算力需求会随工作负载和投资周期而有所不同,但 AI 所产生的数据却会持续留存并不断累积,这使得存储容量、可访问性与经济性,正成为AI基础设施设计中日益重要的考量维度。
白皮书的核心发现包括:
AI 正在催生持续复合增长的数据循环
数据留存周期延长,活跃度及价值同步提升
AI 基础设施必须面向数据全生命周期进行设计
西部数据首席执行官 Irving Tan 表示:“近几年来,关于 AI 基础设施的探讨始终聚焦于算力。实际上,AI 依赖数据运行。各类组织正在生成更多数据、延长数据保留时间,并不断探索从既有信息中发掘新价值的途径。算力需求会随着时间推移而演变,但大规模存储、管理和访问数据的需求只增不减。这一数据基础将在决定 AI 未来发展潜力方面发挥关键作用。”
AI 工作负载在其全生命周期中不断产生数据,涵盖从训练数据集和模型检查点,到推理输出、日志以及合成数据等各个环节。与负责处理这些数据的计算周期不同,大部分数据在工作负载执行完毕后仍会长久留存,并可作为未来 AI 应用的输入源。研究结果表明,随着各类组织将更多数据进行更加长久地留存,并为其既有的信息发掘新用途,数据存储需求正迎来结构性扩张。
研究同时表明,活跃数据与归档数据之间的传统界限正在发生变化。随着历史数据日益成为 AI工作负载的重要输入,曾经静默封存的数据正重新进入活跃数据生命周期,进而改变了组织对数据如何留存、管理以及按需调用方式的预期。
这些转变更强化了面向完整 AI 数据生命周期构建存储架构的必要性。随着数据量持续增长、留存周期不断延长以及历史数据重新变得活跃,组织日益需要根据工作负载的具体需求,在性能、容量、可访问性与经济性之间取得平衡。在 AI 规模化环境下,数据存放于何处——以及存储和访问这些数据的成本——正成为架构规划中愈发重要的考量因素。
以经济的方式实现大规模数据管理的能力,已不再是基础设施中的次要考量,而是正在成为决定AI 成败的关键因素。
西部数据赞助的 IDC 白皮书全文《为规模化而生:HDD在AI时代的持久价值》现已发布,获取链接:https://www.westerndigital.com/resources/white-paper/idc-hdds-ai-era
此内容为平台原创,著作权归平台所有。未经允许不得转载,如需转载请联系平台。
