
从多核CPU时代到GPU并行计算时代,计算架构的每一次重大升级都曾受到内存系统的制约。而在AI从云端像边缘转变的时代,这种矛盾正在变得更加突出。
与传统应用不同,AI任务对内存的需求不仅体现在容量上,还体现在带宽、访问效率以及不同计算单元之间的数据共享能力上。当内存无法满足需求时,AI系统往往不会只是变慢,而是直接失去正常工作的能力。
过去几十年里,传统异构内存体系一直是主流方案。系统通常采用多个彼此独立的内存池,数据需要在不同内存空间之间反复复制和迁移。这种设计能够较好满足图形处理、媒体应用等传统工作负载,因为这些任务的数据访问模式相对固定且可预测。
但AI工作负载的特征完全不同。随着模型不断进行推理、更新上下文,并持续复用中间计算结果,模型权重、上下文信息以及中间数据都需要频繁共享。独立内存池带来的数据复制与传输开销,正逐渐成为新的性能瓶颈。随着模型规模不断扩大,系统面临的挑战已不仅是计算能力是否充足,更在于内存能否持续容纳不断增长的数据,并支撑AI任务稳定运行。
这种变化在模型扩张当中尤为明显。以Qwen3.5模型为例,在8bit量化条件下,从20亿参数扩展至350亿参数混合专家模型后,运行过程中的内存需求已经超过35GB。但对于许多终端设备而言,这一数字远超现有的配置水平。目前大量的客户端和边缘系统依旧依赖8GB的独显来运行AI任务。面对几十GB规模的大模型时,系统往往无法同时容纳模型权重和运行过程中产生的工作数据。
而在达到容量之后,AI会出现两种反应,要么是触发内存不足错误,从而直接终止相应,要么是将内存溢出至共享空间,但是整体性能和反应速度都会显著下降。在用户层面,这意味着AI的相应速度会显著变慢、生成过程频繁中断,甚至任务执行到一半突然中断。
如果说大模型扩大了AI的内存需求,那么智能体AI把这种需求变成了持续存在且更加严峻的问题。相较于传统AI的输入-输出模式,智能体AI需要持续完成规划、执行、评估、重新评估这一循环。在这一过程中,系统不仅要保存当前任务状态,还需要记录工具调用结果、中间推理过程以及长期上下文信息。
如果设备无法保存这些数据,模型就难以维持连续推理能力,也无法稳定完成复杂任务。对于需要长时间运行的AI助手而言,这种问题尤为明显。内存不足时,AI面对的不只是卡顿或变慢,而是直接失效。
很多时候,这些问题被误认为是模型能力不足或者软件Bug。实际上,根本原因往往来自底层内存架构限制。
针对快速增长的AI优先工作负载而设置的解决方案——统一内存架构(UMA)开始受到更多关注。UMA并不会取代传统异构内存体系,其最大的特点在于建立统一、共享且一致的内存空间。CPU、GPU以及NPU都能够访问同一片内存资源,而无需维护各自独立的内存池。模型参数、上下文信息以及中间计算结果可以直接存放在共享空间中,并根据工作负载动态分配资源。
这种设计减少了重复数据复制和跨设备传输带来的开销,也降低了传统显存容量形成的硬性限制。
更重要的是,它改变了系统在高内存压力下的表现方式。传统架构往往在达到容量上限后迅速失效,而UMA能够通过动态资源共享延缓这一过程,使系统在更大模型和更长上下文场景下维持运行能力。虽然性能仍可能受到影响,但不会出现明显的“断崖式”失效。
过去行业追求的是更高TOPS算力。未来更重要的问题则是:设备能否持续运行越来越大的模型?能否支撑越来越长的上下文窗口?能否在复杂任务执行过程中保持稳定状态?这些问题最终都指向同一个核心——内存架构。
UMA并不会取代所有现有设计。在游戏、影音娱乐以及传统生产力应用领域,传统异构内存体系仍然具有优势。
但对于以AI为核心的下一代终端设备而言,UMA正在成为支撑大模型持续运行的重要基础设施。从某种意义上说,边缘AI的发展已经进入新的阶段。未来决定设备能力上限的,未必是谁拥有更高的峰值算力,而是谁能够通过更合理的内存架构,让模型在真实场景中持续、高效且稳定地运行下去。
本文转自媒体报道或网络平台,系作者个人立场或观点。我方转载仅为分享,不代表我方赞成或认同。若来源标注错误或侵犯了您的合法权益,请及时联系客服,我们作为中立的平台服务者将及时更正、删除或依法处理。
