跳出GPU局限,AI处理器架构被重塑

来源:半导纵横发布时间:2026-07-22 16:43
GPU
AI
技术进展
生成海报
下一轮AI竞赛的赢家,未必是搭建最大GPU集群的企业。

过去十年,人工智能行业的发展逻辑十分清晰简单:想要获得更强的AI能力,就打造更大规模的模型、投喂更多数据、堆叠更多GPU。这套方法论行之有效,并且取得了极为惊人的成果。

每一代全新硬件都能够支撑规模更大的神经网络,而更大的神经网络不断拓宽应用边界。技术最初仅能实现图像识别,逐步演化出智能体,可撰写文章、生成代码、制作逼真的图像与视频。业界早已习惯一条简单逻辑:GPU数量越多,AI智能水平越高。

然而近两年来,局面正在发生转变。随着行业迈入第四代AI——企业级AI时代,从业者发现旧有的发展逻辑不再适用。这并不意味着GPU遭到淘汰,恰恰相反,对于训练支撑现代AI体系的各类巨型模型而言,GPU依旧不可或缺。

问题的核心在于:企业级AI给硬件提出了本质不同的任务诉求,支撑生成式AI浪潮的各类前提假设开始失效。

企业级AI遵循一套全新运行规则

大多数人对AI的印象依旧停留在聊天机器人:用户提出问题、AI给出答案,单次交互就此结束。这是生成式AI时代的典型范式。但企业级AI有着截然不同的运行逻辑。

试想嵌入企业内部的AI助手:工作日伊始,它阅读邮件、分析表格、解读图表、审核合同、收听电话会议、调取内部数据库;同时和其他AI智能体协同工作,为员工生成报告,并根据源源不断的新信息持续更新认知。这不再是一次次孤立交互,而是不间断的持续推理。

AI几乎不会真正停止运算,不断在多项任务之间切换,长时间维持上下文信息,并在全天完成成千上万次微小决策。表面看差别似乎十分细微。但从计算架构视角来看,一切都随之改变。

GPU架构难以适配企业级AI推理任务

长久以来,AI系统的优化目标只有一项指标:浮点运算吞吐量(FLOPS)。目标非常明确:最大化每秒运算量。GPU擅长于此,因为它最初设计初衷就是并行处理成千上万组相同运算。

渲染游戏画面需要极强并行能力,而这种并行特性恰好高度适配神经网络训练。训练本身就是典型高并行任务,海量数据可以同时处理,GPU在这类场景下如鱼得水。

推理阶段则完全不同。推理是AI实时向用户输出结果的环节。和训练不同,大语言模型每生成一个新token,都依赖前一个token的输出,存在天然串行依赖。无论堆叠多少GPU,模型依旧只能逐一生成token。

新的瓶颈就此显现。数十年来,工程师持续提升芯片运算性能,但存储性能的发展速度远远滞后。处理器运算速度飞速提升,存储却难以跟上,这种失衡现象被称作存储墙。

如今,存储墙已经成为AI领域最难突破的阻碍之一。大语言模型拥有数千亿参数,部分模型参数规模已经达到万亿级别。这些参数无法全部存入处理器内部。模型每生成一轮回答,都需要持续从存储器调取数据。越来越多AI系统耗费在数据搬运上的时间,远超实际计算耗时。事实上,在大量落地场景中,数据传输消耗的能耗,高于运算本身。

这一现实暴露了以GPU为核心方案的底层短板。GPU的设计目标是最大化并行算力,从未以最小化数据搬运为设计导向。生成式AI时代,该缺陷可以依靠批量汇总大量用户请求来部分掩盖。大批次任务能够让GPU持续满载,实现亮眼的吞吐量指标。

企业级AI重塑产业成本逻辑

参与会议的AI助手无法等待数百条请求积累完毕再给出反馈;辅助医生影像判读的医疗AI不能出现明显延迟;协调供应链与金融业务的AI智能体,无法暂停等待任务凑成批次。企业级AI要求即时响应,延迟指标的优先级远超吞吐量。

这正是GPU推理面临的困境:为满足应用的延迟约束,GPU只能采用小批次任务运行模式,而小批次会直接降低硬件利用率——利用率恰恰是GPU具备成本优势的核心基础。架构本身并未失效,但硬件需要背离原始设计目标运行,最终导致性能大幅衰减。

这种转变迫使行业重新思考问题。工程师不再只关注处理器每秒能够执行多少次运算,转而开始研究数据如何在系统内更快流转。二者看似差别微小,实则代表架构层面的重大变革。

长期以来,AI硬件围绕算力搭建:处理器处于系统核心,存储器只是为算力单元输送数据。这套设计理念正在反转。高速数据访问逐步成为架构设计的核心。

硬件研发目标不再单纯打造更快的运算单元,而是提升数据带宽、缩短数据传输距离。数据传输的每一段距离都至关重要,数据移动会产生能耗、引入延迟,同时限制系统扩展能力。

以存储为核心的架构变革:从堆砌算力到加速数据流转

这一共识正在推动半导体行业掀起一轮创新浪潮。部分企业研发搭载超大片上存储的处理器,将数据就近存放;还有厂商开发面向自回归token生成的专用推理引擎。

全新架构只会激活任务所需的模型模块,从源头规避无效运算。与此同时,研究人员探索近存计算与存内计算两大技术路线,把运算单元布置到更靠近数据的位置。

众多探索新架构的创新企业中,几家方案极具代表性:Cerebras验证了整片晶圆集成处理器可以大幅降低延迟、打通通信瓶颈;Groq专注高确定性、低延迟推理,而非追求峰值吞吐量。

d-Matrix直击存储痛点,拉近存储与计算单元的物理距离;SambaNova研发可重构数据流架构;Etched针对Transformer模型深度定制硬件。

跳出GPU局限:重构AI推理底层规则

下一代推理架构提供了另一套思路,依托三项相互支撑、协同增效的创新:以存储为核心的设计理念;高带宽、低延迟、具备确定性的流水线数据流;融合大规模张量核阵列与可实时重配置DSP核的混合算力架构。三者结合,攻克长期制约AI推理硬件性能、能效与扩展性的核心瓶颈。

第一项创新——以存储为核心的设计思路,和传统推理架构形成根本性区别。传统系统高度依赖多级键值(KV)缓存,数据在外部存储器之间来回传输,算力单元调取、更新缓存数据时,持续产生延迟与能耗开销。方案并非舍弃KV缓存,而是彻底改变其运行成本模型。海量本地寄存器紧邻对应算力单元,让架构能够在算力单元附近承载更大上下文与模型参数集合,每一次KV缓存访问效率大幅提升。缩短数据传输距离,降低访存延迟,减轻存储总线压力,同步提升能效。最终架构可以在功耗更低的前提下维持更高吞吐量。对于大规模部署场景,能耗成本与散热压力是运营核心难题,这项优势价值突出。

第二项创新,高带宽、低延迟流水线数据流,解决当前主流GPU推理采用的单指令多线程(SIMT)执行模型与生俱来的低效问题。SIMT架构带来高昂访存代价:线程需要频繁同步、等待存储操作完成,持续消耗时间与电力。用深度流水线数据流替代SIMT后,数据能够持续、稳定地在各个运算阶段流转,消除同步阻塞,显著降低传统GPU访存模式带来的延迟与能耗损失。流水线方案还能提供具备确定性的实时推理性能。随着AI落地企业级应用、自动驾驶、机器人、实时语音等延迟敏感场景,这项能力愈发关键。

第三项创新,张量核与DSP混合算力架构,拓展算力的能力边界与灵活性。张量核针对Transformer推理中主流的密集矩阵、向量运算深度优化,但不少业务负载还需要专用信号处理、自定义激活函数、非标数值变换,这些任务张量核处理效率欠佳。在张量核阵列基础上增加可实时重配置DSP核,搭配丰富指令集,且单条指令仅占用一个时钟周期,硬件能够动态适配各类模型、各类推理任务的运算需求。这种灵活性对智能体AI意义重大。原本交由主机CPU完成的前后处理任务,可以直接在加速芯片本地运行,减少CPU与加速卡之间的数据交互,释放主机算力资源。同时让架构能够适配持续迭代演进的各类AI模型,具备长远兼容性。

VSORA推出的这三项创新组合,为数据中心与边缘端规模化AI推理提供了定制化方案。相比传统以GPU为核心的方案,硬件能效更高、延迟更低、适配场景更广,能够帮助云服务商降低综合成本、提升投资回报率。

架构新一轮变革近在眼前

计算机发展史印证一条规律:当主流技术触及原始设计假设上限时,架构变革便会到来。数十年来CPU是通用计算首选,直到图形任务需求暴涨,GPU作为全新专用架构应运而生。如今GPU正迎来相似节点。GPU不会被取代,而是迎来互补方案。

下一轮AI竞赛的赢家,未必是搭建最大GPU集群的企业,而是能够打造高效数据存取与管理体系、能耗更低、响应更快、推理效率更强的系统厂商。

本文转自媒体报道或网络平台,系作者个人立场或观点。我方转载仅为分享,不代表我方赞成或认同。若来源标注错误或侵犯了您的合法权益,请及时联系客服,我们作为中立的平台服务者将及时更正、删除或依法处理。

评论
暂无用户评论