训练与推理:AI算力的两面,芯片需求迥异

来源:半导纵横发布时间:2026-10-08 14:57
AI芯片
算力
生成海报
最优训练芯片,未必自动成为最优推理芯片。

AI算力包含两大核心负载:训练与推理。训练是回溯式运算,读取已固定的文本、图像和代码数据集,并从中提炼出模型权重。推理则是前向生成,利用这些权重,逐个token生成此前不存在的内容。

模型相同、矩阵相同,底层运算也都是乘累加。但这两类任务,对芯片提出的需求几乎截然相反。训练需要海量算术运算;推理则要求数据字节按时送达。行业长期将二者视作同一类市场,导致基准测试方向错置,浪费了十年时间。

回溯的一面:训练

训练是循环数万亿次的迭代过程,每一轮迭代分为三个阶段:

前向传播。一批token序列送入神经网络。每一层都执行大型矩阵乘法(GEMM):单颗加速器(例如NVIDIA B300这类GPU)可并行处理数千个token;在整个集群中,单次训练步可覆盖数百万token。中间结果,也就是后续计算梯度所需的激活值,必须保存下来。

反向传播。将模型预测结果与真实下一个token对比,得到误差值,也就是损失。随后将该损失的梯度沿着网络各层反向回传。每一层还会额外计算两次矩阵乘法:一次针对输入梯度,一次针对权重梯度。这也是反向传播的计算量大约是前向传播两倍的原因。

优化器更新。集群内所有模型副本的梯度做均值聚合,再由优化器(通常是自适应矩估计Adam,或是AdamW这类变体)更新全部权重。

一次训练中,每个参数、每个token大约需要6次浮点运算:前向传播2次,反向传播4次。参数规模达数百亿、token规模达数十万亿时,前沿模型的训练总浮点运算量可达10²⁵~10²⁶ FLOPs。

内存是第二个核心难题。在一种常用的混合精度Adam配置下,每个参数大约需要16字节状态数据:BF16格式权重与梯度(各2字节)、FP32主权重(4字节),以及两个FP32优化器动量值(各4字节)。一个700亿参数模型,还未存储任何激活值,就需要约1.1TB内存。单颗芯片无法承载这么大的数据。从架构上看,训练天然就是分布式任务。

训练的一大关键特征是批量处理。一次性处理大量token,处理器可以在海量计算中复用模型权重,提升运算强度,也就是每搬运1字节数据所能完成的浮点运算次数。训练过程中占主导的大型矩阵运算,因此可以充分发挥算力吞吐。增加芯片数量能够提升训练能力与速度,但收益取决于芯片之间的数据交换和同步效率。

向前的一面:推理

推理省去了反向传播与优化器更新环节。对于主要的稠密线性运算,每个参数、每个token的前向传播大约仅需2次浮点运算,只有训练的三分之一。听起来推理像是轻量化版本的同类任务,但事实并非如此。仔细看,推理本身又包含两种子负载。

预填充(Prefill)处理提示词。所有输入token提前已知,以矩阵乘法(GEMM)形式并行送入网络。足够长的提示词或大批次任务,会让矩阵运算偏向算力密集型,此时预填充和训练的前向传播很相似:算力受限、运算强度高。这个阶段,模型会把每一层、每个token对应的键与值写入KV缓存,后续token做注意力计算时读取这份缓存。预填充直接影响首token生成时延。

解码(Decode)逐个token生成回答。必须等前一步运算完成,才能选出下一个token,序列维度不存在并行空间。每一层运算退化为矩阵向量乘法(GEMV),权重复用的计算量很小。每生成一个token,处理器都需要从内存读取该序列的全部权重与完整KV缓存,重新开始计算。

因此,权重与缓存的数据搬运量,决定了生成每个token的耗时。

这就是核心矛盾。当前旗舰加速器,从高带宽内存(HBM)读取1字节数据的时间里,可以完成数百次浮点运算。小批量解码场景下,每搬运1字节数据仅能完成1~2次浮点运算:读取权重,执行一次乘累加,随即丢弃。与此同时计算单元空闲,等待内存数据。

解码属于内存带宽受限场景;在输出内容很长的智能体负载中,解码耗时占总运行时间可达90%。批量增大时,权重复用效率提升,算力与带宽的平衡会有所变化,但KV缓存不受影响 —— 每条序列都需要完整读取缓存。长文本输出会让解码占据请求端到端时延的绝大部分,具体占比取决于提示词长度、输出长度、批量大小和服务系统。见下方框图。

在大语言模型(LLM)推理流程里,预填充并行处理提示词,一次性写入KV缓存;解码逐个生成token,每一步都读取完整缓存。时间占比仅作示意。

随着上下文变长,KV缓存带来另一重约束。每一层里,每个缓存token都会为各个KV头生成一组键和值。假设全部上下文都保存在内存、精度固定,单条序列的缓存大小公式为:

其中L代表层数,H_kv为键值头数量,d_head为头维度,S是序列长度,b为每个元素占用字节。以Llama-3-70B级别模型(80层、8个KV头、头维度128、BF16精度)为例,每个token缓存约占用320KB。

上下文窗口128k token时,单条对话的缓存占用约42GB。对于单个用户而言,该数值已经超过FP8精度下模型权重一半的容量。

三类负载横向对比

预填充更接近训练,而非解码。真正的分界,在批量并行数学运算,和串行、内存紧缺型运算之间,见下表。

训练对芯片的要求

评判训练处理器,要看在整个集群中,芯片标称算力能转化成多少有效计算量。五大核心约束决定芯片设计:

  1. 稠密矩阵吞吐。张量阵列或脉动阵列针对大型GEMM做规模设计,由片上SRAM供给数据,保证足够权重复用,让硬件持续满载。只有在这里,数据手册上的峰值TFLOPS才有实际意义。

  2. 内存容量,不只是带宽。权重、梯度、优化器状态、激活值都需要靠近计算单元。正因如此,单封装内的HBM堆叠层数持续增加;当内存放不下全部数据时,激活重计算会用算力换取内存空间。

  3. 每一步训练结束,都需要梯度全归约;张量并行、流水线并行会增加层内数据流量。横向扩展链路(NVLink级别)与跨节点互联(InfiniBand或以太网),对算力利用率的影响往往超过计算核心。如果集群每轮迭代有40% 时间等待集合通信,相当于浪费了40% 芯片算力。

  4. 梯度动态范围极大。BF16能够普及,是因为保留了FP32的8位指数;FP16需要损失缩放才能避免下溢。FP8训练可行,但必须搭配逐张量 / 逐块缩放,同时保留高精度主权重副本。

  5. 大规模可靠性。上万颗芯片连续运行数周的训练任务,必然会遇到故障。因此,断点保存、快速重启、静默数据损坏检测,属于架构原生设计,而不是后期运维附加功能。

训练场景没有用户等待下一个token,但时间依然关键:任何步骤停滞,都会拖慢整个任务。持续吞吐、利用率、任务完成时间,才是核心衡量指标。

推理对芯片的要求

评判推理处理器,要看在目标时延内,生成每个token的成本与能耗。优先级几乎完全反转。

  1. 每浮点运算对应的带宽。解码吞吐,取决于权重与KV缓存送到计算单元的速度。一款峰值算力减半、有效带宽翻倍的芯片,反而更占优势。这就是内存墙,也是标称峰值算力和持续性能出现差距的地方。

  2. KV缓存容量与管理。长上下文场景下,缓存而非模型权重,成为限制单芯片承载用户数量的核心瓶颈。缓存分页、压缩、量化,以及向低成本存储层卸载,都属于一级设计问题。

  3. 批量处理困境。把多个用户请求合并成一批,可以恢复运算强度:权重读取一次,在多个请求间复用。但批次里所有用户,都需要等待最慢的那一步。算子需要在吞吐和单用户时延之间取舍;硬件必须低成本完成这种权衡:细粒度调度、连续批处理、快速上下文切换。

  4. 激进量化。推理可接受远低于训练的精度。FP8已是常规方案,FP4、INT4权重越来越普遍;比特数每减半,有效带宽几乎翻倍。处理器需要原生支持这些格式,并由硬件处理缩放因子。

  5. 能耗与总体拥有成本TCO。训练属于一次性资本支出,一次投入支撑一个模型。推理是持续运营成本,产品生命周期内每生成一个token都要计费。决定企业盈亏的,是每token功耗,而非峰值功耗。

  6. 利用率与可预测性。请求长度差异巨大,流量突发。确定、调度良好的架构能够保持流水线满载;为大型规整矩阵乘法优化的架构,在解码阶段大部分算力闲置。

预填充增加了设计复杂度:它和训练一样属于算力受限场景,还决定首token时延。优秀的推理芯片必须同时适配两种负载,即便解码占据大部分开销。

单颗芯片能否同时兼顾两类任务?

GPU给出的答案是可以。它本身是极强的训练引擎,配套软件生态,也让它成为推理的默认选择。但为训练矩阵乘法设计的裸片,包含大量解码阶段无法利用的算力。在保障时延的批量规模下,大部分硅片闲置,真正干活的只有HBM。工程师付出了兼顾两种任务的硬件成本,却只用到其中一部分。

行业正从三个方向应对这一问题:

  1. 专用推理芯片。设计思路是提升每浮点运算对应的带宽,把更多内存放在计算单元附近:片上SRAM占比高的数据流芯片、晶圆级器件、多层内存架构,围绕持续效率而非峰值算力设计。不同方案在容量和带宽之间做不同取舍;当模型或上下文超出高速内存上限,性能会断崖下跌。

  2. 解耦部署。预填充和解码拆分到不同硬件资源池,各自针对自身瓶颈配置算力,KV缓存在两套资源池之间传输。该方案直接承认:推理本身就是两种不同负载。

  3. 补齐差距的软件。推测解码,让小模型预先生成候选token,再由大模型在单次批量运算里校验,把一部分解码任务转化成类似预填充的计算。量化与缓存压缩,减少需要搬运的数据量。

以上方案,都不会让GPU在训练场景被淘汰。但它打破了固有认知:最优训练芯片,未必自动成为最优推理芯片。

选择侧重哪一面

过去十年,AI硬件都是为 “回溯式” 的训练任务打造。训练是行业焦点,峰值TFLOPS是PPT上最亮眼的数字。在模型频繁训练、推理调用较少的阶段,这个思路合理。

如今比例已经反转。前沿大模型训练一次,就要被调用数十亿次,越来越多调用来自智能体:读取超长上下文,边思考边输出回答。AI商业价值,现在落在前向推理这一侧;推理瓶颈缺的是数据带宽,而非浮点算力。处理器架构师面临的挑战:在目标时延内经济高效生成token,同时还能处理每个请求起始阶段突发的并行计算。

本文转自媒体报道或网络平台,系作者个人立场或观点。我方转载仅为分享,不代表我方赞成或认同。若来源标注错误或侵犯了您的合法权益,请及时联系客服,我们作为中立的平台服务者将及时更正、删除或依法处理。

评论
暂无用户评论