
近日,Alphabet旗下谷歌云供应链基础设施资深总监Nikhil Cherian指出,随着多模态与混合专家(MoE)架构普及,AI计算已从算力受限转向内存受限,目前高性能内存已占AI服务器硬件物料清单(BOM)成本75%以上。面对容量、带宽与功耗瓶颈,谷歌正通过推理与训练硬件分流、无损量化软件算法等 “软硬件双轨策略”,全面突破AI内存墙。
Nikhil Cherian表示,随着大型语言模型与AI代理工作流快速发展,内存层级正面临容量上限、带宽受限、延迟飙升与能耗平衡等物理瓶颈。为了解决内存瓶颈,谷歌在硬件架构上采取分流策略,分别推出面向低延迟推理的TPU 8i,以及专攻超大规模训练的TPU 8t。
在硬件规格方面,推理专用的TPU 8i配备288 GB高带宽内存(HBM),并将片上SRAM容量扩充3倍至384 MiB,能够把动态对话状态与键值缓存(KV Cache)直接放置在芯片内部,实现零芯片外延迟;用于训练的TPU 8t则依托9600颗芯片组成的超大型计算集群,将HBM共享池化做到2PB规模,消除芯片外数据传输瓶颈,搭配TPU Direct Storage技术,保障加速器保持高效计算。
在软件创新与可持续布局上,谷歌研发无需重训的TurboQuant无损量化算法。TurboQuant主要针对AI推理阶段的键‑值缓存做压缩,并不会影响模型训练、权重存储所需的HBM,也不会降低长期存储的需求。
TurboQuant结合两项技术,解决传统压缩方法带来的额外内存开销,分别为PolarQuant以及Quantized Johnson‑Lindenstrauss(QJL)。PolarQuant是将传统笛卡尔坐标系(例如X、Y、Z轴)转换为极坐标,以此消除大量额外内存开销。传统方式相当于在一个方形网格上标记数据点,但数据点分布范围会持续变化,模型就需要进行大量计算与存储;切换到极坐标之后,数据点仅保留半径和角度,而这些角度已知且可预测,因此能够舍弃大量额外内存开销。QJL是一套校正机制,仅使用1比特(Bit)这一最小运算资源,修正极坐标量化过程产生的少量残余误差。该表达方式足够简洁,无需存储额外信息,因此既能大幅提升内存使用效率,还可以实现零精度损失。
TurboQuant把大模型KV缓存从32位压缩至3位,在精度零损失的条件下将内存占用缩小6倍,同时实现8倍注意力计算加速;还引入旧版DRAM复用技术,以此延长元器件生命周期。整体来看,它对整体内存市场的影响预计有限。不过,TurboQuant能够降低计算成本,有望加速AI技术落地,带动终端设备与边缘计算的需求增长。
内存正在AI基础设施支出中占据越来越高的比重。根据TrendForce发布的信息,受内存合约价格上涨、内存比特需求量提升双重因素推动,DRAM与NAND闪存合计占云服务商总资本开支(CapEx)的比例,预计2026年将达到47%,2027年进一步攀升至68%。TrendForce预测,2026年服务器DRAM合约价格涨幅约270%,企业级SSD合约价格涨幅约235%。
Nikhil Cherian强调,云厂商不再只是被动承受内存带来的约束,他呼吁内存行业跳出传统采购交易模式,走向深度协同设计,共同应对下一代计算需求。
本文转自媒体报道或网络平台,系作者个人立场或观点。我方转载仅为分享,不代表我方赞成或认同。若来源标注错误或侵犯了您的合法权益,请及时联系客服,我们作为中立的平台服务者将及时更正、删除或依法处理。
