跳出GPU,印度团队探索神经形态AI芯片

来源:半导纵横发布时间:2026-09-11 16:37
AI
技术进展
生成海报
类脑计算是下一代智能机器最具潜力的方向之一。

神经形态计算通过稀疏、事件驱动计算,以内存为中心的架构以及异步通信,模拟生物大脑的工作方式。印度科研人员将其视为降低人工智能能耗、同时实现全新硬件设计的一条路径。

在接受采访时,喀拉拉邦印度信息技术与管理研究所(IIITM-K)所长Alex P. James表示:“如今我们需要处理海量数据。如果能耗随数据量同步增长,这种模式不具备可持续性。”

研究人员常会拿人脑做对比。James说:“人脑运行功耗大约只有20瓦,对于神经形态系统所要实现的各类智能任务来说,这可以看作黄金标准。”

数十年来,半导体性能提升主要依靠缩小晶体管尺寸、提升处理器复杂度。这套思路催生了性能越来越强的CPU、GPU与AI加速器,但或许不足以解决AI持续增长的能耗需求。神经科学仍在不断发展,因此研究人员正在探索多种架构方案,而不是收敛到单一路线。James表示:“我们尚未完全读懂大脑。我们了解它的生理结构,但还无法完整理解它所有层面的功能机制。”

脉冲为何重要

脉冲神经网络(SNN)是神经形态研究反复出现的核心概念。传统深度神经网络持续执行乘累加(MAC)运算,而脉冲系统只有在神经元产生事件时才进行信息交互。

James说:“大脑不会时刻动用全部算力。在执行特定任务时,大量神经元保持休眠。这可以大幅节省能耗,并非所有单元都需要一直开启。”

印度理工学院孟买分校(IIT Bombay)的Udayan Ganguly教授团队改造量子隧穿电流,制作出超低功耗神经形态神经元;而这种漏电流,是传统芯片设计者通常想要抑制的效应。

和数字处理器不同,神经形态系统不依赖全局时钟,采用异步运行方式,依靠脉冲的时序与编码模式传递信息。人工神经元遵循类似生物原理:接收输入信号不断累积,超过阈值后产生脉冲,随后复位。在电路上,可以用电容、电流源、泄漏电阻和阈值电路实现。

IIT孟买团队没有采用常规晶体管工作模式,转而利用量子隧穿电流。Ganguly介绍:“晶体管处于深度关断状态时,会产生量子隧穿电流。我们将该隧穿电流用作电流源,这种漏电流缓慢给神经元电容充电。”

该设计采用格芯45纳米标准CMOS工艺流片,证明这套方案可以使用成熟制造工艺实现。

团队表示,研制出的这款神经元功耗比同类实现方案低约1000倍;相比基于亚阈值技术的等效低功耗设计,工艺、电压、温度带来的波动降低约5倍。Ganguly称,该机制同时提升了器件稳定性。

基于脉冲神经元搭建语音识别系统

为证明这套思路不只适用于单个电路,Ganguly团队搭建了一套完整的神经形态语音识别系统,融合器件物理、电路设计、算法与硬件实现。

该演示系统攻克了传统模式识别系统同样面临的难题:记忆随时间陆续输入的信息。Ganguly解释:“系统需要存储器保存前期声音信息,当完整序列接收完毕后,才能识别整体特征。”

研究团队采用液态机(liquid-state machine)实现该功能,这是一种循环脉冲神经网络,天然可以捕捉时序信息。“原理类似水滴落入水面产生涟漪,涟漪会慢慢消散,相当于对事件形成短时记忆。”Ganguly说道。

语音信号会被转换为脉冲序列,循环连接结构保留足够信息,完成完整单词分类。很多深度学习模型需要多级处理,而液态机仅用两层网络即可完成识别。

在标准基准数据集测试下,仅使用约100个神经元,系统分类准确率接近99%,证明小规模脉冲网络可以完成实用AI任务。Ganguly表示,该网络也可改造用于视觉等其他场景。

团队完成硬件制备,实现了端到端信号链路。“格芯通过高校计划为我们提供免费流片机会,我们是印度首个参与该项目的高校。”Ganguly说。

整套系统分为三级。“第一级实现滤波和人工听觉模块;第二级是循环神经网络;第三级负责分类。”芯片内的循环神经网络包含36个神经元,能够根据持续输入芯片的脉冲序列,输出脉冲特征。在二分类语音识别任务(例如 “是 / 否”、“启动 / 停止”)测试中,整套硬件系统错误率低于2%。

Ganguly介绍:“我们的研究出发点是数据中心巨大的功耗。现代处理器会产生大量热量,但人脑并不会像芯片一样明显发热。”制备的神经元工作频率约100千赫兹,面积约40平方微米,待机功耗2.7皮瓦,每个脉冲能耗约8飞焦,Ganguly称这个指标接近人脑水平

内存走向计算核心

脉冲神经网络并非唯一的神经形态架构。James提到细胞神经网络、层级时序记忆系统等其他仿生模型,各自侧重不同类脑特性,例如稳定性与容错能力。

另一大研究方向聚焦存储器件本身,而非神经元模型。印度科学学院(IISc)班加罗尔分校Sreetosh Goswami教授与Navakanta Bhat教授带领团队,近期研制出基于钌化合物的分子忆阻器,模拟分辨率可达14bit,能效为4.10TOPS/W。该器件面向存内计算,矩阵运算直接在存储阵列内部完成,不再需要在存储器和处理器之间反复搬运数据。

James认为,未来AI硬件对算术单元的依赖会下降,更多依靠存储本身。他提到模拟、以内存为中心的架构,存储可编程电导值而非二进制状态;网络权重直接编码,乘累加运算可在交叉阵列中自然完成。“数字系统完成一次32位乘法可能需要数百个逻辑门,而同样运算仅依靠少数存储器件就能实现。”James说。

印度科学学院的研究遵循相同原理。分子忆阻器不存储二进制数值,而是存储代表神经网络权重的模拟电导状态。当在交叉阵列两端施加输入电压,借助欧姆定律完成乘法,依靠基尔霍夫电流定律实现累加,可并行完成数千次乘累加运算。

这类架构能够缩小芯片面积、降低能耗,但同时带来模数转换、精度、器件波动等新挑战。Goswami和Bhat团队在分子层面调控开关机制,解决了其中一项精度难题。很多阻变存储器依靠随机缺陷生成,而这款钌基器件通过确定性分子过程实现开关,电导更新线性、对称,覆盖四个数量级。

稀疏性也起到相似作用。James说:“脉冲系统用0和1表达信息。只要其中一个输入为0,乘法结果就为0。闲置神经元直接跳过运算,几乎不消耗能耗,降低计算开销。”

印度科学学院团队正将该器件集成到一款混合信号AI推理加速器中,依托纳米科学与工程中心孵化的初创企业,采用台积电22nm工艺开发。原型使用交叉阵列实现存内计算,融合模拟计算与数字控制逻辑。

商业化成败取决于应用

历经数十年研究,神经形态计算仍未大规模商用。James认为挑战不只是技术层面,还要证明明确的商业价值。“一项技术从理念走向市场,需要科学、工程与商业三方面支撑。商业维度尤为关键,因为它和应用场景绑定。”

研究人员首先需要证明,神经形态架构在解决真实场景问题时优于传统硬件。James表示:“每一种架构都需要概念验证演示,证明它在实际应用中有显著优势。在此基础上,工程技术才能把概念转化为可量产产品。”

James提醒,仿生算法不会自动转化为高效芯片。部分算法适合模拟 / 混合信号硬件,另一些更适配存内计算或是全新器件技术。“我们不会只锁定单一硬件平台,而是持续探索、筛选最适合实现这类思路的硬件方案。”

归根结底,经济性才是最终决定因素。

一项跨学科挑战

两位研究者都强调,神经形态计算早已超出半导体设计范畴,要求过去相互独立的学科协同工作。“计算机科学家未必和电子工程师深度协作,神经科学家也很少和这两类群体交流。神经形态计算正在改变这一点。生物学家、数学家、电子工程师、计算机科学家共同攻关同一个问题。”

他补充道:“如果该方向持续推进,我相信我们终将攻克当代最重要的科学与工程难题之一。”

Ganguly的目标更为长远: “如果我们能制造神经元、突触原生通信方式与人脑一致的芯片,未来或许有望替换受损的脑组织。我们还可以构建人脑模型,更好理解思维与情绪。”他坦言这类应用距离落地还有数十年:“这是20年的远景目标,不是当下正在做的,但未来可能深刻影响所有人。”

现阶段,神经形态计算仍处在活跃研究阶段,尚不能替代GPU。各类技术路线差异很大:IIT孟买利用传统CMOS中的量子隧穿电流开发超低功耗脉冲神经元;印度科学学院班加罗尔分校研发分子忆阻器,用于模拟存内计算;IIITM-K的James等学者,则研究器件的组织架构方案。对印度而言,这些项目共同推动神经形态计算在器件、电路、架构、系统多个层面同步发展。

随着功耗与扩展性瓶颈愈发突出,科研人员认为,类脑计算是下一代智能机器最具潜力的方向之一。

本文转自媒体报道或网络平台,系作者个人立场或观点。我方转载仅为分享,不代表我方赞成或认同。若来源标注错误或侵犯了您的合法权益,请及时联系客服,我们作为中立的平台服务者将及时更正、删除或依法处理。

评论
暂无用户评论