
近日,移动云公司联合中国电子科技南湖研究院、北京灵汐科技、上海天数智芯、清华大学、北京大学在2026中国算力大会上正式推出了国内首个国内GPU+类脑芯片大模型异构混合推理系统。这套依托产学研多方力量打造的全栈创新成果,跳出单纯依靠先进制程提升算力的传统思路,通过异构协同架构创新,为大模型、多智能体等AI应用构建起本土化推理底座,为国内AI算力产业发展提供全新技术范式。
当前人工智能产业重心正加速从大模型训练,转向规模化推理服务落地。词元工厂、AI智能体、文生视频、代码生成等新兴业务持续爆发,对推理算力的吞吐量、响应时延、部署成本提出严苛要求。传统单一GPU推理架构的短板日益凸显,数据反复读写带来的内存墙、功耗墙问题持续制约性能释放;与此同时,先进芯片制程供给存在约束,单纯依靠硬件工艺迭代提升算力的空间有限。行业亟需突破固有技术路线,从系统架构层面寻找本土化算力破局方案,这套异构混合推理系统正是在此背景下诞生。
该系统核心思路为“分而治之、协同增效”,创新性实现Transformer模型PD/AF分离推理模式,将大模型的Attention注意力计算与FFN前馈网络模块拆分,依托两类特性不同的本土芯片分工承载计算任务。其中,通用型的Attention计算交由本土GPU负责;而对时延敏感的FFN模块,则交给类脑芯片处理,充分发挥类脑芯片存算一体、片上大容量SRAM缓存的独特优势,减少数据在存储单元与计算单元之间来回搬运,缓解内存墙带来的性能损耗。
仅仅实现芯片任务拆分还不足以发挥异构算力价值。项目团队配套自研模型编译器、高速互联协议以及统一推理引擎,打通本土GPU与类脑芯片之间的任务拆解、实时调度、数据交互和结果聚合全流程,实现两种异构算力高效协同、优势互补,真正把两类国内芯片的硬件特性转化为系统层面的推理性能增益。项目团队已在DeepSeek V4 Flash大模型上完成完整调优与验证,实测结果显示,对比同规格本土GPU算力集群,这套异构系统推理输出能力与能效水平提升一倍以上,业务运营成本下降超40%,大幅改善本土算力集群落地的经济性。
这套系统具备广泛的业务适配能力,可支撑AI代码生成、多智能体协同、智能制造等高实时性场景。同时,整套方案底层芯片、软件栈全部基于本土化方案构建,能够满足金融、安防、通信等安全敏感行业对数据自主可控的硬性要求,为重点领域AI业务部署提供安全可靠的推理底座。
本次成果是产学研用协同创新的典型案例,整合运营商、芯片企业、科研院所、顶尖高校多方资源,打通底层芯片适配、推理引擎开发、模型调优到业务场景验证的完整技术链条,不再是单一主体独立攻关,而是联动产业链上下游共同攻克异构协同的技术难题。
面向未来,项目团队将持续迭代异构混合推理系统,在词元工厂、AI代码开发、文生视频、多智能体协同、智能制造以及金融通信安全场景持续开展落地测试与优化。团队计划逐步开放核心异构推理框架,赋能国内GPU、类脑芯片厂商以及各类算力运营商,降低异构算力开发门槛,带动本土算力产业链整体协同升级。
在智能体时代加速到来的当下,大模型推理已经成为数字基础设施的核心组成部分。本次国内GPU+类脑芯片异构混合推理系统的发布,标志着国内找到了一条依靠架构创新弥补硬件工艺约束的可行路径。它证明依托现有成熟工艺的本土芯片,通过异构协同的系统设计,也能够打造出对标国际下一代异构推理方案的算力平台。
该成果不仅丰富本土大模型推理的技术路线,也为国内AI算力自主发展提供重要参考。随着这套异构推理方案持续落地、框架开放,将进一步释放国内芯片潜力,助力国内大模型、多智能体应用规模化落地,夯实智能时代自主可控的算力根基。
本文转自媒体报道或网络平台,系作者个人立场或观点。我方转载仅为分享,不代表我方赞成或认同。若来源标注错误或侵犯了您的合法权益,请及时联系客服,我们作为中立的平台服务者将及时更正、删除或依法处理。
