当全球科技巨头还在为AI芯片的算力与功耗平衡而焦虑时,阿里达摩院用一颗RISC-V架构的CPU,给出了一份完全不同的答案——其今年3月发布的RISC-V旗舰CPU玄铁C950,现已成功原生运行通义千问Qwen3.8-27B大模型。
据悉,这是RISC-V架构芯片首次在不依赖GPU、无需任何模拟层的情况下,直接运行270亿参数级别的AI模型。
可能很多人对“原生运行”这四个字没有概念,简单来说,过去RISC-V芯片要跑大模型,通常需要借助翻译层或模拟环境。这相当于让一个说中文的人先把英文稿子翻成中文后再读——能读,但效率大打折扣。而玄铁C950这次是直接在硬件指令层面执行模型推理,没有中间转换,没有性能损耗。
资料显示,玄铁C950是阿里达摩院在2026年3月玄铁RISC-V生态大会上发布的旗舰级处理器。它采用了台积电5nm工艺制造,是一颗64位服务器级RISC-V处理器。芯片集成64个计算核心,每8核一组通过高速AMBA CHI总线互联,主频最高3.2GHz。
为了应对AI推理负载,玄铁C950搭载了自研的矩阵(Matrix)和向量(Vector)双AI加速引擎。其中,Matrix引擎单核可提供8TOPS的FP8算力,配合Vector引擎的并行处理能力,使得大模型的矩阵运算可以在CPU内部直接完成。

作为一款RISC-V处理器,玄铁C950基于开源指令集架构,这让阿里无需支付x86或ARM架构的高昂授权费用。更重要的是,其开源特性带来了更大的定制空间,阿里可以针对自己的AI模型,在硬件层面进行深度优化。
实测数据显示,基于玄铁C950运行通义千问3.8-27B模型,解码速度稳定在30 token/s,首Token延迟控制在1.9秒以内,标志着该纯CPU方案已具备成熟的商用推理能力。
相比之下,在传统GPU方案上运行270亿参数模型,通常需要16GB至24GB显存。而玄铁C950仅靠CPU加片上加速引擎即可完成推理,无需外接独立显卡。这意味着,企业可以用更低的硬件成本、更简单的系统架构,在边缘侧部署中等规模的大模型。
通义千问3.8-27B本身就是一款为部署场景优化的稠密模型,在编程与智能体任务上表现出色。它在SWE-bench Pro等专业基准测试中甚至超越了Anthropic的旗舰模型Claude Opus 4.6 Max,被开发者誉为“家用版Opus”。而玄铁团队同步完成了Day 0适配,在模型发布当天就打通了RISC-V平台上的完整推理链路。
凭借Qwen大模型与玄铁芯片的双轮驱动,阿里已构建起“芯模一体”的深度协同技术生态,实现了从底层算力硬件到上层人工智能算法的全栈式垂直整合。当模型厂商开始自己定义芯片、芯片厂商开始优化模型,这种“软硬协同”的效率,是传统分工模式难以比拟的。
当然,27B参数的模型和动辄千亿参数的大模型之间还有不小的距离。玄铁C950虽然也展示了对Qwen3-235B的支持能力,但实际落地效果和规模化商用仍需时间验证。不过,其在无GPU依赖下成功原生运行Qwen3.8-27B的突破,已为RISC-V架构开辟了一条极具潜力的AI算力新路径。
本文转自媒体报道或网络平台,系作者个人立场或观点。我方转载仅为分享,不代表我方赞成或认同。若来源标注错误或侵犯了您的合法权益,请及时联系客服,我们作为中立的平台服务者将及时更正、删除或依法处理。
