【方案精选】瑞芯微RK182X,爱芯元智AX650N,后摩智能漫界M50等

来源:半导纵横发布时间:2026-09-21 11:16
AI芯片
技术进展
生成海报
本期主题:端侧大模型芯片

本期我们精选了5款 端侧大模型芯片 应用的相关产品或解决方案。如果您有相关产品的使用经验,或者有想了解的问题,欢迎评论区留言讨论。

大模型往下沉,是这两年芯片行业最确定的一条主线。从云端跑到手机、平板、PC,再到机器人、座舱,智能要从“上传到云”变成“就地想明白”。可真要落到端侧,最先卡住的往往不是算力堆得够不够大,而是冯·诺依曼架构里那几堵老墙:内存墙、带宽墙、功耗墙。算力再高,数据在存储与计算单元之间来回搬运的能耗,就能把大半功力耗在途中。于是端侧大模型的竞争,表面是 TOPS 之争,底层是“怎么让数据少搬一步”的架构之争。

瑞芯微 RK182X

 RK182X 作为一颗“高性能协处理器”,通过 PCIe 2.0 或 USB 3.0 外挂到主处理器边上,专门替它扛下大模型推理这件事。RK182X 的破墙思路,是把“内存墙”和“带宽墙”从物理上搬掉——用 3D 堆叠封装,把高带宽 DRAM 直接码在芯片里,让 NPU 和内存近到几乎零距离,省掉了传统 SoC 里“外挂内存、走总线搬运”那一大段开销。
跑大模型,瓶颈在带宽,—RK1828 跑 Qwen2.5-7B,首帧约 160ms,生成速度 50+ token/s;换到 Qwen3-8B 是 61.11 TPS,Qwen2.5-Omni-3B 更是做到 102.63 TPS。多卡级联还能往上摸到 Qwen3 系列的 9B、27B。对整机厂来说,RK182X 意味着一条最低成本的“端侧大模型”上马路径:无需重做主机,外挂一颗协处理器即可。
核心规格:
  • 定位:面向人工智能应用的高性能协处理器芯片
  • CPU:内置多核 RISC-V(SRV 加双 VRV,VRV 带 128-bit 向量单元与 FPU)
  • NPU:自研高算力 NPU,最高 20 TOPS@INT8,支持 INT4/INT8/INT16/FP8/FP16/BF16 混合精度
  • 存储:3D 堆叠封装内置 2.5GB(RK1820)/ 5GB(RK1828)高带宽 DRAM,eMMC 4.51
  • 互联:PCIe 2.0、USB 3.0 与主处理器高速互联(2×PCIe2x1、RGMII)
  • 多模态:RGA、4K JPEG 解码
  • 模型:本地化部署 3B/7B 大语言模型及传统 CNN 推理
  • 软件:RKNN3 SDK V1.0.0,支持 0.5B~8B 模型
典型应用: 端侧大模型加速(平板、PC、AI 主机)、机器人、智能座舱、边缘推理

后摩漫界 M50

后摩智能把计算直接做进存储单元,从根上消灭“数据搬运”这个环节。漫界 M50 是它专为大模型推理打造的端边芯片,也是本期五款里商业落地最实的一颗:联想 AI 主机 P7、长城 AI 笔记本 N90 Pro,都已经把它装进量产整机。
10W 的典型功耗约等于一次手机快充; 160 TOPS,配上最大 48GB 内存和 153.6GB/s 带宽,能本地跑 7B 到 70B 的参数。量产方面,长城 N90 Pro 用它以 160 TOPS 端侧算力离线跑 35B 大模型,联想 AI 主机 P7 更是做到了在手掌大小的机身里流畅运行最高 1220 亿参数的本地大模型。
核心规格:
  • 架构:存算一体,自研“天璇”IPU 架构
  • 算力:160 TOPS@INT8、100 TFLOPS@bFP16
  • 精度:INT8 / INT16 / FP16 / FP32 / bFP16 / bFP24
  • 功耗:典型 10W
  • 内存:最大 48GB LPDDR5,位宽最大 192-bit,带宽最大 153.6GB/s
  • 互联:PCIe Gen4 X4,片间 HM-Link 16GB/s
  • 软件:后摩大道®软件栈,支持主流深度学习框架
典型应用: AI PC、家庭边缘设备、端边智能体、文搜图、会议纪要实时生成

灵汐领启 KA200(-S)

灵汐科技的领启 KA200(-S)把类脑计算、存算一体、众核并行、异构融合捏在同一颗芯片上,既能高效跑深度网络,也能跑脉冲神经网络,甚至能做大规模脑仿真。
KA200 能跑主流深度模型的 NPU、能仿脉冲神经网络的类脑单元、能做脑仿真的大规模突触计算。48 TOPS 峰值算力不算高,但 KA200 打的不是“堆算力”的牌,而是“一种架构同时覆盖云、边、端大模型与类脑计算”的特点——这是它能在电力、交通、低空这些敏感场景里站稳的根本。
核心规格:
  • 架构:存算一体、众核并行、异构融合(类脑)
  • 算力:48 TOPS@INT8、24 TFLOPS@FP16(混合精度)
  • 规模:单芯片集成 25 万神经元与 2500 万突触(稠密模式),可扩展至 200 万神经元与 20 亿突触(稀疏模式)
  • 能力:支持深度学习神经网络、生物神经网络与大规模脑仿真
  • 大模型:已完成 DeepSeek-R1-Distill-Qwen 1.5B、7B 适配
典型应用: 大模型云边端部署、类脑计算、脑仿真、电力能源、交通、城市治理、低空智能装备

爱芯元智 AX650N

爱芯元智 AX650N架构仍是主流的 ARM 加 NPU,但把功夫下在“混合精度”上——用 INT4、INT8 这类低比特量化,从源头上压小数据量。AX650N 是三年前就冲进 Transformer 端侧落地的那批“先行者”之一,官方早在 2023 实测数据显示:Transformer 网络 SwinT 跑到 361 FPS、精度 80.45%、能效 199 FPS/W,且直接用原版模型 PTQ 量化就能部署,不必重训。放到大模型语境,用 INT4 大幅压缩内存与带宽占用,让原本上不了端侧的模型有了落地的可能。

核心规格:
  • CPU:8 核 Cortex-A55 @1.7GHz,支持 NEON,集成 FPU
  • NPU:自研“爱芯通元”(AXNeutron)混合精度 NPU,最大 72 TOPS@INT4、18 TOPS@INT8
  • 存储:标准 8GB 64bit LPDDR4X(最大 32GB)+ 8GB eMMC
  • ISP:自研“爱芯智眸”AI-ISP,最高 8192×4320@30fps
  • 视频:解码最高 7680×4320@60fps,或 32 路 1080p@30fps
  • 大模型:原生支持 DeepSeek、Qwen、Llama 等主流 LLM/VLM 结构
  • 其他:双核 DSP 800MHz
典型应用: 边缘智能盒、边缘加速卡、视频会议、智慧城市、智慧教育、智能制造

嘉楠科技 K230

嘉楠科技的 K230 用 RISC-V 双核加自研 KPU,把端侧轻量 AI 推理的功耗、成本和启动速度压到极致。K230 的机组网络实测帧率:ResNet50 跑 85fps、MobileNet_v2 跑 670fps。端侧轻量推理,用户要的不是一个峰值数字,而是“我这一路摄像头到底能跑多少路”。它的双核 C908 里,CPU1 主频拉到 1.6GHz 还带 RVV1.0 向量扩展,RISC-V 的开放生态加上 KPU 的稀疏压缩,让它在门锁、词典笔、扫码识别、3D 结构光模组这些“跑量”场景里,比一味堆算力更有性价比。
核心规格:
  • CPU:双核 64 位 RISC-V 玄铁 C908(CPU0 最高 800MHz;CPU1 最高 1.6GHz,支持 RVV1.0、FPU、128-bit 向量单元)
  • 算力单元:自研第三代 KPU,支持 INT8 / INT16,权重稀疏压缩
  • 实测网络性能:ResNet50 ≥ 85fps、MobileNet_v2 ≥ 670fps、YoloV5S ≥ 38fps(均 @INT8)
  • 推理框架:支持 TensorFlow / PyTorch / TFLite / 飞桨 / ONNX
  • 深度:DPU 支持 3D 结构光深度计算,2.5D GPU
  • 特点:低延迟、低功耗、快速启动、高安全
典型应用: 智能门锁、家庭安防摄像头、词典笔、支付识别、3D 结构光模组、无人机、交互机器人

本文转自媒体报道或网络平台,系作者个人立场或观点。我方转载仅为分享,不代表我方赞成或认同。若来源标注错误或侵犯了您的合法权益,请及时联系客服,我们作为中立的平台服务者将及时更正、删除或依法处理。

评论
暂无用户评论