AI领域的加速浪潮,在PC市场引发了一场变革。主流芯片厂商纷纷踏上AI PC之路——在客户端设计中把Windows应用与专用的本地AI子系统结合起来;与此同时,还出现了专门为AI打造的盒子,主要用于本地加速模型与智能体。
去年,英伟达推出了DGX Spark,这是同类产品中第一台以“AI超级计算机”之名应对大语言模型(LLM)与智能体的PC。发布后不久,其他厂商也开始把自家迷你PC标注为专用AI盒子,不同阵营的竞争随之升温。本文将介绍DGX Spark的使用体验。
DGX Spark是首款搭载GB10超级芯片的系统。同样的芯片也将用于即将推出的RTX Spark平台。英伟达将GB10称为超级芯片,它把Grace Blackwell架构缩小到了迷你开发者PC与工作站上。
DGX Spark的设计理念,是用Blackwell GPU架构打造一台迷你AI超级计算机。为此英伟达开发了GB10超级芯片,把数据中心里的一系列创新:NVFP4、CUDA、SLANG、TensorRT、vLLM、CX-7网卡、NVLINK C2C、TMEM等下沉到迷你PC平台。这一切得以在小体积内实现,靠的是多芯粒封装技术、超低功耗的C2C互连以及统一内存架构(UMA)。
DGX Spark工作站具备以下关键特性:
GB10 Grace Blackwell超级芯片:加速AI、数据科学、通用计算、渲染与可视化
128GB一致性统一系统内存:可运行最高2000亿参数的大型AI模型,可微调最高700亿参数的模型
ConnectX-7网络:连接两台DGX Spark即可应对最高4050亿参数的模型
DGX Base OS与英伟达 AI软件栈:工作负载可在DGX Spark与DGX Cloud或任何加速数据中心/云基础设施之间无缝迁移
灵活的部署配置:可配置为AI工作站,或联网的个人AI云
出色的桌面体验:支持多屏显示与灵活连接
紧凑省电的设计:轻松摆上任何桌面,标准墙面插座即可供电
关于GB10超级芯片的具体规格。首先是SoC构成:芯片由两个小芯粒(dielet)组成——S-Dielet承载CPU、内存子系统等,G-Dielet承载GPU核心。两个小芯粒通过先进2.5D封装整合在一起,采用台积电3nm工艺制造。
CPU基于ARM Armv9.2架构,共20个核心,分为两个集群、每集群10核;每个核心有私有L2缓存,每个集群配16MB L3缓存,合计32MB。第一个集群基于Cortex-X925设计,第二个集群基于Cortex-A725设计。
GPU基于GB100 Blackwell架构,由于与CPU在同一封装、同一硅片上,属于核显(iGPU)。它配备第五代Tensor Core,支持DLSS 4与RTX光线追踪核心;FP32算力最高31 TFLOPS,AI工作负载的NVFP4(FP4)算力达1000 TOPS。GPU另有24MB L2缓存。
内存系统方面,GB10超级芯片SoC支持256位LPDDR5x(UMA),速率最高9400 MT/s,原始带宽最高301 GB/s,最大容量128GB。系统织构(fabric)是高性能一致性织构,支持CHI-E一致性协议;GPU通过C2X接口可访问整个系统600 GB/s的聚合带宽。
此外还有16MB系统级缓存,作为CPU的L4,让SoC上多个引擎之间能以低功耗共享数据。C2C接口同样高带宽、低功耗,基于英伟达的NVLink架构实现。
连接性方面,GB10超级芯片SoC提供PCIe、USB、基于PCIe的以太网,最多驱动4台显示器同时输出(3个DP+1个HDMI):DP Alt模式下最高4K@120Hz,HDMI 2.1a下最高8K@120Hz。安全特性包括双安全根(Dual Secure Root)支持、SROOT处理器、OSROOT处理器,以及对fTPM和独立TPM的支持。整颗芯片TDP为140W。
扩展性是GB10超级芯片的另一个有趣之处。可以通过英伟达 ConnectX技术连接多颗GB10芯片,扩展吞吐、带宽与DRAM容量,以支撑更大的AI模型。ConnectX网卡通过PCIe Gen5 x8接口连接GB10 SoC,多台设备之间用以太网通信。
英伟达称GB10超级芯片SoC是其与联发科成功合作的成果:CPU IP来自联发科。针对GPU内存流量进入联发科内存子系统,双方做了大量性能建模工作。
DGX Spark配备4TB NVMe存储,速度很快,运行在Gen5 x4规格上。
对新手来说,设置DGX Spark可能有些棘手,不过英伟达为大部分基础功能提供了设置指南。棘手之处在于:如果你来自Windows平台,适应基于Ubuntu 24.04.4(LTS)的英伟达 DGX OS需要一段时间。
DGX Spark首发时缺少大多数基础应用,需要另行安装;但最新批次的机器已经预装配置好了DGX Dashboard和英伟达 Sync,这两个是监控Spark状态的必备应用。如果需要自行安装,通过机载终端设置DGX Dashboard和英伟达 Sync也就15到30分钟,复制粘贴、照着操作手册(playbook)走即可。
开箱即预装Firefox、固件更新器以及其他Linux发行版上常见的基础应用,界面做了DGX Spark主题适配。首次开机时Spark会下载更新,需要一些时间(本测试用了约45分钟)。
设置菜单里可以配置分辨率等各项参数,驱动4K显示器跑240Hz毫无压力;完整的更新菜单也在这里,确保软件与应用运行在最新版本。
DGX Spark上的大部分操作要么在终端应用里完成,要么在JupyterLab里完成。JupyterLab界面可以直接从DGX Dashboard启动,Dashboard还提供单独的本地应用更新菜单,并能很直观地可视化系统内存与GPU利用率。
本测评可以用ConnectX-7线缆把两台DGX Spark堆叠成一个集群。这既可以通过终端手动完成,也可以交给英伟达 Sync应用(后者效果更好)。操作手册简单明了,我们很快就让两台DGX Spark通过200 Gbps网络跑在同一个IP下。Sync应用还会通过一个短测试评估网络速度(实测185.75 Gbps,高于预期的180 Gbps门槛),之后就可以在双机集群配置下运行本地模型,可用内存达到256GB。
你可以堆叠任意多台DGX Spark——我们听说过最多18台的例子,而英伟达表示还能更多。考虑到模型规模持续扩大、速度持续提升,对本地AI开发者来说,两台或四台应该是最佳规模。
进入基准测试环节。DGX Spark不会堆叠CPU核心或GPU核心,所以基础基准测试只能以单台Spark为限。本文在系统上跑了Geekbench 7。
单核测试中,DGX Spark得分2568;多核测试得分23656。
这颗20核Arm CPU的单核表现不错,竟然快于最高5.1GHz的锐龙AI MAX+ 395——要知道DGX Spark的频率低得多。多核成绩则更亮眼,接近线程数更多的x86桌面产品,领先于移动端SoC。即将推出的RTX Spark PC所用芯片CPU规格相近,但频率经过优化,预计成绩会更好——DGX Spark本身面向7×24小时工作站与开发者使用场景调校。
游戏方面,我们通过Steam运行《赛博朋克2077》,使用Proton 11.0“Experimental”版本与Steam Linux Runtime 4.0。照着几个月前Reddit上已有的指南操作,游戏完美运行,全部RTX特性均可开启。
首先想介绍GB10超级芯片的原生GPU能力。它的核心数量与RTX 5070相同,但受140W TDP限制——而且功耗预算要与内存、CPU共享——GPU实际可用功耗大约在90到100W。
1440p分辨率、RT Ultra预设下,帧率为28.70 FPS;1080p下为59.34 FPS。1080p、高画质、不开光追,DGX Spark能超过100 FPS,AMD锐龙AI MAX+只能跑到80到90 FPS左右。
此外还有一些与RTX 50系列家族相同的好东西:DLSS多帧生成(MFG)、DLSS 4.5 Transformer以及DLSS 4.5光线重建。开启这些特性后,1440p RT Ultra预设下可达95.15 FPS,1080p下可达140 FPS。
再次强调,这只是RTX Spark PC的预演——后者将在Windows系统上提供更好的优化与支持。
本测试挑选了Hugging Face上广受欢迎且相对较新的模型,在llama.cpp中运行。英伟达提供了配置各种推理引擎的操作手册,包括llama.cpp、vLLM、LM Studio等。不同推理引擎各有优势,具体选择取决于你需要的输出类型。
DGX Spark在各种量化权重下都给出了扎实的成绩。单节点测试覆盖从4B到120B(GPT-OSS)的模型。DGX Spark的token生成速度很快,而以它的小体积而言,提示处理(prompt processing)能力更是凶猛。
我们还测试了几款MoE(混合专家)模型——这类模型本质上是用小模型的快速处理速度,提供大模型的海量知识容量。测试包括单节点与多节点(2×DGX Spark)两种配置。其中,最新的DeepSeek V4 Flash(NVFP4,transformers加载)单节点给出21.3 TPS,双集群节点给出59.13 TPS——这款2840亿参数的模型借助256GB可用显存,速度提升超过2倍。
MiniMax-M2.5(4-bit)无法塞进单台Spark,但双Spark集群给出了40.12 TPS的生成速度。其他模型,如英伟达开源的1200亿参数Nemotron 3 Super,在集群配置下也运行良好。
模型背后有合适的软件与支持非常重要,这就涉及调优。英伟达一直在持续打磨DGX/RTX平台的LLM性能与智能体能力。公司最近推送了最新更新(本月可用),在主流推理平台上带来更快性能,并为OpenClaw等Agentic AI平台提供一键安装选项。
本测试通过ComfyUI尝试了一些生成式AI,用了Flux.2、SDXL Turbo等模型,英伟达同样提供了本地配置ComfyUI的完整指南,设置很简单。图像处理速度不错,一分钟可生成6到7张1024×1024图片。
温度方面,DGX Spark确实会发热,但你几乎听不到风扇声。只有在真正把设备推到极限时,才会明显感觉到排出的热气。我们测得空载温度48°C,峰值温度81°C。
功耗方面,虽然DGX Spark额定最高140W,但即便是在Prefill Heavy(预填充密集)场景下,我们也几乎没见过它超过100W。单台Spark的平均功耗接近80W;双机配对时,第二台通常比主机低5到10W。
DGX Spark不只是又一台紧凑工作站,它是定义了一个品类的机器。一台安静、用普通墙面插座供电的系统,把700亿参数微调、2000亿参数推理当作日常工作,而不是需要向数据中心预约的资源。
GB10本身才是真正的主角:两颗紧耦合的小芯粒、128GB一致性统一内存、NVLink-C2C、第五代Tensor Core,以及ConnectX-7网络织构:让两台机器在几分钟内组成256GB集群。正因如此,2840亿参数的DeepSeek V4 Flash才能从单台21 TPS跃升到双台59 TPS,单节点根本装不下的模型突然变得可用。
英伟达的指南与各类操作手册帮了大忙,不过一些内容有些过时。多数并不像宣传的那样简单复制粘贴即可,不得不翻遍各类代码仓库与论坛,才能确保运行的模型最适合Spark。
软件栈:DGX OS、Dashboard、英伟达 Sync以及不断扩充的一键操作手册库,把一个原本可能只是Linux爱好者科学项目的东西,变成了开发者在首次开机更新之后真正能日常使用的工具。
DGX Spark并非为游戏设计,但硬件表现暗示了RTX Spark平台未来的交付能力。《赛博朋克2077》在1440p、全光追、DLSS 4多帧生成下达到95 FPS,而GPU功耗不到100W,这是一个体面的预览。
不过,主角始终是本地智能体、长上下文RAG与不离桌面的多节点实验。温度保持得体,风扇保持安静,实际功耗很少超过80到100W。这些数字很重要:意味着你可以让一对Spark跑一整夜,而不必担心电费或噪音。
一年过去,DGX Spark依然像是所有人对照衡量的参考设计,初代Spark是一台证明了个人AI超级计算机真的可以摆在桌面上干活的产品。
本文转自媒体报道或网络平台,系作者个人立场或观点。我方转载仅为分享,不代表我方赞成或认同。若来源标注错误或侵犯了您的合法权益,请及时联系客服,我们作为中立的平台服务者将及时更正、删除或依法处理。
