最近又有人问我:既然 Mac Studio 的 M3 Ultra 可以配置到512GB统一内存,整整是 DGX Spark 的四倍,那么它是不是更适合运行大模型?甚至可以直接替代 DGX Spark?
上面的视频转自@Edstion-Ai
搭载 M3 Ultra 芯片的新款 Mac Studio并不是什么新产品,其发布和发货时间节点如下:
发布时间:2025年3月5日(北京时间)。苹果官方通过新闻稿正式发布了这款迄今最强大的 Mac 桌面设备(与搭载 M4 Max 的版本一同推出)。正式发货/发售时间:2025年3月12日(星期三)。补充细节: 由于 M3 Ultra 顶配版本(特别是本文提到的 512GB 统一内存 + 16TB 固态硬盘 这种怪兽级配置)极为抢手且产能受限,在 3 月 12 日首发当天,选择顶配定制版的用户普遍遇到了约两周的延迟,订单大多被推迟到了 2025 年 3 月底甚至 4 月初才陆续送达。
从纸面参数看,Mac Studio 的确很凶猛:512GB统一内存、819GB/s内存带宽、最高32核CPU和80核GPU。DGX Spark只有128GB统一内存,带宽也只有273GB/s。
但真正把这两台机器摆在一起,就会发现它们并不是同一类产品。
Mac Studio更像一台拥有超大共享内存的全能专业工作站;DGX Spark则更像一台缩小到桌面上的CUDA AI开发服务器。
谁更适合你,不能只看内存容量。
很多人习惯把它叫作“M3 Ultra CPU”,严格来说并不准确。
M3 Ultra是一颗完整的SoC,其中集成了CPU、GPU、32核Neural Engine、媒体编解码引擎以及统一内存控制器。标准版本为28核CPU加60核GPU,最高可以配置到32核CPU加80核GPU,统一内存带宽为819GB/s,内存容量最高512GB。
DGX Spark内部的GB10同样不是传统意义上的“CPU加独立显卡”。它把20核Arm CPU和Blackwell GPU结合在一个Grace Blackwell平台中,CPU和GPU共享128GB LPDDR5X内存,并通过一致性内存架构协同工作。
因此,两台机器都有统一内存,但设计目标完全不同。
需要特别注意:DGX Spark标称的“1 PFLOP”是在FP4低精度并启用稀疏计算的特定条件下得到的AI指标,不能直接拿来和Apple GPU的通用计算能力比较。
Mac Studio最大的吸引力,不是某一个AI算力数字,而是512GB容量和819GB/s带宽同时出现在一台桌面电脑里。
这相当于给CPU和GPU准备了一个巨大的公共仓库,而且仓库通道非常宽。
大模型首先要解决的不是“算得快不快”,而是“能不能装进去”。
可以做一个非常粗略的估算:
不考虑量化尺度、缓存和运行时开销时:
因此,512GB Mac Studio不仅可以轻松容纳32B、70B和100B级模型,还能够尝试405B甚至671B级量化模型。
Apple官方也宣称,512GB版本可以在本地运行超过600B参数的大模型。这个说法显然不可能指BF16全精度权重,而必须建立在量化、压缩和特定软件实现之上。
不过,装得进去和跑得实用是两回事。
一个671B模型即使能够完整放进512GB统一内存,每生成一个Token,仍然需要读取大量权重。模型结构、量化格式、上下文长度、KV Cache、MoE激活方式和推理框架,都会影响最终速度。
所以,512GB Mac Studio的正确理解不是“可以高速运行所有大模型”,而是:
它把很多原来根本无法在单机内存里展开的实验,变成了至少可以启动、观察和研究。
DGX Spark的内存带宽是273GB/s,M3 Ultra是819GB/s,纸面上正好达到三倍。
在单用户、Batch Size较小的对话式LLM推理中,模型解码阶段经常受到内存带宽限制。每生成一个Token,GPU都要不断从内存中读取模型权重。因此,在模型格式和软件优化水平接近时,更高的带宽通常有助于提高Token生成速度。
但是,这不代表Mac Studio在所有AI任务中都会快到三倍。
大批量推理、Prompt Prefill、模型训练、矩阵计算和低精度Tensor运算,可能更多受到GPU计算单元、内核优化和软件框架影响。DGX Spark的Tensor Core、FP4支持以及NVIDIA推理软件栈,在这些场景中仍然具有明显意义。
M3 Ultra不仅有大内存,还有两套视频解码引擎、四套视频编码引擎以及四组ProRes编解码引擎,支持H.264、HEVC、ProRes、ProRes RAW和AV1解码。
对于经常处理技术交流视频、提取字幕、剪辑演示录像、压制公众号视频的人来说,Mac Studio可以把很多工作集中到一台机器中:
视频导入、音频提取、语音识别、字幕处理、视频剪辑、降噪、调色、编码和导出,都可以在同一个macOS环境里完成。
DGX Spark也有NVENC和NVDEC,但官方硬件规格只有一套编码和一套解码引擎。它首先是一台AI开发设备,并不是专门为多路ProRes剪辑和影视后期设计的。
如果只比较128GB和512GB,DGX Spark似乎已经输了。
但DGX Spark真正卖的并不是内存容量,而是下面这几个字:
NVIDIA AI软件生态。
大量AI项目默认围绕CUDA开发,包括:
DGX Spark预装NVIDIA AI软件环境,官方建议通过NGC容器使用经过适配的PyTorch、vLLM和TensorRT-LLM。
这带来一个很现实的优势:
在DGX Spark上开发和验证的模型,更容易迁移到配备RTX PRO、L40、H100、H200、B200或者其他NVIDIA GPU的数据中心和云端环境中。
而Mac上的Metal、MLX和Core ML,本质上是另一条技术路线。模型虽然可以转换过去运行,但它和企业里常见的CUDA服务器并不是完全相同的开发、调试和部署环境。
如果工作的目标是“在桌面上验证,随后部署到NVIDIA服务器”,DGX Spark明显更加顺手。
DGX Spark的Blackwell GPU带有第五代Tensor Core,并支持FP4低精度AI计算。NVIDIA给出的指标是在稀疏条件下最高1 PFLOP FP4性能。
对于已经针对Tensor Core优化的模型,特别是TensorRT-LLM、NVIDIA量化工具链和大批量推理,专用Tensor Core可能比单纯增加内存带宽更加重要。
Mac Studio虽然有32核Neural Engine,但在当前常见的本地LLM工作流中,主要承担计算任务的通常仍然是Apple GPU和统一内存,而不是Neural Engine。
Apple自己的MLX框架目前主要把计算放在CPU和GPU上,并利用统一内存避免CPU与GPU之间反复复制数据。
换句话说,不能简单地把“32核Neural Engine”和“第五代Tensor Core”当成两个可以逐项对比的产品参数。
DGX Spark运行Linux系统,带有10GbE和ConnectX-7高速网卡,并提供两个QSFP网络接口。单台机器支持最高200B级模型,两台Spark还可以通过高速网络组合,用于405B级模型。
它很适合放在办公室里,作为一台长期开机的AI节点:
Mac Studio当然也能运行Web服务和容器,但它更像一台安静、强大的个人工作站;DGX Spark从产品思路上就更接近“小型AI基础设施”。
这是我自己非常关心的场景。
公司经常有产品培训和技术演示视频,需要从视频里提取音频,再用faster-whisper生成字幕,最后整理成总结报告。
faster-whisper的核心执行引擎是CTranslate2。当前CTranslate2官方已经提供Linux AArch64的Python Wheel,并支持Linux下的NVIDIA GPU执行。
因此,从系统架构上看,DGX Spark适合继续使用:
FFmpeg → faster-whisper → 字幕文件 → 文稿整理 → 视频回写
问题在于,DGX Spark同时涉及Arm64、Blackwell、CUDA、cuDNN和CTranslate2版本匹配。只要其中一个环节没有及时适配,就可能出现“硬件很强,软件却暂时跑不起来”的情况。
这也是DGX Spark刚买回来时容易踩坑的地方:它不是普通的x86电脑加一张NVIDIA显卡,而是一个相对较新的Arm+Blackwell平台。
CTranslate2的macOS ARM64版本可以安装,但其官方预编译包的GPU执行主要面向Linux和Windows上的CUDA环境。Mac没有CUDA,因此不能指望把原来的faster-whisper CUDA流程原封不动搬过去。
Mac Studio更合适的路线是:
Apple的MLX示例项目已经包含Whisper语音识别,也包括LLM、LoRA、QLoRA、图像生成和视频生成等示例。
不过,即便使用同一个Whisper large-v3模型,不同推理引擎在分段、Beam Search、VAD、时间戳和解码参数上也可能存在差异。不能只看速度,还需要拿公司过去积累的中文技术交流录音做一轮准确率和时间戳测试。
Whisper large-v3并不是一个需要数百GB内存的模型。
如果购买512GB Mac Studio只是为了跑Whisper、整理字幕或者运行32B本地模型,那么配置明显过高。Whisper真正需要的是成熟的软件适配、可靠的批处理脚本和稳定的GPU加速,而不是半TB内存。
结合我自己比较关注的模型,可以简单划分如下。
例如DeepSeek-R1蒸馏版32B、Qwen系列32B。
两台机器都能轻松容纳。DGX Spark可以通过CUDA、vLLM或者TensorRT-LLM运行;Mac Studio则可以通过MLX、llama.cpp类工具或者LM Studio运行。
在这个级别,没有必要为了容量从128GB升级到512GB。
两台机器仍然都很适合。
NVIDIA官方给DGX Spark的定位是最高支持70B级模型微调、200B级模型推理。这里的“微调”通常需要结合具体精度、LoRA或其他节省显存的方法理解,不能等同于任何条件下都能进行70B全参数训练。
Mac Studio则拥有更大的内存余量,可以使用更高精度、保留更长上下文,或者同时运行Embedding、Reranker和主模型。
这时差距开始变得明显。
一个235B模型使用4bit量化,仅权重理论值就接近117.5GB。对于128GB DGX Spark来说,除去操作系统、运行时、KV Cache和量化元数据以后,空间会非常紧张。
虽然NVIDIA官方宣称单台DGX Spark支持最高200B参数模型推理,但这显然需要合适的量化格式、上下文长度和软件优化。
512GB Mac Studio在容量方面会从容得多。
这正是512GB Mac Studio最有吸引力的领域。
405B模型的4bit权重理论上约203GB,671B模型约336GB。即使加入量化信息和运行时开销,512GB仍然提供了相当可观的空间。
单台DGX Spark基本不属于这个容量级别。两台DGX Spark可以按照NVIDIA官方方案尝试405B模型,但两台机器之间的数据交换、并行框架和模型切分都会提高部署复杂度。
所以,如果目标是在一台桌面机器里研究DeepSeek-V3、DeepSeek-R1全尺寸模型或者其他600B级量化模型,512GB Mac Studio的容量优势是实实在在的。
只是还要再强调一次:
可以把模型装进内存,不代表一定能够获得令人满意的生成速度。
超大模型单机推理和研究
需要在一台机器中容纳200B、400B甚至600B级量化模型,又不想搭建多GPU服务器。
视频、音频和内容生产
大量技术视频剪辑、ProRes处理、字幕生成、图片处理、三维渲染和多媒体导出。
一台机器完成全部日常工作
除了AI,还要同时处理浏览器、Office、图片、视频、编程、音乐和多屏显示。
需要大容量GPU可访问内存的专业应用
例如3D渲染、超大场景、科学数据处理、基因测序、视觉特效和大型数据集分析。Apple也把512GB统一内存重点用于LLM、3D、视觉特效和科学计算场景。
CUDA原生AI开发
项目依赖CUDA、TensorRT-LLM、vLLM、NGC、NVIDIA NeMo或其他NVIDIA框架。
模型微调和部署验证
希望在桌面上完成原型开发,再迁移到NVIDIA服务器、数据中心GPU或者云端。
公司内部AI服务器
需要长期开机、远程SSH、Docker部署、Open WebUI、API服务和多人访问。
机器人、视觉和边缘AI
使用Isaac、Metropolis、Holoscan或者其他NVIDIA边缘AI框架。
需要高速网络互连
ConnectX-7和QSFP接口使DGX Spark更容易进入多节点AI和高速网络实验环境。
结合我平时的工作内容,我的结论并不是“Mac Studio比DGX Spark强”,也不是“DGX Spark才是真正的AI机器”。
更准确的判断是:
这类任务的核心问题不是128GB不够,而是要把Arm64、CUDA、容器和推理框架真正配置稳定。
如果DGX Spark目前没有充分利用起来,仅仅再买一台512GB Mac Studio,并不会自动解决软件部署和工作流问题。
从这个角度看,Mac Studio不是DGX Spark的升级版,而是另一种方向。
如果只看内存容量和带宽:
Mac Studio M3 Ultra明显占优。
它拥有四倍内存容量和三倍理论内存带宽,特别适合单机加载超大模型、处理大型媒体工程和承担综合性专业工作。
如果看AI开发生态、低精度Tensor计算和未来部署路径:
DGX Spark仍然有自己的护城河。
CUDA、TensorRT-LLM、vLLM、NGC和NVIDIA服务器生态,使它更适合真正围绕NVIDIA平台进行模型开发、微调、验证和部署。
可以用一句话概括这两台机器:
Mac Studio是一座容量巨大、传送带很宽的全能仓库;DGX Spark是一间面积小一些、但设备和接口都按照NVIDIA AI生产线布置好的实验室。
对于已经拥有DGX Spark的人来说,如果日常只是跑Whisper、32B或70B模型,没有必要因为看到512GB这个数字就急着换机器。
只有当工作负载真正跨入200B、400B甚至600B级模型,或者希望把AI、视频剪辑和日常生产全部集中到一台桌面工作站上时,M3 Ultra+512GB才会体现出它不可替代的价值。
真正专业的比较,最后一定要落到同一个模型、同一种量化、同样的上下文长度、同样的Batch Size和同一套测试数据上。
脱离这些条件讨论“谁每秒能跑多少Token”,往往只是在比较两张产品宣传页。
更多PCIe5&6.0, CXL, NVMe SSD, SAS/SATA, NVMe over Fabric (NVMoF), NAND,新型存储技术NVM(RRAM/ReRAM, FRAM/FeRAM, MRAM, PCM, 3D-NOR, SRAM/DRAM等) DDR5/LPDDR5以及UFS测试方面的问题想咨询,可以查看Saniffer公司2026.2.24最新更新的测试工具白皮书15.1版本,我们已经整理收录在Saniffer公众号的【白皮书】菜单中。
欢迎关注Saniffer公众号,点击底部菜单栏即可免费获取。如有任何技术问题,也可直接在公众号内留言交流。