rick awsb ($people, $people)|2026年08月19日 17:26
独立开发者 Ash Hart(@ashxhart)今天分享了一项个人ai服务器配置降本增效的方法——MCDMA(Metal CUDA Direct Memory Access)。
这可能是目前个人配置能跑deepseek v4 flash性价比最高的方法
它让 Apple Silicon Mac 的 Metal 统一内存,和 NVIDIA CUDA 设备的显存之间,通过一根 USB-C 线就能实现接近 RDMA 的直接内存访问。
两台 NVIDIA DGX Spark(每台 128GB 统一内存)通过 ConnectX-7 互联,负责 Prompt Processing(prefill)。
每台 Spark 再用独立 USB-C 链路连接到一台 Mac Studio,负责 Decode(生成)。
两根链路并发工作。
Mac 可以直接把数据写进 Spark 的 CUDA 内存,Spark 也能直接写回 Mac,双方对等,没有主从关系。
单台 Spark 官方支持约 2000 亿参数(量化后),双 Spark 互联可到约 4050 亿参数。
加上 Mac Studio 的统一内存后,作者表示理论上可以把内存池化到 512GB 级别,跑更大的单模型。他目前主要在跑 DeepSeek V4 Flash,并认为社区后续完全可以测试更极限的分片方案。
互联带宽已经实测:
单链路约 939 MB/s
Mac → 两台 Spark 并发约 1.80 GB/s
两台 Spark → Mac 并发约 1.25 GB/s
往返延迟仅 24 µs
完整的 tokens/s 基准测试作者承诺本周开源并公开。目前参考单设备表现:单台 Spark 生成大约 14–20 tok/s,Mac Studio / M 系列在优化(含 speculative decoding)后通常能到 25–45+ tok/s。混合方案的目标是让 Spark 加速 prefill、Mac 发挥高带宽优势做 decode,理论上兼顾规模与速度。当前 USB 控制器仍有锁定,作者正在推动 NVIDIA 解锁更高带宽,后续还有提升空间。
这套方案最大的价值,是把 Apple MLX 生态 和 NVIDIA CUDA 生态 用最简单的 USB-C 连接起来,实现真正的跨平台分布式本地推理。它既解决了单台机器内存不够的问题,又尽量避开了复杂网络配置。
这样看来,mac还得涨价。。。(rick awsb ($people, $people))
分享至:
热门快讯
APP下载
X
Telegram
复制链接