rick awsb ($people, $people)
rick awsb ($people, $people)|2026年08月19日 17:26
独立开发者 Ash Hart(@ashxhart)今天分享了一项个人ai服务器配置降本增效的方法——MCDMA(Metal CUDA Direct Memory Access)。 这可能是目前个人配置能跑deepseek v4 flash性价比最高的方法 它让 Apple Silicon Mac 的 Metal 统一内存,和 NVIDIA CUDA 设备的显存之间,通过一根 USB-C 线就能实现接近 RDMA 的直接内存访问。 两台 NVIDIA DGX Spark(每台 128GB 统一内存)通过 ConnectX-7 互联,负责 Prompt Processing(prefill)。 每台 Spark 再用独立 USB-C 链路连接到一台 Mac Studio,负责 Decode(生成)。 两根链路并发工作。 Mac 可以直接把数据写进 Spark 的 CUDA 内存,Spark 也能直接写回 Mac,双方对等,没有主从关系。 单台 Spark 官方支持约 2000 亿参数(量化后),双 Spark 互联可到约 4050 亿参数。 加上 Mac Studio 的统一内存后,作者表示理论上可以把内存池化到 512GB 级别,跑更大的单模型。他目前主要在跑 DeepSeek V4 Flash,并认为社区后续完全可以测试更极限的分片方案。 互联带宽已经实测: 单链路约 939 MB/s Mac → 两台 Spark 并发约 1.80 GB/s 两台 Spark → Mac 并发约 1.25 GB/s 往返延迟仅 24 µs 完整的 tokens/s 基准测试作者承诺本周开源并公开。目前参考单设备表现:单台 Spark 生成大约 14–20 tok/s,Mac Studio / M 系列在优化(含 speculative decoding)后通常能到 25–45+ tok/s。混合方案的目标是让 Spark 加速 prefill、Mac 发挥高带宽优势做 decode,理论上兼顾规模与速度。当前 USB 控制器仍有锁定,作者正在推动 NVIDIA 解锁更高带宽,后续还有提升空间。 这套方案最大的价值,是把 Apple MLX 生态 和 NVIDIA CUDA 生态 用最简单的 USB-C 连接起来,实现真正的跨平台分布式本地推理。它既解决了单台机器内存不够的问题,又尽量避开了复杂网络配置。 这样看来,mac还得涨价。。。(rick awsb ($people, $people))
分享至:

热门快讯

APP下载

X

Telegram

Facebook

Reddit

复制链接

热门阅读