在这个人人都在聊云 GPU 租借和推理 API 的时代,有玩家选择了一条更“硬核”的路:在自己的服务器机架里堆上 36 个 NVIDIA DGX Spark,组成 4.6TB 统一内存的本地 AI 集群。这听起来像是另一个维度的玩具,但它的决策逻辑其实非常清晰:数据主权优先、统一内存可扩展、以及设备随时可以二手变现升级。这篇文章把这次扩容的配置、选择理由和真实约束整理出来。
从 16 到 36:扩容后的硬件清单
作者年初先搭了 16 个 DGX Spark 的集群,这次又加 20 个,最终规格如下:
- 36 个 DGX Spark 节点
- 1 台 200Gbps 的 FS 交换机,带 24 个 200Gb QSFP56 端口和 8 个 400Gb 端口
- 24 根 QSFP56 DAC 线缆
- 6 根 400Gb 转 2x200Gb 分支线缆
- 统一内存总计 4.6TB
这个集群并不只用来跑单发推理请求。作者把节点拆成多个“推理模块”,再用 Hermes 和一套自建内存 sidecar 系统,把它们编排成一个常驻 agent。也就是说,这更像一个“agent 能力集群”,而不是单纯的一台大号推理服务器。
为什么不用 B200/B300,或者更多 6000 Pro?
很多人会问,为什么不直接买 B200、B300 甚至几台 6000 Pro。作者给了几个很实际的理由:
- 散热和电力:B200/B300 放进家庭环境,会带来比现在还要严重的冷却和能耗问题。
- 数据主权:这整套构建的核心目标是完全本地化,不依赖任何数据中心或第三方存储。
- 统一内存性价比:作者认为 Spark 目前依然是可扩展统一内存里最划算的选择。等到 M5 Ultra 出来,再尝试把 Mac Studio 加入、研究分离式推理,会有更大的收益。
- 灵活性和流动性:Spark 和 6000 Pro 的组合在配置、功耗优化上非常灵活,想换新设备时也更容易二手处理。
作者的机架里还有两台 6000 Pro 系统:一台 4x Max Q 低功耗版,一台 8x 企业服务器,它们替代了之前用过的 H100 和 GH200。
这套设备大约花了多少钱?
按目前的市场行情粗算,包含交换机和线缆在内,这套系统大约要 20 万美元。有用户开玩笑说“我以为 16 个 Spark 已经很顶了”,也有人说“我 2 个 Spark 跑 DeepSeek 就觉得是个人物,结果发现自己在小联盟”。侧面说明这个建造成本和规模,确实不是普通玩家能轻易复制的。
什么人会建这样的个人集群?
作者自述有稳定的工作(带医疗福利)、几个自己的公司,还在做 AI 领域的顾问。即使不直接拿设备去变现,它对他手里所有的事情都带来了巨大帮助。有人评价得很精辟:有的人在车库里放一辆入门级超跑,有的人在机架上放一大堆 Spark。
如果你想动手,先从控制规模开始
这种规模的集群不是给大多数人准备的。如果你也想走类似路线,建议先试 2-4 台 Spark 或二手 6000 Pro,跑通自己的推理和 agent 工作负载,再评估功耗和噪音。真正需要做的功课是供电、散热和网络布线——否则你得到的不是 AI 集群,而是一个电费黑洞。