36 个 DGX Spark 组成本地 AI 集群,到底图什么?

文章导读
这篇文章从一位真实玩家的经历出发,记录了从16台到36台DGX Spark的本地AI集群升级之路。作者不仅列出了完整的网络和计算配置,还解释了为什么放弃 B200/B300,转向性价比更高的 Spark 与 6000 Pro 组合。文章同时讨论了约20万美元的成本、数据主权诉求,以及如何将集群拆成agent能力模块。最后给出了小规模试水和基础设施规划的建议,适合对本地大模型硬件感兴趣的读者。
📋 目录
  1. 从 16 到 36:扩容后的硬件清单
  2. 为什么不用 B200/B300,或者更多 6000 Pro?
  3. 这套设备大约花了多少钱?
  4. 什么人会建这样的个人集群?
  5. 如果你想动手,先从控制规模开始
A A

在这个人人都在聊云 GPU 租借和推理 API 的时代,有玩家选择了一条更“硬核”的路:在自己的服务器机架里堆上 36 个 NVIDIA DGX Spark,组成 4.6TB 统一内存的本地 AI 集群。这听起来像是另一个维度的玩具,但它的决策逻辑其实非常清晰:数据主权优先、统一内存可扩展、以及设备随时可以二手变现升级。这篇文章把这次扩容的配置、选择理由和真实约束整理出来。

从 16 到 36:扩容后的硬件清单

作者年初先搭了 16 个 DGX Spark 的集群,这次又加 20 个,最终规格如下:

  • 36 个 DGX Spark 节点
  • 1 台 200Gbps 的 FS 交换机,带 24 个 200Gb QSFP56 端口和 8 个 400Gb 端口
  • 24 根 QSFP56 DAC 线缆
  • 6 根 400Gb 转 2x200Gb 分支线缆
  • 统一内存总计 4.6TB

这个集群并不只用来跑单发推理请求。作者把节点拆成多个“推理模块”,再用 Hermes 和一套自建内存 sidecar 系统,把它们编排成一个常驻 agent。也就是说,这更像一个“agent 能力集群”,而不是单纯的一台大号推理服务器。

为什么不用 B200/B300,或者更多 6000 Pro?

很多人会问,为什么不直接买 B200、B300 甚至几台 6000 Pro。作者给了几个很实际的理由:

  • 散热和电力:B200/B300 放进家庭环境,会带来比现在还要严重的冷却和能耗问题。
  • 数据主权:这整套构建的核心目标是完全本地化,不依赖任何数据中心或第三方存储。
  • 统一内存性价比:作者认为 Spark 目前依然是可扩展统一内存里最划算的选择。等到 M5 Ultra 出来,再尝试把 Mac Studio 加入、研究分离式推理,会有更大的收益。
  • 灵活性和流动性:Spark 和 6000 Pro 的组合在配置、功耗优化上非常灵活,想换新设备时也更容易二手处理。

作者的机架里还有两台 6000 Pro 系统:一台 4x Max Q 低功耗版,一台 8x 企业服务器,它们替代了之前用过的 H100 和 GH200。

这套设备大约花了多少钱?

按目前的市场行情粗算,包含交换机和线缆在内,这套系统大约要 20 万美元。有用户开玩笑说“我以为 16 个 Spark 已经很顶了”,也有人说“我 2 个 Spark 跑 DeepSeek 就觉得是个人物,结果发现自己在小联盟”。侧面说明这个建造成本和规模,确实不是普通玩家能轻易复制的。

什么人会建这样的个人集群?

作者自述有稳定的工作(带医疗福利)、几个自己的公司,还在做 AI 领域的顾问。即使不直接拿设备去变现,它对他手里所有的事情都带来了巨大帮助。有人评价得很精辟:有的人在车库里放一辆入门级超跑,有的人在机架上放一大堆 Spark。

如果你想动手,先从控制规模开始

这种规模的集群不是给大多数人准备的。如果你也想走类似路线,建议先试 2-4 台 Spark 或二手 6000 Pro,跑通自己的推理和 agent 工作负载,再评估功耗和噪音。真正需要做的功课是供电、散热和网络布线——否则你得到的不是 AI 集群,而是一个电费黑洞。