DGX Spark 是 NVIDIA 去年底推出的桌面级 AI 主机,定位是让企业或开发者在办公室里跑大模型,不必每次都向云端 API 付费。但有个硬伤:模型越大,显存越贵。

Reddit 用户 ciprianveg 写了个开源工具,能把"推测解码"(speculative decoding,先让一个小模型"猜"答案、再让大模型验证的技术)里那个小草稿模型,挪到家里的闲置显卡上跑。腾出的空间可以装更长上下文,或跑更高精度的版本。

这是什么

简单说,这是一个"显存借调"补丁:本地 AI 主机内存不够时,从家里其他显卡"借"一点过来用。技术上不复杂(走 TCP 或 RDMA 高速网络),但解决的是真问题——DGX Spark 默认配置跑 70B 以上模型捉襟见肘。

行业怎么看

这只是个社区小工具,不必高估。但它折射的趋势值得关心:大模型正从"只能上云"走向"也能落地"。金融、医疗、政务对数据出内网敏感,本地化是刚需;NVIDIA、苹果都在押这条线。

反对意见也很明确:自己买硬件、自己运维、自己调参,算下来并不便宜。DGX Spark 售价数千美元起,电费、散热、调试全是隐性成本。Reddit 上"穷人云端、富人本地"的调侃有一定道理——本地化不是更便宜,是为数据安全付溢价。

对普通人的影响

  • 对企业 IT:如果业务数据不能出内网(客户名单、未公开财报),本地化从"可选项"变成"必答题",但需要预留硬件预算。
  • 对个人职场:你大概率不会买 DGX Spark,但云端 AI 未来可能分化——敏感数据走本地,通用任务继续上云,按场景计费。
  • 对消费市场:消费级"AI 主机"会变多,但离"买个盒子替代 ChatGPT"还远。