这是什么
本周一件值得编辑部记录的事:一位 Reddit 用户在自家客厅跑起了 Kimi K3——参数 2.8 万亿、目前最强的开源大模型——靠的是 20 张 NVIDIA DGX Spark(NVIDIA 去年发布的桌面级 AI 工作站,单张约 1.4 万美元)组成的家庭集群。他和他兄弟两家的机器加在一起,总功耗 400 瓦,但家电表已经烧过好几回,因为机器和厨房烤箱不能同时开。
他的升级路径清晰:从一张 RTX 3090 起步,到 16 张 3090 组成千兆网络集群,再到 20 张 DGX Spark。最终他搭出两套配置:16 张组成"大集群"专跑 Kimi K3、Qwen 3.8 等万亿级模型,4 张组成"日常集群"24 小时跑轻量开源模型 GLM 5.3 Flash。优化后,300k token 上下文(模型一次能"看到"的文本量,约等于一本中等厚度小说)能跑到 20 t/s(每秒 20 个字)——基本可用的对话速度。
整个故事的关键转折:算力瓶颈让位给了家庭电路。
行业怎么看
值得认真对待的事实:开源模型——Qwen、DeepSeek、Kimi、GLM、MiMo 全部是中国团队做的——已经达到"个人硬件能跑、生产力可用"的水平。用户说他用本地模型接了付费外包项目。
但我们必须泼三盆冷水。第一,这是高度技术化的个例:组装、vLLM/SGLang(开源推理引擎)调参、跨节点集群连通,没有 DevOps 背景复制不来。第二,"本地部署"的隐性成本被严重低估:电费、散热、噪音、稳定性维护叠加工时,未必比每月 200 美元的 ChatGPT 订阅便宜。第三,DGX Spark 受美国出口管制约束,中国大陆企业能否稳定采购存疑——这位用户能买到 20 张,本身就是供应链信号。
更冷静的判断:开源模型的能力上限已触到商业可用线,但部署成本远没到消费级。两者之间,就是云厂商和系统集成商未来 2-3 年的活空间。
对普通人的影响
对企业 IT:如果公司对数据出境敏感(金融、医疗、法律、跨境业务),"本地大模型能跑万亿参数"这个事实本身就是谈判筹码——可以压云厂商报价,也可以认真评估自建方案,而不是默认上公有云。
对个人职场:懂开源模型部署、推理优化、GPU 集群调度的工程师会持续稀缺;但"只会写 prompt 包装自己"的从业者溢价会继续下降——开源把能力天花板抬高后,写 prompt 的边际价值被压缩。
对消费市场:未来 2-3 年大概率会出现"家用/小微 AI 工作站"这个新品类,从极客玩具走向中小企业工具,类比 2010 年代小型服务器从机房进入创业公司办公室的路径。