本周 Reddit 上一则技术贴给出了具体数字:海外用户用 16 张消费级 RTX 5060 Ti 显卡(通过两块 PLX88096 交换芯片互联)拼出一台机器,本地跑通 DeepSeek 系列模型。500K 上下文(模型一次能处理的文字长度)下生成速度 100-150 tokens/秒(每秒生成的文字片段数),整套机器成本约为单张 RTX 6000 Pro 的 60%。我们关心的不是这台机器,而是它背后的信号:本地部署前沿大模型的硬件成本曲线正在快速下沉。

这是什么

这是海外极客社区的一次 DIY 实践。传统上,本地运行千亿参数级别的大模型需要 A100/H100 这类专业卡,单张价格数万到十几万美元。这次的方案用 16 张消费级 RTX 5060 Ti(每张约 400 美元)加上两块 PCIe(主板上显卡等设备的接口总线)交换芯片(一种让多张显卡高速通信的硬件),把总成本压到专业方案的六成左右。

技术核心两点:一是把 16 张消费卡用 PLX 交换芯片组成高速互联集群(类似小型数据中心的拓扑结构),二是对 NVIDIA 驱动打了补丁让多卡直接通信(绕过官方不支持的消费卡互联限制)。最终在 50 万字上下文窗口下达到接近实时的生成速度。

需要说明的是,这仍是极客向方案——需要自己编译内核、写自定义 all-reduce 代码(让多张显卡协同计算结果的通信机制)、修改主板固件配置。距离"开箱即用"还有相当距离。

行业怎么看

支持方认为这条曲线意义重大。消费级显卡加交换芯片的组合,意味着中小企业不必依赖云厂商,可以以可控成本私有化部署前沿模型——对金融、医疗、政务等有数据合规需求的场景尤其有价值。也有硬件分析师指出,NVIDIA 高端卡的利润空间可能因此被进一步压缩。

反方意见同样值得听。一位云基础设施工程师指出,这种方案的稳定性、运维成本、功耗(16 张显卡同时满载)都没有被充分讨论。"DIY 集群跑跑分测试和跑生产环境是两回事。" 此外 DeepSeek 官方并未背书此类方案,社区补丁可能在后续模型版本中失效——今天能跑通的配置,下个版本不一定能用。

对普通人的影响

对企业 IT:预算模型要重做。过去"自建大模型"默认意味着百万级硬件投入,现在 50-80 万人民币或许就能搭出可用的推理集群(用已有模型做应用的阶段),但稳定性和运维成本仍是未知数。

对个人职场:暂时不用焦虑。16 张显卡的机器不是普通办公室能放下的,这条曲线短期对绝大多数岗位没有直接影响。但对模型微调师、AI 基础设施工程师,社区硬件方案的成熟意味着新的工作流。

对消费市场:短期无感。DIY 大模型集群不会进入普通消费者视野。但 NVIDIA 等厂商的消费卡定价策略可能因此调整,最终受益的仍是玩家和本地创作者群体。