这周 Reddit 的 LocalLLaMA 版块出现了一个有意思的硬件折腾帖:一位玩家用 4 张二手 RTX 3090(每张约 5000-7000 元)拼接,目标是逼近单张 RTX 6000(约 4 万元)的推理性能。方案是把两张卡做张量并行(把一次计算拆给多卡同时做),再把两对卡用流水线方式串联——他特别提到,4 卡全部张量并行在多数情况下反而更慢,这是个反直觉但经验证的结论。

这是什么

本质上是一次「消费级显卡集群化」的实验。3090 是 NVIDIA 上一代(30 系)的旗舰游戏卡,24GB 显存让它至今仍是本地跑大模型的热门选项。4 张 3090 总显存 96GB,远超 RTX 6000 的 48GB,多卡并行意味着可以跑更大的模型(比如 70B 级别的本地模型)或更长的上下文。瓶颈在 PCIe 通道和主板——作者现有的主板不够用,需要额外加一块 PCIe 交换芯片。

行业怎么看

支持方认为这是 AI 算力「下沉」的典型路径:企业级显卡价格高、供货受限制,二手消费卡反而给中小团队和研究人员留了空间。但反对意见同样值得听:多卡并行的软件复杂度(CUDA 版本、驱动、显存对齐)远超单卡,维护成本和电费长期看不便宜;NVIDIA 本身也在用软件锁(如 NVLink 限制)逐步收紧消费卡跑专业负载的能力。换句话说,今天能这么玩,不代表明天还能这么玩。也有评论指出,真要拼性价比,等 5090 上市后收 4090 可能比堆 3090 更划算。

对普通人的影响

对企业 IT:如果你的公司在评估「要不要买一张 A100/H100 跑内部 AI」,这个帖子的潜台词是——可以先用消费卡集群验证需求,再决定是否上专业硬件,预算门槛从几十万降到几万。

对个人职场:硬件折腾本身不是机会,但「如何用更低成本跑出一个能用的本地大模型」正在成为一项可迁移技能,懂的人会越来越值钱。

对消费市场:二手 3090 显卡可能会因为本地 AI 需求出现一波小阳春,淘卡玩家和模型玩家会撞上同一批货源。