这是什么
本周 Reddit r/LocalLLaMA 社区有张照片刷屏——一台用刨花板拼成、用 ThinkPad 主板加两张二手 RTX 3090 攒出的「推理赛车」,当前跑通义 Qwen3-8B。作者 TooManyPascals 把主机里所有「不必要的东西」全拆掉:电池、屏幕、键盘、外壳都不要,只留下能算的部分。
工程细节相当扎实:BIOS 被刷掉白名单、PCIe 拓扑被重新分配、两张 3090 用 NVLink(英伟达卡间高速互联通道)桥接,水冷循环 2.4 升冷却液,散热器来自 €24 的大众高尔夫轿车,固定方式是「一个夹子」加一堆胶管。目前日漏液不到 100 毫升,稳定运行。
行业怎么看
值得关切的信号是:这位作者用的是 2020 年发布的 RTX 3090——上一代产品,二手仍是当下本地大模型圈主力。原因直接:新一代 5090 一卡难求、价格离谱,而 3090 的 24GB 显存对 8B–30B 级模型恰好够用。
正面看,本地推理社区确实在壮大:r/LocalLLaMA 订阅超 21 万,Qwen、Llama、Mistral 等开源模型快速迭代,让「在家跑」成为真实选项。
但反方意见同样真实:这种硬核 DIY 项目本身就是 GPU 供给扭曲的产物。它意味着,想认真做本地 AI,几乎只有两条路——接受 3090 这代「老人」,或者接受云端推理的持续账单,中间几乎无路可走。
对普通人的影响
对企业 IT:认真部署本地大模型,硬件采购要么拥抱 3090 这代二手、要么等 5090 真正铺货,预算与节奏都被上游供应牵着走。
对个人职场:绝大多数白领不会在家攒双 3090,但追踪 r/LocalLLaMA 这类社区,能对「AI 部署到底卡在哪」建立直观体感,少被销售 PPT 迷惑。
对消费市场:高端消费 GPU 仍未恢复正常定价,普通玩家正在为这波 AI 需求持续买单——背后是整个 AI 基础设施的瓶颈信号。