这是什么
本周 r/LocalLLaMA 一则装机求助引发上百条回复:用户想把 RTX 3090 和 3070 同时塞进 B450 主板跑本地大模型,结果被两个 PCIe 槽之间的物理间距卡死——延长线方案又和 SATA 供电线冲突。
评论区有人建议走 NVMe 转接方案。帖子本身只是个人装机咨询,但它触及了被行业话术掩盖的事实:消费级主板、机箱、电源,从一开始就不是为多卡 LLM(Large Language Model,大语言模型)推理设计的。
行业怎么看
主流叙事是「端侧小模型 + 云端大模型」:Apple Intelligence、Phi-3、Llama 小参数模型都在往这个方向推。我们注意到,这条路线的潜台词是——云厂商和芯片公司希望消费者别再碰硬件,把 AI 算力交给订阅服务。
但社区的反对声音很清楚:真要跑 70B 以上参数的模型,或者想做本地 RAG(Retrieval-Augmented Generation,让模型查内部资料的方案),多卡堆叠仍是少数派的硬核选择。这类求助帖的活跃,恰好说明云端之外没有成熟的消费级方案。
更值得警惕的是,硬核玩家的真实需求反过来撑住了 3090、4090 的二手价格——LLM 是 GPU 市场的隐形推手,而这件事在卖方研报里几乎不提。
对普通人的影响
对企业 IT:本地部署大模型不是「插张显卡」的事,是机房级工程——机架、散热、电源、网络都要重新规划。
对个人职场:现阶段云端 API 成本远低于自建,本地部署更适合研究者和极客;普通职场人不需要为此焦虑。
对消费市场:高端显卡价格短期难降,AI 训练/推理需求是二手 GPU 市场被撑住的隐形因素。