Reddit r/LocalLLaMA 这周一个热帖:一位 DIY 玩家准备把本地 AI 服务器从 4 张 RTX 3060 升级到 8 张,期望把 Qwen 27B 模型的输出从 50 tps(每秒生成的 token 数,约等于每秒输出多少个字)拉到接近翻倍。评论区却几乎一边倒劝退 — 4 张以上消费卡会撞 PCIe 带宽墙,速度可能不升反降。
这是什么
多卡推理(多个 GPU 协同跑一个大模型)时,GPU 间需要频繁传数据,走的是主板 PCIe 通道。消费级 GPU 显存需求大但单卡算力不高,超过 4 卡后通信开销吃掉并行红利,堆卡从「线性变快」变成「先快后慢」,再多就变更慢。
对想省云服务费、把模型搬回自家机房的企业,「多买几张卡就等于多算力」是常见错觉。
行业怎么看
支持者说,本地 AI 在中小规模下成本可控、数据不出公司,对医疗、法律、金融这类合规敏感业务有真实价值。
但更值得听的是反方:云厂商用 NVLink(英伟达卡间专用高速通道)和 InfiniBand(数据中心级互联协议)绕开了 PCIe 瓶颈,消费硬件根本抄不来。AWS 这周还在下调部分 GPU 实例(按小时租用的云端显卡)价格,本地方案的相对成本优势在收窄,「私有化」反而可能变成一笔昂贵的沉没成本。
对普通人的影响
对企业 IT:批自建 AI 集群预算前先算通信开销,别按「卡数 = 算力」线性外推。
对个人职场:本地跑模型对有隐私需求的咨询、律师、医生仍是可选方案,但要清楚它的速度天花板。
对消费市场:游戏卡跑 AI 还会持续,但对普通用户的实际意义主要在二手卡价格波动,不是「在家搞个 ChatGPT」。