Reddit r/LocalLLaMA 这周一个热帖:一位 DIY 玩家准备把本地 AI 服务器从 4 张 RTX 3060 升级到 8 张,期望把 Qwen 27B 模型的输出从 50 tps(每秒生成的 token 数,约等于每秒输出多少个字)拉到接近翻倍。评论区却几乎一边倒劝退 — 4 张以上消费卡会撞 PCIe 带宽墙,速度可能不升反降。

这是什么

多卡推理(多个 GPU 协同跑一个大模型)时,GPU 间需要频繁传数据,走的是主板 PCIe 通道。消费级 GPU 显存需求大但单卡算力不高,超过 4 卡后通信开销吃掉并行红利,堆卡从「线性变快」变成「先快后慢」,再多就变更慢。

对想省云服务费、把模型搬回自家机房的企业,「多买几张卡就等于多算力」是常见错觉。

行业怎么看

支持者说,本地 AI 在中小规模下成本可控、数据不出公司,对医疗、法律、金融这类合规敏感业务有真实价值。

但更值得听的是反方:云厂商用 NVLink(英伟达卡间专用高速通道)和 InfiniBand(数据中心级互联协议)绕开了 PCIe 瓶颈,消费硬件根本抄不来。AWS 这周还在下调部分 GPU 实例(按小时租用的云端显卡)价格,本地方案的相对成本优势在收窄,「私有化」反而可能变成一笔昂贵的沉没成本。

对普通人的影响

对企业 IT:批自建 AI 集群预算前先算通信开销,别按「卡数 = 算力」线性外推。

对个人职场:本地跑模型对有隐私需求的咨询、律师、医生仍是可选方案,但要清楚它的速度天花板。

对消费市场:游戏卡跑 AI 还会持续,但对普通用户的实际意义主要在二手卡价格波动,不是「在家搞个 ChatGPT」。