这是什么

本周一个 Reddit 帖子在本地 AI 圈子里被传开。用户 poofph 把游戏电脑里的两张 RTX 5090(单张约 2000 美元)搬到了地下室的专业服务器上——AMD 服务器 CPU、八通道 DDR4 ECC 内存、专用 NVMe 固态盘,听起来更"企业级"了。但同样的 Qwen 27B 模型,输出速度从 100-150 tokens/秒(token 是大模型生成文字的最小单位)掉到了 60 左右。反而是"补全"(infill,即模型填中间空白文本)的速度变快了。

他自己测了内存带宽,发现服务器 CPU 只有 4 个 CCD(CPU 核心模块),实际带宽 90-120 GB/s,连理论值的一半都不到。问题大概率在这里:大模型生成文字时,CPU 要不停地给 GPU 喂数据,带宽不够,GPU 就在等。

行业怎么看

这事在 r/LocalLLaMA 圈子里不稀奇。社区共识是:消费级 5090 配消费级主板反而是"甜点组合",因为 PCIe Gen5 x8(新一代显卡插槽,单卡 8 条)直连 CPU、延迟低;一旦套上企业级的虚拟化层(Proxmox 虚拟机、PCIe 透传),多出来的环节就吃掉了速度。

但反对意见值得说:有运维老手指出,问题可能不是带宽,而是 Proxmox 的 CPU 调度或 NVMe 的 IOMMU(输入输出内存管理单元,负责把硬件直接交给虚拟机)配置不对;也有观点认为,跑 26 万 token 长上下文(模型一次能"记住"的文字量)本身就是慢的元凶,跟硬件无关。换句话说,poofph 的结论可能是错的,但他的数据有价值——他无意中做了一次"对照组实验":硬件升级不是线性收益。

我们注意到,支持本地部署的人会拿这个案例论证"云 API 才是性价比之选";支持自建的人会说"甜点配置存在,只是没找对"。两边的判断都还没有被充分验证。

对普通人的影响

对企业 IT:如果你们正在评估"上私有大模型"还是"接云 API",记住硬件采购清单不等于性能预算。一台 5 万块的服务器跑出来的速度不如 2 万块的工作站,这是真实存在的。

对个人职场:暂时不用焦虑"本地 AI 取代云端"这件事。普通人能在自己电脑上跑得动的大模型还很远,中间这一层专业运维的复杂度比想象中重得多。

对消费市场:显卡价格会继续被两股力量拉扯——游戏玩家和本地 AI 玩家同时抢 5090、5090D 这类高端卡,二手市场和黄牛短期不会消停。