本周 r/LocalLLaMA 上一位用户晒出他的本地 AI 配置:两颗 RTX 5090 显卡(消费级旗舰,每颗国内现货价在 1.4 万元上下)、64GB DDR5 内存、AMD 9950X 处理器——光显卡就接近 3 万元,这已不是发烧友玩具,是企业级预算的起步线。他还在纠结要不要把这套硬件搬进一台企业级 EPYC 服务器。我们关心的是:当"本地跑 AI"从极客玩具滑向企业 IT 选项,钱、运维、电费这三笔账,到底哪笔更重?
这是什么
该用户想跑更大的开源模型(目前用 Flash Next 和 27B 参数级别的小模型),考虑搬到一台 EPYC 服务器——后者有 256GB DDR4 ECC 内存和 8 通道带宽,显卡通过 PCIe 透传(在虚拟机里直接使用物理显卡)给 Proxmox(一款免费的企业级虚拟化软件,类似 VMware)。问题很技术:多出来的内存与带宽,能不能换来明显的推理速度?
行业怎么看
支持本地部署的声音我们听得到:数据不出机房、长期成本可控、不被 API 涨价卡脖子。但反对意见同样值得摆出来:
- 云厂商批量推理价仍在持续下降,Anthropic、Google、MiniMax 都在打价格战。
- 本地部署的隐性成本——双 5090 满载约 1kW 功耗、驱动兼容、模型更新、人力运维——经常被低估。
- AWS 工程师在 Hacker News 类似帖下回过:"客户三年总成本算下来,云永远便宜——除非你的数据真的不能出机房。"
编辑部判断:硬件预算过千万、有合规硬约束的企业才值得自建;其余按 token(按调用量计费的基本单位,类似"字数")付费仍是更现实的选择。
对普通人的影响
- 对企业 IT:自建 GPU 集群与云 API 的拉锯还没结束。预算过千万、数据出境受限的,才值得谈;其余按量付费更现实。
- 对个人职场:硬件调试、驱动兼容、模型量化(把模型压小以加快推理)这些技能在本地 AI 圈是硬通货,但对绝大多数岗位仍是加分项而非必选项。
- 对消费市场:这件事离普通消费者还很远。愿意花 3 万元在家跑模型的人,在中文互联网仍是极少数——这更像 B 端(企业端)的故事。