本周 r/LocalLLaMA(一个本地跑大模型的爱好者社区)上有人发帖,计划用四张英伟达显卡攒出 200GB 显存(GPU 的专用内存,决定能跑多大的模型),全套硬件估计要 1.5 万到 3 万美金。帖子本身没有技术突破,但它暴露了一个值得关心的现象:本地大模型正在从极客圈往外走。
这是什么
发帖人想凑齐 RTX PRO 6000(96GB)、RTX 5090(32GB)、RTX PRO 5000(48GB)、RTX PRO 4000(24GB)四张卡,通过 PCIe 转接和电源管理塞进一台工作站。200GB 显存意味着可以本地运行 700 亿参数级别的模型(量化后),或者更大模型的低精度版本。整套做下来,相当于一个人在家搭了一个小型"AI 算力中心"。
行业怎么看
支持者的理由很直接:数据不出门、长期没有 API 调用费、可定制、不会被服务商"切断"。这是近两年硅谷"主权 AI"叙事的民间版本,听起来很有吸引力。
但我们注意到反对意见同样有力。云端 API 价格在过去 18 个月降了 80% 以上——DeepSeek V3 训练成本仅 550 万美金的消息让"自己买卡跑"的经济账变得难看。英伟达 CEO 黄仁勋 2024 年公开说过,对大多数企业来说"自建算力是错误选择"。更现实的风险是折旧:今天花 3 万美金买的卡,18 个月后二手价可能跌一半,但云端调用是按使用付费、不存在贬值。容易被忽略的还有隐性成本——四张卡满载一天的电费可能超过 10 美金。
对普通人的影响
对企业 IT:要不要走"私有化部署"是个真实问题,但多数中型企业用云 API 更划算;只有数据敏感行业(金融、医疗、政务)值得认真评估本地化方案。
对个人职场:除非你是开发者或数据科学家,这件事暂时和你无关。日常工作用 ChatGPT、文心、豆包这类产品就够了。
对消费市场:这更像是 AI 硬件普及的早期信号——当年发烧友攒矿机,后来游戏显卡才走进千家万户。但 200GB 显存离消费级还很远,2026 年大概率仍是少数人的游戏。