这个帖子核心是一份四年的硬件清单:2023 年用游戏显卡跑 Llama 1、2024 年搭 6 卡 3090 矿机框架做实验、2025 年到 2026 年初陆续升级到 4 张 RTX 6000 Pro Max Q 配 4 张 3090。整机功耗近 2kW,单卡 300W。他自己算了一笔账:从 2026 年 1 月开始追踪,半年只生成了 3000 万 token、20 亿 prompt token——按云端 API 价格算,电费加硬件折旧根本回不来本。
这是什么
所谓"本地大模型部署",就是把 Llama、Qwen 这类开源模型装在自己电脑上跑,不用 OpenAI、DeepSeek、Anthropic 的云服务。门槛是显存——3090 单卡 24G、6000 Pro Max Q 96G,跑 70B 以上模型基本要拼多卡。这套配置大概能舒服跑 120B 量级的量化模型。
动机帖子写得很直白:隐私、数据不出门、学习过程本身有乐趣。他提到一个具体的痛点:PCIe 总线不稳、电源接错烧过转接卡、差点把房子点了。这是大多数媒体不会告诉你的——多卡本地推理的工程坑,远比"装个 Ollama 跑起来"复杂得多。
行业怎么看
支持声音:Reddit 的 LocalLLaMA 圈子里,本地部署从来不是性价比之选,是一种"DIY 取向"——你愿意为数据主权和不被供应商绑死付溢价。对企业来说,本地化在金融、医疗、政务场景是硬需求,不是可选项。
反对和风险:作者自己也承认,云端比他这套机器便宜得多。这是行业共识的延伸——开源模型质量追上闭源后(DeepSeek、通义千问 Qwen3),云端 token 价格一年内跌了 10 倍以上,本地部署的经济账基本只剩"爱好"和"合规"两类理由。另外,多卡系统的稳定性是隐形门槛,他描述的"GPU 掉总线"在生产环境不可接受,企业真要本地化通常直接采购 Dell、HPE 这类带白盒支持的整机方案。
对普通人的影响
对企业 IT:本地大模型不再是极客玩具,金融、政务、医院已经开始要求数据不出内网。如果你公司有这种合规约束,这帖子是预算参考——4 张 6000 Pro 加周边设备大约 15-20 万人民币。
对个人职场:如果你只是日常用 AI 写邮件、做总结,开 ChatGPT、Claude、通义 App 就行,别自己装机器。只有当你处理的东西不能上传任何服务器,再考虑这条路。
对消费市场:RTX 6000 Pro Max Q 96G 单卡发售价约 8 万人民币,二手矿卡价格波动剧烈——作者明确说"现在的价格我不会买"。消费级显卡(4060/4090)跑 30B 以下模型够用,别被这种帖子带去囤卡。