Andrew 在 r/LocalLLaMA 上发了一条带实测数据的吐槽:双 5060Ti 跑 Qwen 3 27B 做编码任务,房间热到没法久坐。每张卡满载 170W,两张合计 340W——约等于一台小型取暖器持续运行。他在问'降频能不能缓解',社区的回复却更悲观。
这是什么
这并不是孤例,而是'本地大模型运动'长期被忽略的隐性账单。过去两年,越来越多人鼓吹在家用消费级显卡跑大模型,理由是隐私、零 API 费、不依赖云厂商。但电力转化为热量是基本物理定律——170W 满载运行一小时,约产生 600 千焦热量,足以让一个 20 平米的小房间体感明显升温。Reddit 上的讨论集中在两条缓解路径:降低 GPU 功耗上限(性能跟着缩水),或者干脆换云 API。本质问题是:本地跑 AI 真的便宜吗?
行业怎么看
支持本地推理的一方强调隐私和长期成本可控,尤其是涉及代码、客户数据、内部知识库的工作场景。技术社区普遍认同这是一个值得投入的方向。
但反对意见同样值得留意。一位长期跑本地模型的用户留言:'我算了三年电费加硬件折旧,跑云 API 反而便宜一半。' 另有人指出,对日均推理只有几小时的普通用户而言,两万块的显卡投入永远回不了本。还有一个被忽略的趋势:NVIDIA 新一代显卡功耗持续上涨,4090 到 5090 满载从 450W 升至 575W——'本地 AI'的散热门槛只会越来越高,不会越来越低。
对普通人的影响
对企业 IT:本地部署大模型不能只看显卡采购价,机房散热、电力增容、噪音治理这些往往排在预算表最末尾几行——也是最容易被砍掉的几行。
对个人职场:想自己买显卡在家跑 AI 辅助工作的白领,会发现'一次性投入、零边际成本'的承诺有水分,每月电费和夏季空调费会悄悄吃掉预期收益。
对消费市场:'消费级显卡当 AI 工作站'的营销话术需要降温——厂商宣传的 TOPS 算力从不附带功耗数字,卖的是一个不完整的方案。