我们注意到 r/LocalLLaMA 上这周一个求助帖:一位硬件发烧友想本地跑 Deepseek 的量化大模型(约 120GB;量化是把模型压缩到小显存上跑的技术),手上有 48GB 显存的 Blackwell 5000 和 24GB 显存的 3090,单独跑 16 token/秒(每秒生成多少字),把 3090 接进来反而掉到 11-12 token/秒——折腾了三天。

这是什么

Deepseek 是 MoE 架构(混合专家:模型有上千个「专家」模块,每次推理只激活一小部分,理论上更省资源)的开源模型。理论上 MoE 应该能自动拆分到多张卡,但实际不会——需要手动指定哪些专家层放哪张卡;分配不当时,速度反而比单卡更慢。

这不是孤例。过去半年 r/LocalLLaMA 上类似求助帖越来越多,说明「本地跑前沿大模型」目前还停留在爱好者圈子。

行业怎么看

支持「本地 AI 是未来」的一方认为:云 API 每条都要付费、数据还要上云,对中小企业和数据敏感场景不划算;开源模型进步(Deepseek、Qwen、Llama)和硬件升级(Blackwell、消费级 AI PC)会持续压低本地部署成本。

但值得警惕的反面是:这位用户是硬件发烧友级别,Reddit 求助三天没解决,说明当前本地部署的门槛仍高得超出宣传话术。如果你是普通公司的 IT 负责人,现在指望「给员工电脑装个软件就能本地跑 Deepseek」是不现实的。另一个少被讨论的事实:开源模型的「能跑」和「跑得能用」之间差得远——16 token/秒做聊天勉强,做生产力工具远远不够。

对普通人的影响

企业 IT:本地部署大模型短期不会成为主流选项,云 API 仍是更经济的选择,除非有数据合规或规模化的硬需求。

个人职场:如果听到「开源 Deepseek 谁都能本地跑」这类宣传,记住「能跑」和「跑得能用」是两回事;先确认工作流真的需要本地化再投入。

消费市场:AI PC、AI 手机「内置大模型」的卖点,本质上做的也是「把大模型压进设备」这件事;但厂商场景是营销概念,发烧友场景是生产力工具,落地难度不在一个量级。