R/LocalLLaMA 上这位开发者用 4 张 RTX 3060(共 48GB 显存)+ 一台普通工作站,跑通了 144GB 的 DeepSeek-V4-Flash 量化版(一种把模型权重压缩到更小体积的技术),提示处理接近 100 token/s,生成约 10 token/s。判断是:本地大模型部署的硬件门槛,正在塌方。
这是什么
具体方案:4 块 RTX 3060 12GB + Intel i9 工作站 + 128GB DDR4 内存,跑 llama.cpp(主流开源本地推理框架)。模型是 DeepSeek-V4-Flash 0731 的 Q4_K_XL 量化版(一种精度压缩方案),约 144GB 放在 NVMe SSD 上按需读取。实测在约 2 万 token 的提示下,处理 99.4 token/s,生成 10.1 token/s。模型大部分权重仍在内存里,9 层 MoE 专家(Mixture of Experts,即「模型由多个子模块按需激活」的架构)显式分配到显卡 1-3,关键优化是 -ncmoe 34 这个显存调度参数。
行业怎么看
支持者认为,这件事意味着本地大模型的「可用门槛」快速下移。过去想用千亿参数级模型,要么租云端 API,要么买 A100/H100 这种单张几万的服务器卡。现在 4 张两千元级的消费卡就够了,成本差着一个数量级。对处理敏感数据(医疗、法务、政务)的企业,本地化部署是合规上的硬需求,这条路走通意味着不必再为每一次调用向云厂商上交数据。
反对意见同样明确。第一,10 token/s 的生成速度对真实对话偏慢,普通人读中文约每秒 5-7 个字还能忍,但用于自动化批处理延迟会迅速放大。第二,198 秒的模型加载时间意味着每次重启很慢,不适合 SLA(服务等级承诺,即「系统多久内必须响应」的合同条款)严格的生产环境。第三,所谓「4 张 RTX 3060」背后其实是万元级工作站,普通办公室电脑撑不住;内存带宽是隐性瓶颈。第四,DeepSeek 官方 API 价格已经接近免费,自己搭一套的运维人力成本往往更贵,综合 TCO(总拥有成本,即从采购到报废全部花出去的钱)未必划算。
对普通人的影响
对企业 IT:这是一个有效的成本校准点——硬件一次性投入可能比想象中低,但要算上电费、机房、运维人力,3-5 年的综合 TCO 才会见真章。
对个人职场:本地跑大模型还远不是「装个软件就完事」的体验——你要会配显卡、懂量化、看得懂命令行报错。但具备「本地大模型部署」技能的人在猎头市场有溢价,可以早做储备。
对消费市场:消费者端短期内不会因此买到什么新东西——市面上的 AI 玩具和学习机用的还是云端方案。但 3-5 年后,中小公司「自建一个不联网的 AI 助手」会像今天自建邮箱一样普通。