这是什么
本周 Reddit 本地大模型社区 r/LocalLLaMA 出现一张被广泛转发的成绩单:用户 Spiritual_Impress_30 通过 LM Studio 加载社区量化专家 Mradermacher 制作的版本,让 26B 参数规模的 Gemma 模型在两张 RTX 4060 显卡(合计 16GB 显存)上跑出每秒 75 字生成、每秒 1500 字处理的速度。
Mradermacher 是 GitHub 上小有名气的开源贡献者,专门为各类大模型制作高质量量化版本(把模型压缩到更小体积以适配低显存硬件的技术)。帖子里的「gemma 4 26b」属于社区对 Google 开源模型的惯用简称,量化后实际显存占用大幅下降。这不是实验室跑分,是普通玩家家里的实测。
行业怎么看
乐观派认为这件事意义不小:过去本地跑 20B 以上模型至少需要 24GB 显存(一张 RTX 4090 或专业卡),现在两张千元级游戏卡就能扛住,速度还够日常对话。推理成本沿这条路持续下降,云端 API 的定价权会被进一步稀释。
但编辑部也听到另一种声音。一位模型部署工程师对我们说:「75 字/秒看着漂亮,可一旦要做检索增强生成(让模型翻阅企业文档库回答问题)或长上下文任务,16GB 显存就是天花板,模型放不下文档就谈不上实用。」另外,量化版本在数学、代码等需要精确推理的任务上通常比原版弱一档,企业真要落地还得做能力评估。简单说:本地能跑 ≠ 本地能用。
对普通人的影响
对企业 IT:医疗、法律、金融等数据敏感行业有了认真评估「全本地部署」的底气,2 万元硬件预算就能跑中等模型,比动辄上百万的 GPU 服务器方案轻得多。
对个人职场:懂点技术的白领可以用几千块硬件搭一个不向云端传数据的 AI 助手,处理敏感客户资料时少一层顾虑。
对消费市场:未来一两年可能出现更多「插电即用」的本地 AI 盒子类产品,但现阶段对大多数人仍是极客玩具,门槛不低。