本周 Reddit LocalLLaMA 社区有一组对比数据值得记一下:DeepSeek V4 Flash 的一份本地量化(一种把大模型压缩到家用电脑能跑的格式)版本,在 SlopCodeBench(一项测试 AI 写代码能力的基准)上拿到了 29.4% 的通过率,比它自己云端 API 的 17.6% 高出近一倍,也超过了 Claude Opus 4.8 的 23.5%。这个反差让我们编辑部停下来想了想:本地跑模型这件事,是不是到了某个临界点。
这是什么
开发者用 macbook M5 Max 跑了 DeepSeek V4 Flash 0731 版本的本地量化模型(quant,就是把模型体积压缩、损失少量精度以便在消费级电脑运行的处理方式),工具是开源的 pi 0.84.0。17 道代码题,5 道做对。
关键的对照是同一模型、同一基准:云端 API 用 OpenCode 跑,只做对 3 道(17.6%);本地版本换了套工具链,反而做对 5 道。Claude Opus 5 的云端版本做对 4 道(23.5%)。
换句话说:在写代码这件事上,一台两万块的苹果笔记本,跑一个免费开源版本,刚刚跑赢了每月几十美元订阅的顶级云端模型。
行业怎么看
乐观一派——本地化社区长期鼓吹的「主权算力」(即不依赖云端服务商、自家硬件就能跑 AI 的能力)终于兑现。模型量化技术(把大模型压小但不压垮)这两年进步飞快,硬件也在追,2024 年「本地跑不动」的论调开始站不住。
但我们注意到三个反面的声音:
第一,单跑分无法代表真实工作流。代码基准里很多题目是「写一个小函数」,但实际工程要读懂整个仓库、处理依赖、跑测试,这是两回事。
第二,速度问题原帖自己也提到了——本地跑比云端慢不少。一道题等 30 秒和等 3 秒,对程序员的工作节奏影响巨大。
第三,量化会掉智商是公开的秘密。同一个模型、不同量化策略,能力能差出一倍(看表格里 DeepSeek V4 Flash 的两次本地跑分,29.4% vs 5.9%,差了五倍)。这说明「本地能跑」不等于「本地能稳定跑好」,选择门槛反而变高了。
对普通人的影响
对企业 IT:如果本地版真的能逼近云端效果,对数据合规要求高(金融、医疗、政务)的公司就有了替代方案,不必再把所有代码送到美国公司的服务器。
对个人职场:程序员和重度文字工作者是第一批受益的人。一台高端笔记本 + 一个会调参的开源模型,可能比订阅 ChatGPT 更划算;但「会调参」这道门槛会拦住大多数人。
对消费市场:MacBook 工作站、AI PC(专门为跑本地大模型设计的个人电脑)这些品类去年讲的故事,现在有了第一个真实的对照数据。硬件厂商接下来会拿这个案例做营销。