这是什么

本周我们注意到 Reddit r/LocalLLaMA 上的一个信号:一位开发者用 M1 Max 笔记本(32GB 内存)实测两个 27B 开源模型,跑了 240 道编程、数据分析、本地 RAG(让模型读取本地文档回答问题)真实工作题。结果 Dirk-Qwen 3.8-27B 全面领先 Swift-1.5 Qwen3.8-27B——开源在本地跑,开始够用。

两者参数规模都是 270 亿,用 Q4 量化压缩(一种把模型体积压到约 1/4、损失少量精度的技术)以便在消费级硬件上运行。测试覆盖编程、numpy/pandas、数据分析决策、本地 RAG、语音助手,分易中难三档。

Dirk 答案更准、token(模型生成的基本单位,约 1 个汉字或半个英文词)消耗更少、速度更快;Swift 在难题上反复撞上 16,384 token 输出上限,最后因"答不完"失败。值得记录的一个细节:作者在系统提示词里加了一句"be brief"(回答要简短),这个不起眼指令对结果的影响"超出预期"。

行业怎么看

社区里兴奋的声音不少:开源 27B 在消费硬件上已经能处理真实任务,追平闭源只是时间问题。

但我们认为要打折扣看。测试集是作者按自己日常工作自拟的,覆盖范围有限,模型换个领域可能掉链子。作者也明确提到,唯一"100% 通过"的是 Anthropic 的 Opus 5.5,Deepseek Flash 4.1 也只错 3 道——开源与顶尖闭源的差距并未抹掉。Q4 量化版有信息损失,企业关键业务未必敢直接上。

更值得关心的信号是:评测话语权正在从厂商榜单,下沉到真实用户的实际工作流。

对普通人的影响

对企业 IT:本地部署成本持续下降,但选型不能只追跑分,必须按真实业务场景做小规模验证。

对个人职场:未来一两年,能跑 27B 的笔记本可能成为部分知识工作者的标配,类似今天的 Excel。

对消费市场:开源阵营进步越快,闭源 API 的定价压力越大,企业级 AI 服务有望出现新一轮降价。