一位 Reddit 用户这周做了一件事:把通义千问 35B 模型塞进 16GB 显卡,跑出 60 token/s 的速度,分数还比原版高 2.5 分。改造对象是开源推理引擎 llama.cpp(让大模型在本地运行的核心程序),新版本叫 AgrillaMoE,专门为 Qwen 系列 MoE 模型(混合专家架构——模型内部有多个"专家"子网络,每次只激活其中一部分)优化。

这是什么

核心数据是这几条:35B 参数(模型总规模)的大模型跑在一张租来的 V100 16GB 显卡上,2-bit 极限压缩下生成速度达到 57-60 token/s,且兼容 OpenAI 和 Anthropic 两套 API 接口,意味着 Claude Code 这类编码工具可以直接对接本地模型。

更关键的是他做了一个叫"MoE 扩专家"的运行时技巧:原本模型每次只用 8 个专家子网络,他通过一个参数(--moe-experts 20)把激活数动态扩到 20 个,门槛是只要新专家的置信度达到原 top-8 的 80% 就纳入,全程不重新训练。在 GPQA-Diamond(一份研究生级理科推理题库)上,分数从 81.82% 拉到 84.34%,涨了 2.5 分。

行业怎么看

支持者认为这是开源生态正在"换打法"的标志——不再死磕模型规模,而是从推理效率、路由策略(决定每次激活哪些专家的算法)等工程层面挖金子,对云端 API 厂商形成成本压力。

但我们也要看到三个保留意见:第一,这是单一开发者的 Reddit 帖子,可复现性需要打问号;第二,"扩专家"本质上是工程取巧,在长文本、复杂指令下是否稳定,社区还没充分测试;第三,16GB V100 的租赁成本和直接调用 API 比起来到底划不划算,账还没算清楚。换句话说,这条路在爱好者层面成立,但离企业生产环境还差一段距离。

对普通人的影响

对企业 IT:自建 AI 推理的硬件门槛又降了一截,但要不要替代云端 API,还得看业务对延迟、稳定性的实际要求。

对个人职场:如果用 Claude Code 这类工具处理敏感代码,可以考虑走本地路线,至少在"数据不出公司机房"这件事上多了一个选项。

对消费市场:云端 API 价格战会被这类社区创新倒逼,但短期内消费者体验仍然是云端更好,别被技术博客带偏节奏。