一个 Reddit 用户用 12GB 显存的 RTX 5070 Ti 笔记本实测 Qwen3.8 27B:2-bit 量化版生成速度 35.9 字/秒,但栽倒在经典的 1.1 元小球问题上;3-bit 版答对所有六道题,速度却跌到 7.5 字/秒。换 Qwen3.6 35B MoE 上场,59 字/秒、六道全对——上一代反而赢。

这是什么

测试者比较了两个模型。Qwen3.8 27B 是阿里新发布的稠密模型(每次推理都激活全部参数),分别压成 2-bit 和 3-bit 量化(即将模型精度压缩以省显存)跑。Qwen3.6 35B-A3B 采用 MoE 架构(混合专家:35B 总参数但每次只激活约 3B),量化到 4-bit。六道常识题加一道编程题下来:27B Q2 错 1 题但快,27B Q3 全对但慢到卡顿,MoE 4-bit 全对且最快。

行业怎么看

支持者认为这说明 MoE 是本地化部署的真正出路——同样的显存能跑更聪明、更快的模型。对不能把数据上传云端的金融、医疗、政务机构来说,私有 AI 助手第一次有了现实可行性。 但也有工程师指出:Reddit 单人测试样本太小,且只测了 llama.cpp 一个推理框架;MoE 的专家路由需要更精细的显存调度,普通用户的部署门槛并不低。如果 Qwen3.8 团队下一版本推出 4-bit 优化,结果可能反转。

对普通人的影响

对企业 IT:12GB 显存级别的本地大模型已可用,对数据敏感行业意味着合规成本下降。 对个人职场:处理客户数据、合同、内部备忘不必再上传第三方服务器,技术小白的部署门槛在降低。 对消费市场:显卡厂商和模型公司在争夺同一个叙事——"在你电脑上跑最强的模型",下一代消费级硬件值得跟踪。