本周一个值得追踪的事实:智谱 AI 的开源大模型 GLM-4.5-Air——总参数 106B、每次只激活 12B 的 MoE(混合专家:模型内部分多个小专家按问题调用)架构——在 llama.cpp(最主流的开源本地推理工具)里解锁了 MTP(多 token 一次预测,让模型一次吐出多个字)。结果是生成速度有可见提升,社区已在 3090 这种消费级显卡上验证可用。编辑部判断:本地跑大模型的门槛,又被悄悄砍掉一截。
这是什么
GLM-4.5-Air 是智谱 AI 去年发布的开源大模型,定位是「大模型小跑法」——总量大但每次推理轻。本周更新的核心是把 MTP 加速集成进 llama.cpp,并在 Hugging Face 上传多个针对创意写作的微调版本。简单说,同一张显卡,现在吐字更快了。
行业怎么看
正面看:中国开源大模型在性能与部署成本的天平上,继续向本地可用靠近。对数据敏感、不愿上云的企业(金融、医疗、政务)来说,这是个潜在选项,长期可能影响它们对云端 API 的依赖结构。
但要冷静:3090 单卡几千元,多卡部署的总账未必比调用云端 API 便宜;推动这件事的是 Reddit 极客社区,不是企业 IT 部门;当前主流用例仍集中在创意写作和角色扮演,离企业级落地还远。模型能跑,不等于你该自己跑。
对普通人的影响
对企业 IT:本地大模型从技术 demo 向可评估方案又前进半步,但短期不构成对云端 API 的替代。
对个人职场:除非你做内容创作或 AI 开发,否则这件事和你关系不大,云端产品仍是更优选择。
对消费市场:消费者级 AI 助手仍以云端为主,本地部署 1-2 年内仍是极客和隐私刚需用户的领地。