通义千问这周在跑分榜上抛出一个数字:Qwen 3.8 27b 在 Artificial Analysis 拿下 52 分,比上一代 3.6 版的 38 分暴涨 14 分,单版本涨幅 37%。在同一榜单上,Anthropic Claude Opus 4.5 大约是 42 分。一个 27b 参数的开源模型,单跑分一项已经超过闭源旗舰。
更值得关注的是 MoE(混合专家,模型内部拆成多个小模型按需激活)版本。3.6 代的 35bA3b(总参数 350 亿、每个问题只激活 30 亿)跑出 32 分,只比同代密集版 27b 低 6 分,但推理速度快约 5 倍。如果 3.8 代的 35bA3b 能站上 42 分以上,就意味着用 1/10 左右的算力跑到闭源旗舰水平。
这是什么
Artificial Analysis 是目前业内较受认可的第三方大模型评测榜之一,按推理、代码、数学等多项能力加权。这次 Qwen 在一个版本周期内跳涨 14 分,确实反常 —— 之前的版本迭代通常是 2-3 分的渐进提升。社区猜测可能涉及训练数据扩充、架构调整,或者针对榜单做了专项优化。
行业怎么看
社区里两种声音。乐观派认为,这是开源阵营第一次在跑分上正面压制闭源旗舰,意味着企业部署大模型的成本曲线还会继续往下走。怀疑派则直接指出"benchmaxxed"(针对跑分做专项优化)问题 —— 厂商在评测集上训练,分数好看但实际能力存疑。两种声音都有道理:跑分高不等于好用,但跑分逼近意味着能力上限确实在抬升。对企业来说,更稳妥的做法是看第三方盲测和真实业务场景反馈,而不是单一榜单。
对普通人的影响
对企业 IT:开源跑分逼近闭源,自建部署的性价比窗口正在打开,企业对云端大模型 API 的依赖有望松动。
对个人职场:本地跑大模型处理内部文档、敏感数据变得更现实,不必每条信息都过云端。
对消费市场:短期内你手机里的 AI 助手不会有体感 —— 模型从跑分强到产品好用还有一两层工程差距。