这是什么

Qwen 3.8 27B 用 270 亿参数的「小身材」,在 Artificial Analysis 综合智能评测上追平了 GPT-5.6 Luna(最高算力档)—— 这意味着「小模型跑不动顶级任务」的行业假设需要改写。

52 分这个成绩的具体坐标是:与 GPT-5.6 Luna 持平,落后智谱 GLM-5.2 一分(GLM 参数量 7530 亿,是 Qwen 的近 28 倍),落后 DeepSeek V4 Pro 0813 一分。Artificial Analysis Intelligence Index 是业内被广泛引用的综合跑分,汇总推理、代码、数学等多类任务表现。

把这件事放回时间线:三个月前,业内还在争论「开源或中等模型能不能追上闭源巨头」。Qwen 3.8 27B 给出的回答是,至少在第三方跑分层面,追平做到了。

行业怎么看

看好的一方认为,这是「小模型路线」的标志性时刻。当 27B 就能接近 753B 的综合表现,意味着大量原本必须调用超大云端 API 的应用场景,可以转向自部署或私有云,企业 AI 的成本结构可能被改写。Hacker News 开发者社区一片惊叹,长期跟踪开源模型的 Simon Willison 直接称其为「令人震惊的模型」。

但克制的声音同样存在。第一,Artificial Analysis Index 是单一评测体系,对「真实任务表现」的代表性一直有争议,跑分追平不等于体验追平。第二,27B 模型虽然规模「小」,单次推理的显存占用和成本对中小企业依然不轻,远未到「随便一台电脑就能跑」的水平。第三,GPT-5.6 Luna 的 52 分是在 max effort 档位取得,意味着闭源方调用了更高算力,两边并非真正同一起跑线比较。最后,中国模型在硬件获取上仍有外部约束,模型层面的效率优势能否完全转化为产业优势,还要看供应链。

对普通人的影响

对企业 IT:如果你的公司正在评估自建 AI 能力,Qwen 这类「中等身材、强能力」的模型降低了私有化部署的硬件门槛,值得开始重新询价。

对个人职场:你日常用的 ChatGPT、文心、豆包等产品短时间内不会因此降价,但行业整体推理成本下行的趋势,对内容、客服、数据分析这些岗位的工具成本是利好。

对消费市场:手机、车机、智能音箱里塞进更强 AI 的可能性在变大 —— 厂商终于有「小但够用」的模型可以选了。