7 个新词。这是 Reddit 用户 @bigattichouse 测出的阿里通义千问 3.8 和 3.6 之间的差距——本周他用模型合并技术(把两个模型的参数混在一起)把两个版本合二为一,造出一个'QwenMix-3.7'。

这是什么

这位 Reddit 用户注意到社区里反复讨论:Qwen3.8 和 3.6 的内部结构几乎一样。3.8 唯一新增的,是 7 个 token(模型认识的最小语义单位,可以理解为 7 个新词)。他用 GGUF 量化格式(一种把模型压缩到本地硬盘运行的文件格式)把 27B 参数的 3.6 和 3.8 合并,结果能用。

作者坦诚:只做了冒烟测试(确认能跑、不正式验证效果),把脚本和思路放在 Replicate 上开源。这不是产品发布,是社区里的一次验证性实验。

行业怎么看

正面看:开源大模型的生态已经成熟——一个普通开发者可以在自家电脑里合并两个 27B 参数的模型并跑通。这在过去要靠专业团队。

质疑看:这是不是一件值得讨论的事?模型合并本身是已有技术,GGUF 量化也不是新东西。一个 Reddit 帖子证明两个版本相似,不等于官方版本号通胀就是普遍问题——有些升级改的是训练数据、推理行为,肉眼和合并脚本都不一定看得出来。

更现实的判断:版本号节奏加快是行业普遍现象,不独阿里。值得关心的是,企业采购方因此更难判断'升级是否值得'。

对普通人的影响

企业 IT:这次实验在 27B 量级,距企业生产环境还远。但如果未来出现 100B+ 的合并方案,私有部署的成本结构会重写。

个人职场:版本号更新不等于能力升级。下次看到'新一代大模型'的宣传,先问一句:和上一版差在哪?

消费市场:开源模型的世界跑得比官方发版更快。消费者用到的产品,背后可能是已经迭代过几轮的混合模型。