30 小时。Qwen3.8(阿里通义千问最新开源版本)在一项 Reddit 基准测试里跑完所有题目的总时长,而且因为 32K 输出 token 上限,最后还挂了 16 个 case。同样的任务,被低估的开源模型 Muse Glimmer 只用了 3-4 小时,在「隐式知识」这一项的得分甚至高于 Qwen3.8。

这个对比值得记一笔:「模型越大越强」的直觉,正在被架构层面的设计选择打破。

这是什么

测试由 r/LocalLLaMA 用户 Ok-Inevitable8391 发在社区,对象包括 Qwen3.8(高、中投入两种模式)、Muse Glimmer,外加 Claude 系列(数据取自公开仓库 embedeval 的引用结果)。

高投入模式的 Qwen3.8 总计跑了近 30 小时,最终因 token 上限失败 16 题;中投入模式和 Muse Glimmer 都只要 3-4 小时,并且 Muse 在「模型需要从训练数据里『自己猜出来』的事实」这类隐式知识测试中,得分高于 Qwen3.8。

作者点出 Muse 的核心优势:滑动窗口注意力机制(每一层只关注最近若干 token、不回头看全部历史),带来 KV cache 效率提升(缓存占用显存更少),从而能塞进更长的上下文窗口。

行业怎么看

一种反对意见很直接:隐式知识这一项本来就对参数量小的模型更友好,它考的是「模型记住了什么」,而不是「模型能调出什么」。给 Qwen3.8 配上 RAG(检索增强生成 — 让模型先查资料再回答)补足上下文,结果大概率会反超回来。

但这恰好是这件事值得想清楚的地方:当任务可以通过 RAG 或更长上下文解决时,「在脑子里装下所有知识」就不是个划算的设计 — 显存、推理成本、部署门槛都要为大参数买单。我们认为,架构上更聪明的模型,可能比单纯堆参数的模型更容易进入生产环境。

另一项背景容易被忽略:Muse Glimmer 是被严重低估的开源选项,国内做模型压缩与高效架构的团队不止一家,正在悄悄改写「什么算 SOTA」这件事。

对普通人的影响

对企业 IT:本地化部署的可行性在变高。一台机器跑得动一个不输主流的模型,意味着数据可以不出公司、不上云、不被按 token 计费,这对受合规约束的行业是实在选项。

对个人职场:短期不会直接换掉 ChatGPT。但凡你需要做长文档分析、长代码库理解,滑动窗口架构带来的「更长上下文」会逐步变成新基线,工具选型时该留意这条线索。

对消费市场:推理成本下降最终会传导到 AI 产品定价上 — 越来越多「不限量、不涨价」的功能,背后靠的是这一波架构红利,而不是大模型公司让利。