两个全球最被广泛引用的 AI 模型评测平台——Artificial Analysis 和 LMArena(原 Chatbot Arena)——本周对同一对开源模型给出了相反结论:AA 把阿里 Qwen3 27B 排在 Google Gemma4 31B 前面;LMArena 把 Gemma4 排到比 Qwen3 高近 20 个位置。对于打算在本地电脑或服务器跑开源模型的开发者,这意味着「看榜单选模型」已经基本失效。
这是什么
事情起因是 Reddit 上 r/LocalLLaMA(一个本地部署 AI 模型的爱好者社区)一位开发者发现:两个尺寸相近的开源大模型——Google 的 Gemma4 31B 和阿里的 Qwen3 27B——在两大主流评测上的排名几乎颠倒。AA 的「智能指数」显示 Qwen 全面领先;LMArena 的人类盲测投票把 Gemma 排到前列,相差近 20 名。两种方法论——一种偏自动跑学术题库,一种偏真人盲评——撞出了完全相反的答案。
行业怎么看
本地社区里更倾向 Qwen,认为它在推理任务上更「执着」,但代价是处理简单问题会过度思考;Gemma 也没被贬低,仍被认为是合格的模型。一种主流解释是:Qwen 团队针对 AA 这类学术类 benchmark(标准测试题库)做了定向优化,而 Gemma 团队更重视 Arena 这种「用户真实投票」——两种优化目标天然不兼容。
但也有反对声音:有人指出两个榜单本身都存在被「刷分」的可能——模型厂商可以在 Arena 上自家测试投票,也能在 AA 题库风格的数据上做训练。所以「榜单分歧」未必是「两个真相」,更可能是「两套刷题策略」。我们更倾向的判断是:当两个评测差距大到这个程度,开发者应该把两份榜单都降权一档,回到自己的业务数据上做实测对比,而不是相信任何一个单一数字。
对普通人的影响
对企业 IT:选开源模型时不要用单一榜单做决策,最好同时看人工评估和自动跑分,并准备一个小型「业务题库」实测一周再下结论。
对个人职场:如果你用的是 ChatGPT、文心、豆包这类闭源产品,模型厂商用什么榜单优化跟你关系不大——他们各自有自己走的路,你关心的是「哪个产品好用」。
对消费市场:这件事会加剧「AI 模型没法直接比较」的认知,接下来一年里,「某某模型比某某强」的广告语,可信度都要打个折。