找到 1 篇关于此标签的文章
Google Gemma4 31B 和阿里 Qwen3 27B 在 Artificial Analysis 与 LMArena 两份权威榜单上拿到了几乎相反的名次。这件事不只关乎两个模型谁更强——它暴露了 AI 评测正在系统性失灵,值得每一个打算用榜单做选型决策的人重新想想。