返回首页

Artificial Analysis

找到 13 篇关于此标签的文章

GemmaQwen

Gemma4 与 Qwen3 同台打榜,两份权威榜单给出相反答案 — AI 评测陷入信任危机

Google Gemma4 31B 和阿里 Qwen3 27B 在 Artificial Analysis 与 LMArena 两份权威榜单上拿到了几乎相反的名次。这件事不只关乎两个模型谁更强——它暴露了 AI 评测正在系统性失灵,值得每一个打算用榜单做选型决策的人重新想想。

3d ago2 分钟
Qwen阿里

Qwen 3 低算力档位跑分封神 — 阿里开源模型让'过度思考'质疑闭嘴

Artificial Analysis 最新基准测试显示,阿里 Qwen 3 在低、中算力档位下表现远超预期。此前外界怀疑其强项靠深度思考堆算力,这轮数据说明底层能力扎实,开源生态再添筹码。

Aug 212 分钟
智谱GLM-5

智谱 GLM-5.3 跑分进海外榜 — 中国开源旗舰第一次被独立测评认真打分

智谱开源旗舰 GLM-5.3 本周完成 Artificial Analysis 全套基准测试,跻身综合榜前列,是首个进入该海外第三方榜单前列的中国开源模型。值得关心的是:开源阵营现在到底追到前沿的哪一步了。

Aug 192 分钟
Ling-3Qwen3.5

Ling-3 Tiny 跑分超 Qwen3.5 9B — 我们对开源的关注太集中

本周 Reddit 开源社区发现,参数 1-2B 的 Ling-3 Tiny 在推理基准上跑赢 Qwen3.5 9B。这不是孤例 — 中型开源实验室的好模型正被几个明星的光芒盖住。对本地化部署和企业 AI 选型而言,这是个值得重新看一次的信号。

Aug 182 分钟
Qwen阿里

Qwen 27B 小模型跑赢 Opus — Agent 战场上开源开始反超闭源

Qwen 团队新发布的 27B 模型在 Artificial Analysis 的 Agent 综合榜上压过 Opus 5 Medium。开源小模型在 Agent 任务上反超闭源大模型,对正在评估 AI 落地的企业来说是值得收藏的信号。

Aug 182 分钟
AlibabaQwen

Qwen 新版 27B 跑分逼近 70B — 小模型路线的牌这次打出来了

阿里 Qwen 团队本周在 Artificial Analysis 第三方榜单上放出 27B 模型跑分,综合成绩逼近自家上一代 70B 级。这意味着「模型越大越强」的旧叙事正在松动,对企业自部署成本和个人开发者都是值得重新算账的变量。

Aug 172 分钟
Qwen通义千问

通义千问 27b 跑分跳涨 37% — 开源大模型首次摸到闭源天花板

Qwen 3.8 27b 在 Artificial Analysis 跑分榜上拿下 52 分,比上一代涨 37%,首次超过 Anthropic Claude Opus 4.5 的 42 分。开源大模型逼近闭源天花板的临界点,可能比预期更早到来。

Aug 172 分钟
阿里Qwen

Qwen3.8-27B 跑分追平 GPT-5.6 — 小模型够打大模型了

独立评测机构 Artificial Analysis 给阿里 Qwen3.8-27B 跑分,综合成绩追平 DeepSeek V4 和 GPT-5.6 Luna Max。27B 参数跑出这个水平,意味着企业私有化部署 AI 的成本结构,可能正在被悄悄改写。

Aug 172 分钟
DeepSeekKimi K3

DeepSeek 又把性价比拉开一截,但低价未必等于真正护城河

一则 Reddit 讨论把 DeepSeek 再次推到聚光灯下:在第三方排行榜的价格/性能图里,它与 Kimi K3 的对比让不少人意外。值得关心的不只是便宜,而是中国大模型公司开始把竞争点从“参数更大”转向“单位成本更低、可用性更强”。

Jul 182 分钟
Moonshot AIKimi K3

Kimi K3 把中国大模型价格抬上新台阶,开源牌开始改打高性能

Moonshot AI 发布 2.8 万亿参数的 Kimi K3,并承诺 2026 年 7 月 27 日前开放权重。它更值得关心的不是“更大”,而是中国厂商开始用更高价格卖更强开源模型,竞争从低价转向能力与效率。

Jul 162 分钟
Artificial AnalysisClaude Fable

新 Agent 基准把“会不会干活”单独拎出来,Claude 与 GLM 暂时跑在前面

Artificial Analysis 新发布一套 Agent 基准,重点不再是“会不会答题”,而是“大模型能否规划并执行任务”。Claude Fable 和 GLM 5.2 分别在各自组别领先。值得关心的是,行业开始从参数和跑分,转向更接近真实工作的执行能力。

Jun 192 分钟
PeanutFLUX

匿名Peanut爬到文生图第8 — 开源图像生成赛道越来越挤

匿名文生图模型Peanut在Artificial Analysis竞技场排名第8,超过FLUX.2等开源模型,权重即将开放。开源图像生成赛道持续升温,但匿名发布的安全隐忧和'即将开源'的兑现风险值得观察。

May 52 分钟
Claude MythosAnthropic

Claude Myt hos 限制访问,阿里巴巴「快乐马」 匿名登顶视频榜单

Anthropic 最强模型 Claude Mythos 仅对 12 家合作伙伴开放;阿里巴巴视频模型 HappyHorse 以匿名身 份登顶两大评测榜单后才宣布归属。

Apr 122 分钟