返回首页

基准测试

找到 10 篇关于此标签的文章

通义千问Qwen

Qwen3.8 在 Mac 上跑出 94% — 但基准测试正在失效

阿里通义悄悄放出 Qwen3.8 实验版,本地开发者用五万块的 Mac 工作站跑出 94% 的基准分。但比分数更值得关心的是博主自己的一句话 —— 模型已经好到基准测试分不出高下。

8月27日2 分钟
Qwen本地大模型

本地 AI 越来越聪明,但越来越慢 — 开发者开始用「时间预算」挑模型

本地大模型越变越聪明,用户却发现「聪明不等于能用」:跑分高的模型思考链太长,不如跑分低但出活快的模型。本周 Reddit 上有用户点名 Qwen3-32B,呼吁建立「限时榜单」。这是 AI 评估从「准不准」转向「一小时能干多少活」的信号,值得所有打算部署 AI 的企业重新算账。

8月27日2 分钟
Kimi K3Claude Opus 5

2.8T 参数的 K3 修不好一个 Bug — 基准分高不等于真能干

开发者拿 Kimi K3 去排查一个真实的 OpenCode 加载故障,耗一小时答案全错;Claude Opus 5 一眼锁定根因。这件事提醒我们:参数规模和基准分数,不等于真实场景的判断力。

8月26日2 分钟
Qwen阿里

Qwen 3 低算力档位跑分封神 — 阿里开源模型让'过度思考'质疑闭嘴

Artificial Analysis 最新基准测试显示,阿里 Qwen 3 在低、中算力档位下表现远超预期。此前外界怀疑其强项靠深度思考堆算力,这轮数据说明底层能力扎实,开源生态再添筹码。

8月21日2 分钟
NVIDIAAVO

NVIDIA AVO 满分拿下 ARC-AGI-3 — 通用智能考试真被攻破了?

ARC-AGI 是 François Chollet 设计的通用推理考试,被视为 AI 是否真会思考的试金石。NVIDIA 一款名为 AVO 的模型这周在 183 个关卡全拿满分,且没有收到任何指令。如果属实,这是对「LLM 不能真正推理」最直接的反驳——但消息源是 Reddit,需要交叉验证。

8月21日2 分钟
LocalLLaMA基准测试

AI 跑分竞赛正在失控 — 社区开发者集体质疑榜单还能信几分

本周 LocalLLaMA 社区一篇高赞帖引发讨论:AI 行业每年发布数百个新基准测试,模型真实能力与榜单分数已明显脱节。值得关心的是,企业采购和个人选工具时越来越依赖的「跑分」,可能正在变成营销工具而非能力证明。

8月21日2 分钟
Y CombinatorAgent

YC 把整晚 Paper Club 给了"数据" — 大模型下半场:算力不缺,缺的是高质量数据

YC 这周把 Paper Club 整晚给了"数据"。我们看完觉得这信号很明确:当模型架构趋同、参数竞赛降温,行业竞争重心正在从"算力+参数"转向"数据质量+评测体系"。对中国大模型公司尤其关键。

8月20日2 分钟
智谱GLM-5

智谱 GLM-5.3 跑分进海外榜 — 中国开源旗舰第一次被独立测评认真打分

智谱开源旗舰 GLM-5.3 本周完成 Artificial Analysis 全套基准测试,跻身综合榜前列,是首个进入该海外第三方榜单前列的中国开源模型。值得关心的是:开源阵营现在到底追到前沿的哪一步了。

8月19日2 分钟
MetaProgramBench

Meta 新基准测 200 任务:AI 从零重建大型程序仍不靠谱

Meta 开源 ProgramBench,用 200 个任务测试 AI 从零构建完整程序的能力,结果最强闭源模型也远未及格。这给"AI 能造软件"的叙事泼了冷水,也暴露了现有编程基准被刷分的隐患。

5月6日2 分钟
AnthropicClaude

Anthropic 被指用不实信息给 新模型造势 — AI 公司的 「发布会公关」正在透支可信度

Anthropic 旗下新模型 Claude Mythos 的发布被外部分析人士指出存在误导性 宣传,核心争议集中在性能对比数据的 呈现方式上。这不是孤立事件——AI 头 部公司在发布节点夸大或选择性披 露数据已成惯常操作,值得我们认真审 视这个行业的信息质量问题。

4月18日2 分钟