返回首页
大模型评测
找到 4 篇关于此标签的文章
Kimi K3Claude Opus 5
2.8T 参数的 K3 修不好一个 Bug — 基准分高不等于真能干
开发者拿 Kimi K3 去排查一个真实的 OpenCode 加载故障,耗一小时答案全错;Claude Opus 5 一眼锁定根因。这件事提醒我们:参数规模和基准分数,不等于真实场景的判断力。
3d ago2 分钟
benchmark大模型评测
AI 跑分没人信了 — Reddit 开发者集体吐槽 benchmark 注水
r/LocalLLaMA 上一条『你信哪个 benchmark』的提问,评论区『我也不信』刷成主旋律。我们的判断是:这不是个别吐槽,而是 AI benchmark 整体失灵的信号。
Aug 222 分钟
小米MiMo
小米 MiMo 耗六倍算力仍出废代码,大模型竞争正从跑分转向交付效率
近日一项复杂编程测试显示,小米 MiMo 2.5 Pro 耗费 6 倍算力仍未交付可用代码,而 DeepSeek 等模型高效完成。这表明大模型跑分已无法反映真实开发水平,企业选型应更关注实际交付率与成本。
May 62 分钟
XiaomiMiMo-V2.5-Pro
小米大模型 MiMo 在复杂推理测试中登顶 — 性价比开始取代参数量成为新焦点
小米 MiMo-V2.5-Pro 在复杂社交推理测试中以不到 1 美元成本取胜,这标志着大模型竞争焦点正从单纯算力比拼转向推理性价比与实用性,企业落地有了更实惠的选择。
May 22 分钟