返回首页
benchmark
找到 3 篇关于此标签的文章
Ling金融大模型
金融大模型跑分争议:每家都穿自己的装备上场,这榜还公平吗
本周 Reddit 技术圈拆解了一张国内金融大模型 Ling 的官方跑分卡:不同模型在不同测试里用了完全不同的推理设置、Agent 框架甚至工具,所谓的榜单排名更像一场「测试方案」的比拼。这事对所有用 benchmark 选模型的企业和投资人都值得警惕。
5h ago2 分钟
AI评测benchmark
AI 考试满分但活干不好 — 业界开始追问评测到底在测什么
大模型在 benchmark(标准测试)上刷出高分,落地却频频翻车。本期我们看一个正在升温的讨论:行业花几年建起的评测体系,可能从没在测「能不能干活」,只在测「记性好不好」。
3d ago2 分钟
benchmark大模型评测
AI 跑分没人信了 — Reddit 开发者集体吐槽 benchmark 注水
r/LocalLLaMA 上一条『你信哪个 benchmark』的提问,评论区『我也不信』刷成主旋律。我们的判断是:这不是个别吐槽,而是 AI benchmark 整体失灵的信号。
Aug 222 分钟