返回首页
AI评测
找到 3 篇关于此标签的文章
DeepMindAI评测
DeepMind 试点'双盲'AI 评测:人类评委也不知道在评谁
DeepMind 本周推出首个'双盲'AI 评测方法。评委不再知道自己在评哪家模型——这套路来自医学临床试验,目的是消除品牌光环偏差,让模型比较更公平。
2d ago2 分钟
AI评测benchmark
AI 考试满分但活干不好 — 业界开始追问评测到底在测什么
大模型在 benchmark(标准测试)上刷出高分,落地却频频翻车。本期我们看一个正在升温的讨论:行业花几年建起的评测体系,可能从没在测「能不能干活」,只在测「记性好不好」。
3d ago2 分钟
Qwen通义千问
Qwen 27B 真改了一次 Git 仓库 — 但更值得抄的是评测方法
开发者用真实 Git 仓库测了 Qwen 27B 模型,发现它能改代码、跑测试、甚至从错误里恢复。这件事真正值得关心的不是结果,而是这份评测方法本身够不够硬——6 条标准可能是中国 AI 行业目前最缺的东西。
4d ago2 分钟