本周 Reddit 的 LocalLLaMA 板块一篇标题为 "This benchmark is getting out of hand" 的帖子冲上板块热门,社区用户集体表达同一个判断:AI 跑分竞赛正在失控。我们注意到一个具体趋势:2024 年以来,主流评测榜单从 MMLU、HELM 等十余个,扩张到涵盖数学、代码、推理、多模态的上百个细分榜单;几乎每家大模型公司发布新模型时,都附上一份「我们在 XX 榜单拿下 SOTA(当前最优成绩)」的成绩单。

这是什么

基准测试本是衡量模型能力的标准化工具,本应起到统一标尺的作用。但过去一年,榜单数量激增、厂商「刷榜」现象频出,已经让社区开发者产生普遍怀疑。我们梳理本地部署圈(LocalLLaMA 用户群)的讨论,焦点集中在三件事:榜单本身是否还反映真实能力、企业用榜单做选型是否还合理、消费者看到的产品宣传跑分还能不能信。

行业怎么看

社区的批评集中在三点:第一,训练数据污染——基准测试的题目可能直接进入训练集,模型相当于「背答案」;第二,过度拟合(overfitting)——厂商专门针对评测题目微调(fine-tuning,用特定数据继续训练),分数好看但泛化能力(在新场景下表现的能力)未必提升;第三,指标与真实场景脱节——能拿高分不等于能解决用户实际问题。

但也有从业者持保留意见。某模型评测团队负责人告诉我们:「基准测试不是没用,而是不能只用一两个。综合多个榜单、加上人工盲测(评测人不知道模型身份打分)和真实用户反馈,才更接近真实能力。」我们也注意到一种风险:随着模型能力差距缩小,「刷榜」会变成投入产出比最高的营销手段,榜单本身的意义会被进一步稀释。

对普通人的影响

对企业 IT:选型时如果只看厂商提供的「对标分数」,等于把决策权交给对方的营销部门,建议要求对方在自家业务数据上做实测。

对个人职场:招聘中越来越常见的「AI 技能测评」分数,同样存在被应试化训练污染的可能,更值得看的是实际项目产出。

对消费市场:手机助手、智能音箱等产品宣传的「跑分领先」,短期内参考价值有限;长期看会推动整个行业把评测标准拉回真实场景——但这至少需要一两年时间。