找到 1 篇关于此标签的文章
大模型在 benchmark(标准测试)上刷出高分,落地却频频翻车。本期我们看一个正在升温的讨论:行业花几年建起的评测体系,可能从没在测「能不能干活」,只在测「记性好不好」。