一个号称让开源 AI 模型跑到 70 tokens/秒(粗略理解为"字/秒")的推理框架,被实测打回原形:真实任务下只有 38 左右,比竞品还慢 13%。问题不在技术,而是 benchmark 选了一道投机解码(一种加速技巧)能直接抄答案的题——让 AI 写 1000 遍"red"。

这是什么

Gufo 是开源大模型推理框架(让 AI 模型对外提供服务的中间层),主推数据:在 AMD Strix Halo PC 级芯片上跑阿里 Qwen 27B 量化版,单用户 70 tokens/秒,8 用户 122 tokens/秒。

Reddit 用户用 Gufo 自家脚本复测,70 确实能跑——但测试题是"写 1000 遍 red"。换成代码、总结、翻译等真实任务,单用户跌到 38 左右,8 用户去掉排队时间后实际只有 52。和竞品 Halogen 对比,真实任务下 Halogen 反而快 13-18%。Gufo 在长提示词处理上有优势,重复任务优势更大,只是首页没展示这些场景。

行业怎么看

正面:测试方法本身规范。用户用了 Gufo 自家脚本,Gufo 文档其实分了"重复题"和"混合题",混合题数字与实测吻合,问题不在造假。

质疑:问题在传播路径。GitHub 描述和 README 顶部只展示最好看那格,普通用户不会往下翻。这和大模型厂商在榜单上"挑题刷分"是同一种动作。

风险视角:把 AI 跑分等同于传统软件性能测试本身就不严谨,AI 推理负载波动远大于传统软件,单题不代表生产环境。但正因如此,挑题刷分才有诱惑力。"用最佳场景定义产品"是整个 AI 基础设施行业的系统性问题,不是 Gufo 一家的事。

对普通人的影响

对企业 IT:今年评估本地部署开源大模型时,别直接采信首页数字,要求对方在你们真实业务数据上跑一遍再下结论。

对个人职场:从模型层到工具层,"截图秀速度"普遍不可信,挑 AI 写作、编程助手时看长期真实评测更靠谱。

对消费市场:消费级 AI 产品(翻译笔、学习机)的"每秒多少字""准确率多少"同样可能挑过题,看到"实测"二字可多信一分。