一个 Reddit 用户拿两台 NVIDIA DGX Spark(约六万元一台)对比两款国产开源模型,给出一个数字:智谱 GLM-5.3 Flash 在写代码测试中以 97% 对 94.5% 跑赢 DeepSeek V4 Flash。开源小模型在「小机器」上真正进入取舍战——GLM 慢三成、上下文只有后者四分之一。

这是什么

HumanEval 是行业里测「AI 会不会写代码」的标准测试。GLM-5.3 Flash 在开了深度思考模式后拿到 97% 通过率,DeepSeek V4 Flash 是 94.5%。GLM 跑完这个测试只要 20 分 52 秒,DeepSeek 要 38 分 16 秒。

代价在另一边:GLM 每秒生成约 50 个字(token),DeepSeek 是 70 个;GLM 上下文(AI 一次能处理多长)是 25.6 万字,DeepSeek 是 100 万字。说白了:GLM 写代码更准,DeepSeek 长文本更强。

行业怎么看

官方话术会捧国产开源模型。但我们提示三个冷静点:

这是 Reddit 个人测试,不是机构评测——作者自己在文末说「自己的体验比任何 benchmark 都重要」。HumanEval 只测写代码,是窄指标,不能推出「全面超越」。2.5 个百分点的差距在统计意义上不算大,且双方都用了量化压缩(一种用更小空间存模型的技术,会损失一点精度),说「全面反超」并不严谨。

但反向看:三年前在 256GB 显存里跑出 97% 是天方夜谭。开源追平闭源的速度,确实在加快。

对普通人的影响

对企业 IT:以前「在内网跑 AI」是技术极客的事,现在有了现成路径。数据合规敏感的金融、医疗、政务行业,本地部署越来越现实——采购时该问:我们能不能自己跑?

对个人职场:日常办公室短期内不会变。但模型便宜了,意味着订阅类 AI 工具会继续降价,年底前大概率有一波促销。

对消费市场:手机和 PC 厂商未来一年会更激进地宣传「端侧大模型」——模型在设备上直接跑、不上传。手机里的中文 AI,正在从「凑合能用」走向「真能干活」。