这是什么

AMD 新芯片 Strix Halo 的用户这周给出个反直觉的测试结果:Zhipu 三年前发布的 GLM 4.7 Flash,在工具调用(让 AI 自动操作外部软件完成任务)和常识问答上跑赢阿里今年的新版 Qwen。

这不是一次正式 benchmark(基准测试),而是单个开发者在自己硬件上的主观体验。但它指向一个被忽视的问题——开源大模型不是越新越好用,对企业选型有现实意义。

行业怎么看

支持者会认为这印证了 Zhipu 在开源生态的早期积累——GLM 系列是国内最早押注开源路线的大模型之一,虽然发布已久,但工具调用这类工程化能力打磨得扎实,适合真实业务场景。

反对意见更值得听三点。第一,单个用户在特定硬件上的测试不能当 benchmark 用,Qwen 在标准评测集上其实长期优于 GLM 同类模型;第二,这位用户自己承认「可能是 Qwen 配置有问题」,无法判断这是模型代差还是使用问题;第三,也是最关键的一点——Zhipu 在 GLM 4.7 Flash 之后再没出同体量的新模型,可能意味着公司战略重心已转向闭源或更大尺寸,企业选型时真正要担心的不是今天谁跑得好,而是三年后还有没有团队维护。

对普通人的影响

对企业 IT:如果公司在评估自建 AI 方案(不依赖云端,把模型部署在公司服务器上),开源模型选型不能只看发布日期——同一家公司三年前的模型,可能比另一家今年的新模型更适合你的硬件和工作流。

对个人职场:「会用最新 AI 工具」正在贬值,「能在不同模型间做选择、判断什么场景用什么模型」开始值钱——这个 Reddit 帖子就是一个具体案例。

对消费市场:AMD Strix Halo 这类能让普通电脑本地跑大模型的硬件正在成熟,未来一两年,不联网、本地就能对话的 AI PC 和智能设备会变多。