一个让美国同行有点尴尬的事实:Z.ai(智谱旗下)本周发布的 GLM-5.3,只用 750B 参数——不到 Kimi K3 的三分之一——就在多项 Agent 编程基准(即让 AI 自主写代码、调试、跑任务的测试)上追平甚至超过了 Claude Fable 5 和 GPT-5.6-Sol。

这是什么

GLM-5.3 这周先在 Z.ai 的编程套餐里上线,两周后会在 Hugging Face 开源权重(即可下载的模型参数文件)。官方博客开宗明义一句话:「Scaling post-training is all we did for GLM-5.3」——后训练的规模化,是我们为 GLM-5.3 做的唯一一件事。

所谓「后训练」(post-training),指的是模型预训练完成(即先用海量文本「喂」出基础语言能力)之后,再用大量高质量数据进行强化学习与微调。GLM-5.3 与上一版 GLM-5.2 用的是同一套底座模型,关键差异就是后训练阶段被大幅拉长。

对比之下,Moonshot 的 Kimi K3 被业内认为是「预训练杰作」——靠的是底座大、底子厚。Z.ai 走的是另一条路:底座不大,但后训练功夫深。这是工程取舍,不只是营销话术。

背景上,智谱前身是清华 THUDM 团队,2019 年成立,是国内最早做大模型的一批人之一,从 GLM、ChatGLM 一路迭代到今天。

行业怎么看

原作者 Nathan Lambert 的判断是:Z.ai 确实很会做自己的事,中国公司能持续跟上,不全是「蒸馏」(distillation,即用一个更强的模型去教小模型)撑场面。

但值得保留的,是另一种声音。业内一直有人怀疑:「这么小的模型真能打吗?」近期还有论文公开了从顶级模型中「抽取推理轨迹」(让 AI 把思考过程一步步写出来,供小模型学习)的简单方法——中国公司有没有用这种捷径,外界无从验证。

更深的反差在于:美国公司在算力、芯片、数据上的投入仍领先一个量级,能力上却没拉开差距。Lambert 自己也承认,最初他有点「不敢相信」。这件事的真实性,仍要等两三个月后社区大规模实测来定论。我们倾向于把它当成一个「高度可信、但仍需独立验证」的信号。

对普通人的影响

对企业 IT:Agent 编程现在多了一个新的开源候选,国内企业可以多一个比「全靠闭源大模型」更可控的选项,但落地还要看后续 API、合规和企业级支持是否跟上。

对个人职场:非程序员、产品经理、运营,开始可以用 GLM 类模型把「想法快速做成原型」这件事往前推,不必再完全依赖工程师排期。

对消费市场:普通消费者短期感受不到 GLM-5.3 的存在,但值得留意的信号是——中国 AI 公司的技术自信确实在上升。