Z.ai 这周发布 GLM-5.3,参数规模、架构、激活参数(每次推理真正参与计算的参数,MoE 模型分这两种)和上一代 GLM-5.2 完全相同,只多花一个月做长链路 RL(强化学习,简单说就是让 AI 在模拟环境中反复练习,靠奖惩信号自我调整)训练。我们在意的不是发布本身,而是它背后的主张:当参数堆到某个阈值后,决定能力的是后训练,不是模型变大。

这是什么

Z.ai(智谱)的实验是一个典型的「控制变量」:模型主体不动,变量只有后训练的时间和方式。结果在某些长链路任务上(需要多步推理、不能一步到位的问题,比如找代码漏洞),GLM-5.3 明显强于 GLM-5.2。

文章把这个结果放进了一个更大的历史脉络:

  • 2020 年 Kaplan 那篇论文认为参数应该比数据涨得快 2.7 倍,业界照做,造出了一批「参数大但笨」的模型;
  • 2022 年 Hoffmann 用 400 个模型重做实验,结论是每个参数配 20 个 token 最划算,这就是 Chinchilla 法则;
  • 当模型被每天调用数十亿次后,推理成本(每次回答问题的算力开销)超过训练成本成为常态,Llama-2-7B、Gemma-2-9B 这种「小模型喂饱数据」的路子就起来了;
  • 到了 MoE(混合专家,把一个大模型拆成多个小模块、按需激活)架构,事情又变了——总参数决定模型「能记住多少」,激活参数决定「能推理几步」,两者不能合并看。

Z.ai 引用的 Roberts 等人 2025 年研究指出一个关键差异:死记硬背的任务参数越多越好,需要推理的任务数据越多越好。「参数 = 能力」这个等式,从来就不成立。

行业怎么看

支持方认为这是「清醒的一步」。一位长期做模型评估的研究员对《本地 LLaMA 论坛》表示,过去两年大家把 90% 的钱砸在参数增长上,但用户用 AI 时 90% 的痛点是「它思考不下去」,不是「它不知道」。Z.ai 用控制变量法证明后训练有独立价值,是行业第一次把这个证据公开摆上桌面。

反对意见同样尖锐。一位长期跟踪中国大模型公司的投资人对我们说,这篇博客更像 PR 而不是科学——只公布「做了什么」,没公布「对比什么基线」(baseline,跑实验必须的对照组)、「评测集是否独立」(benchmark,公开测试题集)、「成本上升多少」。一个月 RL 训练的真实算力开销,可能比换更大基座还贵。模型好,不等于企业愿意买单。

还有一条隐忧:长链路 RL 训练依赖高质量模拟环境。能搭出这种环境的公司,全球不超过 10 家。如果「后训练」成为新护城河,算力优势反而会比参数时代更集中——OpenAI、Anthropic、Google、Z.ai、DeepSeek 之外的玩家,可能连入场券都拿不到。大模型的「民主化」叙事,正在悄悄反转。

对普通人的影响

  • 对企业 IT:未来 18 个月,采购大模型 API(调用接口,按 token 计费)时「参数规模」不再是第一指标,关注点会转向「任务跑分」和「单价推理质量」,现有招标模板需要重写。
  • 对个人职场:会写提示词(prompt)、会拆解任务链的从业者价值继续上升;纯靠「我懂参数」建立优势的空间在收窄。
  • 对消费市场:明年消费级 AI 产品会出现一波体验分层——同价位产品有的「博学但答非所问」,有的「思考深但反应慢」,选购时该看任务类型,而不是看模型名字。