本周 Z.ai(智谱)放出了 GLM-5.3-Flash 的完整模型权重,3200 亿参数只激活 180 亿(MoE 架构——把模型拆成多个"专家",每次只调用其中几个),号称在编程和 Agent 类基准上接近 Claude Opus 4.8,自家定价只有 GLM-5.2 的十分之一。这是智谱第一次以 MIT 协议(最宽松的开源许可,允许商用、修改、再分发)公开主力模型的权重。

这是什么

GLM-5.3-Flash 是智谱 GLM-5 系列的第一个原生多模态模型——输入不仅文字,图像和视频也直接进模型词表,不用外挂识别模块。架构上有两点新东西值得记一下。一是"混合稀疏+线性注意力"(Hybrid Sparse + Linear Attention)。传统 Transformer 处理长文本成本爆炸,线性注意力用近似算法压下来。智谱把 45 层里 34 层换成线性、保留 11 层稀疏注意力,长文本推理成本显著降低。二是"流形约束超连接"(mHC),扩宽层与层之间的信息通道,声称提升训练效率。训练用了 30 万亿 token(模型处理文字的最小单位)的多模态语料,上下文支持到 100 万 token(评测用 30 万文本 / 16.4 万视觉)。FP8 权重约 331GB,BF16 约 640GB——基本上要几块 H100 才能跑起来。

行业怎么看

Reddit 的 LocalLLaMA(开源模型主要讨论地)就是这次发布的主场,megathread 刚发几个小时,复测还没沉淀。但凭经验可以先列三条。乐观的理由是实在的:MIT 协议意味着商业化零摩擦;FP8 默认权重说明 Z.ai 在抢推理市场;如果基准自报属实,这是开源阵营第一次在 Agent 类任务上敢跟 Claude Opus 摆在一起比。但冷静看也有三处隐忧。第一,所有基准都是 Z.ai 自家跑的,独立复现之前都画问号——之前 GLM 版本就被社区质疑过中英文表现差距悬殊。第二,331GB FP8 权重意味着能自托管(自建服务器跑模型)的依然是少数大厂和云厂商,"开源"对绝大多数中小企业是虚名,他们实际购买的还是 API。第三,GLM 系列因内容安全过滤出过争议,5.3 是否收敛要看实测。

对普通人的影响

企业 IT:能自托管 GLM-5.3-Flash 的企业本来就在用其他开源大模型,这次真正重要的是价格信号——智谱敢打到上代十分之一,会向下挤压所有 API 报价。对中型公司而言,"开源"的实际意义不大。对个人职场:长上下文(100 万 token,约一本半《三体》)开始进入主流价位,"把整个代码库丢给模型分析"变得更现实。但日常编程工具(Cursor、Cline、Copilot)愿不愿意接入国产模型,决定了普通人能不能摸到。对消费市场:这个体量的模型只会跑在云上,跟手机和 PC 用户没关系。智谱的"Flash"后缀通常预示几个月后会出蒸馏版(小模型继承大模型能力),那才是真正影响普通用户的时候。