智谱这周把旗舰模型 GLM-5.3-Flash 的折扣价打到 4.5 美分每任务——Anthropic 同档 Claude Opus 4.8 的四十分之一。「前沿=昂贵」的行业默认,第一次被中国公司在性能、价格、开源三张牌上同时改写。

这是什么

GLM-5.3-Flash 是智谱开源发布的 320B 总参数、18B 激活参数的大模型(即每次推理只调用 18B 参数),GLM-5 系列首个原生多模态模型(直接处理图像与文字,不靠外挂模块)。几件事放一起看: Artificial Analysis 综合智能指数 57 分,与 Claude Opus 4.8 持平; MIT 协议开源(最宽松许可证:商用、修改、再分发均免费),HuggingFace、API、Coding Plan 同步上线; 1M token 上下文窗口(一次处理约一本中等厚度书的文字)出厂配置; 发布前匿名模型「牛来」拿下 OpenCode、OpenRouter 双平台调用量第一,全部流量跑在国产芯片集群。

行业怎么看

编辑部听到三种声音。 支持者认为,「前沿=昂贵」默认被打破。稀疏+线性混合注意力、IndexPool 缓存压缩、mHC 扩展效率三项叠加,让 1/40 价差源自架构而非补贴;国产芯片承载前沿流量被视为算力验证时刻。 谨慎者提两条风险:4.5 美分是限时折扣价,回归正价后成本能否守住是问号;官方承认 KV 缓存(推理时存储的历史信息)仍高于 Kimi-K3 与 DeepSeek-V4-Flash。 更冷静的看法:性能持平不等于体验持平,AA 指数是综合打分。在 BabyVision 等纯视觉基准上与 GPT-5.6 Terra、Gemini 3.7 Flash 仍有差距——强项在带工具的编码,不是裸眼感知。

对普通人的影响

对企业 IT:API 成本结构可能洗牌,原本月度预算紧的旗舰模型,如今跑一整夜 AI Agent(自动跑多步任务的程序)或长文档批量处理都能负担。 对个人职场:完整长文档审阅、报告初稿这类深度使用的边际成本(多处理一份的额外花费)大幅下降,个人上限被价格挪开。 对消费市场:开源加国产芯片的价格压力会传导,海外大模型中文区定价接下来几个月很可能跟着调整。