01 触发事件
2026 年 7 月 11 日,36kr 披露智谱 CEO 唐杰内部信《巨浪已来》:智谱在 2026 年 6 月跻身万亿港元俱乐部,较半年前上市初期市值涨了 10 倍;7 月 8 日首批股票解禁后股价仍稳住;公司将过去一年押中的主线,从 Coding 与 Reasoning,进一步推进到 Long Horizon Task、Autonomous Agent System、Self-Evolving。
这不是一封普通的“战略升级”内部信。
按 36kr 的叙述,智谱 2025 年初开始重配资源,集中提升模型 Coding 能力;2025 年 7 月发布 GLM-4.5,2026 年 6 月上线并开源 GLM-5.2;截至 2026 年 3 月,MaaS 平台 ARR 达到 17 亿元,过去一年提升 60 倍。文章同时给出一个更刺眼的参照:Anthropic 从 2024 年 1 月 8700 万美元 ARR,到 2026 年 6 月突破 470 亿美元,核心抓手同样是 AI Coding。
如果只看表层,这像是中国版“Claude trade”:先靠 Coding 把模型能力变现,再把资本市场信心转译成 AGI 叙事。
但我没在智谱内部跑过它的收入结构,也没看到更细的 cohort 数据,所以我会把这里的判断限定在一个更稳的层面:内部信真正重要的,不是它说了什么远景,而是它刻意改变了市场该如何给智谱估值。
真正被市场定价的,不是一个模型会不会写代码,而是一个公司能不能把推理能力变成长期、重复、可扩张的生产系统。
02 这事的真正含义
问题不在于“智谱发布了新愿景”,而在于它公开承认:单次对话与单次 Coding assist,已经不足以支撑下一阶段的估值锚。
唐杰把下一阶段拆成三件事:Long Horizon Task、Autonomous Agent System、Self-Evolving。这个顺序很关键。
先是 Long Horizon Task。它意味着模型价值单位,从“一次回答”变成“一个跨天、跨周的任务完成率”。这会直接改写 token 经济学:你卖的不再是 prompt-response,而是 memory、工具调用成功率、失败恢复、checkpoint、KV cache 命中率、长链路推理稳定性。换句话说,收入模型会从 token throughput,转向 task throughput。
再是 Autonomous Agent System。这里真正稀缺的,不是会不会做 agent demo,而是能否把 agent 变成 7×24 可运营系统。谁掌握 memory 层、工具协议、权限边界、评价闭环,谁就开始拥有 distribution 之外的第二层 moat。MCP、A2A、内部工具总线,这些看起来像接口标准的小事,最后都会变成 switching cost。
最后才是 Self-Evolving。这一段最像资本市场语言,但也最值得警惕。它在暗示一种更重的资本结构:如果 AI training AI 成立,那么下一阶段的瓶颈就不只是 pretraining 数据,而是能否持续吞下推理算力、合成数据管线、自动评测系统。也就是说,模型公司从“训练公司”转向“永不停机的推理-评测-再训练复合体”。
我可能会低估其中的研究成分,但从商业策略上看,这才是智谱在说的事:它不想只做中国市场里一个强 Coding model provider,它想被定价成 agent era 的基础设施候选。
这一步一旦成立,benchmark 就退居二线,持续推理成本曲线才是一线。
03 历史类比 / 结构对照
我想到的类比,不是 2022 年 ChatGPT,而是 2014 年 AWS 从“便宜服务器”变成“默认计算层”的那一刻。
早期很多人把 AWS 理解成租机器。后来市场发现,真正难迁移的不是 EC2 本身,而是围绕存储、身份、数据库、监控、部署形成的操作系统。价格当然重要,但决定客户留下来的,是整个工作流被吸进去之后的 switching cost。
智谱这次内部信,也在做相同动作。
第一阶段,Coding 是入口,像当年的低价算力,先证明“能用、好用、值得付费”。第二阶段,Long Horizon Task 是把 API 从函数调用升级成工作流承载层。第三阶段,Autonomous Agent System 则是在争抢 AI 时代的“云操作系统”位置。谁能让企业把知识库、工具链、权限、审计、评价都绑定进去,谁就不再只是模型供应商。
这个结构也像 iPhone 之后的 App Store,只不过单位从 app 变成 agent。硬件时代的核心约束是分发;云时代的核心约束是部署;agent 时代的核心约束会是自治系统的可靠性与可计费性。
我没法确认智谱能不能成为这个位置上的最终赢家,毕竟 OpenAI、Anthropic、Google 也都在沿着 agent stack 往下压。但如果只看叙事进位,这封信很像一个 inflection point:从“模型性能领先”切到“生产系统领先”。
先赢下 assistant,不代表就能赢下 agent;但赢不下 agent,assistant 的高增长通常守不久。
04 对 AI builder 意味着什么
如果我是 AI builder、模型 API 消费者,接下来这周和这个月,决策重点不该是追逐最新榜单,而是重算自己的任务单位经济。
第一,重新定义路由逻辑。不要再只按“哪个模型最聪明”路由,而要按任务阶段拆层:规划模型、执行模型、验证模型、回退模型。Long Horizon Task 的毛利,不会来自单一 SOTA model,而来自 routing 是否精细。便宜模型配合 prompt caching、batch、异步执行,常常比一把梭高端模型更能守住利润。
第二,开始把 memory 当正式基础设施,而不是 demo feature。到了 agent 阶段,RAG 不是护城河,memory pipeline 才可能是。你要盯的是写入频率、召回精度、过期机制、权限隔离、上下文污染,而不只是 context window 数字。window 再大,也不能替代结构化记忆。
第三,优先押注可观测性。真正贵的不是 token,而是 silently wrong 的 agent。没有 step-level tracing、tool call replay、失败归因、人工接管接口,Long Horizon Task 只会把错误放大。我可能偏保守,但我会认为 2026 下半年的 builder 分水岭,不是“谁先发 multi-agent”,而是谁先把 agent debug 做成标准件。
第四,别把开源当成情怀议题。按 36kr 口径,GLM-5.2 的开源和上线被视为智谱进入全球 AI Coding 第一梯队的关键信号。对 builder 来说,开源的意义不只是省钱,而是获得可控性:私有部署、定制 eval、工具链耦合、合规缓冲。闭源模型继续适合冲刺上限,但开源模型越来越像谈判筹码和成本地板。
第五,如果你本身卖 API 或网关,真正要卖的是 routing intelligence,而不是 catalog completeness。客户最后留在你这里,不会因为你接了多少家模型,而是因为你帮他把 task success rate、latency、unit cost 一起压到可接受区间。
我没在所有行业里验证过这套结论,尤其高监管行业可能更慢,但大方向很清楚:应用层的套利窗口,正在从“套一个最强模型”转向“编排一条最便宜且足够可靠的任务链”。
05 反方观点 / 风险
我也可能错,而且可能错在最核心的地方。
第一种可能,是市场把智谱的 Coding 成功外推得太快。Coding 的高付费意愿,并不自动等于 Long Horizon Task 也有同样强的商业闭环。写代码天然可验证、可替代人时、ROI 好算;而多步 agent 任务往往边界模糊、责任不清、错误代价高。很多公司会发现,assistant 能卖,autonomy 却卖不动。
第二种可能,是“Self-Evolving”被高估了。AI 训练 AI 听起来诱人,但如果合成数据分布塌缩、评测反馈失真、reward hacking 失控,系统会迅速进入自我强化的幻觉循环。我没见到智谱在这方面公开更多工程细节,所以我不会轻易把它当作已验证路线。
第三种可能,是资本市场喜欢这个故事,但企业客户未必买单。万亿港元市值、10 倍涨幅、解禁后股价稳住,这些都说明市场相信智谱抓住了某个主叙事。但二级市场认可,不等于企业 IT 会大规模把核心流程交给自治 agent。历史上,很多平台叙事都先被交易,后被使用。
第四种可能,是 open source 的追赶会比所有人想得更快。若 GLM、Qwen、DeepSeek、Mistral 一类模型持续把 Coding 与 agent 能力压到 commodity 区间,那么真正被压缩的会是模型层毛利,而不是应用层。届时智谱这类公司的挑战,反而是如何证明自己不是另一个被开源定价的 provider。
所以我的最终判断并不浪漫:这封内部信不是 AGI 宣言,它更像一份资本开支宣言。
智谱在押注一个更大的答案:未来最值钱的 AI 公司,不是最会聊天的,也不只是最会写代码的,而是最先把推理、记忆、工具、评测、再训练绑成闭环,并把这套闭环卖成基础设施的公司。
这条路很对。
但它也极贵,而且容错率极低。