01 触发事件

2026 年 8 月 29 日, TechCrunch 报道 Nvidia 的 AI 竞争优势正在"溢出 GPU 之外"——下一代数据中心的提效手段不再是堆更多 processor cycles, 而是 smarter traffic control。原文明面是讲产品演进, 暗线是讲护城河迁移: 在 Blackwell / Blackwell Ultra / Rubin 这一代之后, Nvidia 真正在卖的不再是 GPU 单卡, 是整套数据中心 fabric。

02 这事的真正含义

这不是"Nvidia 开始卖交换机了"那么简单。它真正的意思是: GPU 算力的边际收益已经在递减, 网络层和数据中心的 efficiency 才是下一段 scaling 的来源。

我这里要 hedge 一下——我没有内部跑过 GB300 NVL72 的全栈 benchmark, 公开材料里能看到的方向是 NVL72 在 MoE inference、长 context agent 这类 workload 上比 H100 8 卡有显著提升, 但具体数字各家口径不一致, 我不会报具体倍数。

但方向是清晰的。现在主流模型几乎全是 MoE: Mixtral、DeepSeek-V3 类架构, 以及 Anthropic、Google 的闭源 MoE 都是。这种架构对 all-to-all communication 极其依赖, KV cache 在长 context 下需要跨卡共享, batch 推理里的 token routing 也是网络密集型任务。这意味着一件事: GPU 多 30% FLOPS, 不如把 token 在正确的卡之间搬运得更快来得重要。

Nvidia 的护城河从 GPU 溢出到网络层, 这才是这篇文章在讲的事。

03 历史类比 / 结构对照

最像的类比是 AWS 在 2014 到 2018 年的演化。早期 AWS 卖的是 EC2 算力, 后来真正赚钱的是 VPC、S3、managed service 组成的整套 cloud fabric。客户离不开的不是某个 VM, 是整套数据中心里数据流动的方式。

另一个对照是 Apple 在 2007 到 2012 年从卖 iPod / Mac 变成卖 iOS ecosystem。Nvidia 正在做的, 结构上是同一件事——当 GPU 算力开始 commodity 化 (AMD MI400、AWS Trainium、Google TPU v7 都在追), 必须主动把 moat 挪到 GPU 之外。

换句话说, 这就是 Andrew Grove 讲的 strategic inflection point: 当原有竞争优势遇到边际收益递减, 必须主动迁移到下一层。Nvidia 这次转得早, 比等到 GPU 卖不动再转要聪明得多。

04 对 AI builder 意味着什么

第一, 评估硬件时, NVLink / NVSwitch topology 应该比 raw TFLOPS 更重要。如果你在跑 MoE 推理、长 context agent、或大规模 batch, 跨卡通信效率直接决定 cost-per-token 这个核心指标。

第二, 不要把 Nvidia 当 GPU vendor 谈, 当 full-stack system vendor 谈。Sovereign AI 这类国家级采购, 谈判的不是 GPU 单价, 是整套集群的 TCO 和 utilization。这条对模型 API 消费者来说也间接相关——上游打包越紧, 你能选的 routing 选项越少。

第三, 对 opcx.ai 这种 model access 平台来说, 上游 infra 变化会传导到 API pricing 和 routing 策略。如果 Nvidia 系 GPU 的 inference cost 下降幅度比 AMD / TPU 阵营大, 我们需要在 model routing 上重新评估 default backend, 不能简单按价格排序。

05 反方观点 / 风险

我可能高估了网络层护城河的持续性。三点风险:

第一, hyperscaler 正在用自研网络绕开 Nvidia。Microsoft 在 Azure 内部持续推 Ethernet + 自研调度替代 InfiniBand, Google TPU 本来就是 full-stack 自控, AWS Trainium 也在走自己的 fabric。如果三家集体往自研网络走, Nvidia 的 Spectrum-X 客户群会被压缩到 enterprise tier, 这一层对价格更敏感、moat 更弱。

第二, "smarter traffic control" 这个叙事容易被传统网络公司吃掉。Cisco、Arista、Broadcom 的 Tomahawk 系列都在抢这个位置。Nvidia 的优势是 GPU + network 同源、可以协同调度, 但如果模型架构再变一次 (比如 SSM 类架构、Mamba 系吃更少 all-to-all 通信), 整个优势基础会动摇。

第三, 也是最关键的——我没看到 Nvidia 在网络层之外的下一层是什么。当 rack-scale 也开始 commodity 化的时候, moat 必须再往下沉。我的判断有效期可能是 18 到 24 个月, 之后 Nvidia 自己也得再交一次答卷。