01 触发事件

2026 年 8 月, Amazon 宣布将未来两年内向 Nvidia 采购的 GPU 数量从原计划基础上三倍扩张, 新增约 200 万颗, 官方口径是 "surging demand"。表面看是 cloud provider 加大 AI 投入的标准 PR, 但订单 "tripled" 这个动词, 比 "increased" 危险得多 — 它意味着 AWS 在 12–18 个月前对 AI 需求的判断是显著偏低的。

02 这事的真正含义

这件事真正在说的不是 "Amazon 买 GPU", 而是 AWS 的 Trainium 战略在 frontier 推理和训练上还没有形成真正的替代能力

如果 Trainium 2 / Trainium 3 真的能在性价比上打到 Nvidia H100 / Blackwell 的八成以上, AWS 没有理由把订单三倍化 — 自家芯片意味着 capex 留在 AWS 体内, 也意味着对 Anthropic、Meta 这些大客户有更可控的毛利率。一个理性的 hyperscaler 会尽量用自家硅替代 Nvidia, 除非替代不了。

我没在 AWS 内部跑过 Trainium 的 workload, 但从公开的 Anthropic / Airbnb 案例和 Trainium 集群规模看, 它今天主要承载的是非 frontier 的训练和中等复杂度的推理 — 真到 Claude Opus / Sonnet 这种等级, 仍主要跑在 Nvidia 上。三倍订单意味着 AWS 已经默认了 "至少到 2028 年, frontier workload 离不开 Nvidia"。

那个真正会被定价的是: Nvidia 的 moat 在 H100 → Blackwell 这一代没有被打穿, 反而被加强了。Microsoft 的 Maia、Google 的 TPU, 都还停留在 "自家 workload 用一用" 的阶段, 没有外溢成真正的第三方替代品。

03 历史类比

最像的时刻是 2010–2013 年 AWS 对 Intel Xeon 的依赖。Amazon 当时意识到 x86 是数据中心唯一可行的选择, 于是开始认真做 Graviton — 但 Graviton 真正能扛起 AWS 相当比例的通用 workload, 是 2018 年 Graviton2 之后的事。从 "意识到依赖" 到 "做出能打的替代", 花了接近十年。

Trainium 2018 年立项, 到现在 2026 年, 大概 8 年, 仍未到 Graviton2 之于 Intel 的位置。这个时间表意味着: 即使 AWS 全力推进, 真正能分流 Nvidia 容量的自研硅, 最早要到 2030 年前后。

另一个对照是 2014–2016 年的 GPU 泡沫前夜。当时 Nvidia 靠 gaming 卡打进深度学习, hyperscaler 集体下注 GPU 集群, 大家都觉得需求 "surging"。后来泡沫破裂 (一部分是 crypto 崩盘叠加), 但 Nvidia 的份额没掉 — 因为 AI 需求接住了。这次不一样的是, 下游需求方是真实的 LLM 推理和 agent 调用, 不是 mining。需求曲线更陡, 但也更实在。

04 对 AI builder 意味着什么

这周 / 这个月该调整的几件事:

第一, 推理成本下降节奏要重新校准。过去两年大家默认的预期是 "每年 token 单价下降 5–10×", 这个曲线假设了 GPU 供给宽松 + 自研硅分流 + 量化 + 蒸馏多管齐下。Amazon 三倍下单说明需求曲线比供给曲线更陡, 单价下降的斜率会被拉平。我现在倾向于把 2027–2028 年的推理单价预测上调 30–50%, 而不是按 OpenAI / Anthropic 给出的 "frontier 模型定价" 线性外推。

第二, model routing 和多 provider 套利窗口还在。如果 Nvidia 容量仍然偏紧, 不同 cloud (AWS / Azure / GCP / CoreWeave / Lambda) 之间的现货价格差异会扩大。用 opcx.ai 这种多 model 网关做动态 routing 的产品, 价值会比 2025 年更高 — 因为同一 prompt 在不同 backend 的成本和延迟差异会更大。

第三, 锁定 long-term contract 要谨慎。如果你是 AI startup, 现在签一年期 GPU 容量合约, 比 2024 年更危险 — 一旦 2027 年 Blackwell Ultra 或 Rubin 上市, 价格会阶梯式下降, 锁定高位是给 Nvidia 送钱。

第四, 自研硅路线不要押注过早。如果你的产品 architecture 假设 "2027 年会有便宜的 AWS Trainium / Google TPU v7 替代品", 这条假设需要 hedge — 时间表可能再延后 2–3 年。

05 反方观点 / 风险

我可能错的地方:

风险一, 这是 AWS 的 hedge, 不是真需求。Microsoft 的 Azure + OpenAI 联盟、Google 的 Gemini + TPU 联盟, 都在产能上激进扩张。AWS 落后于这两家是公开的事实 (Anthropic 是 AWS 的客户, 但 Azure 也有 OpenAI)。三倍订单可能不是 demand-driven, 而是 competitive-driven — AWS 在为可能的 demand surge 做过度配置, 防止 Anthropic 客户被抢走。如果 AI 需求 2027 年真的冷却 (这是 Jensen Huang 自己都提过的可能性), 这 200 万颗 GPU 会变成 AWS 的折旧噩梦, 但这是 AWS 的问题, 不是 builder 的问题。

风险二, 我可能高估了 Trainium 的战略重要性。AWS 公开从未把 Trainium 定位为 Nvidia killer, 它一直是 "为特定 workload 提供更优性价比" 的角色。三倍订单不一定意味着 Trainium 失败, 可能只是 AWS 决定 "frontier workload 就让 Nvidia 赚, 我们用 Trainium 吃中长尾"。这个解读下, Nvidia 的 moat 没有被加强, 只是 AWS 在做理性分工。我没看到内部 capex 分配数据, 这个判断颗粒度不够。

风险三, "tripled" 这个数字的口径。可能是从原订单的某个子集 (例如仅限于 H200, 或仅限于某个 region) 三倍化, 也可能是整体三倍。如果只是 Blackwell 子集的三倍, 那么 H100 / H200 这部分存量可能并未真的 "tripled"。我对这个数字的解读, 是基于标题和摘要, 没有看到完整 PR 内容。

风险四, 时间维度。"未来两年" 这个窗口覆盖到 2028 年中, 期间 Rubin 平台会上市, Nvidia 的供给能力本身也在扩张。今天判断 "GPU 紧缺", 到 2027 年下半年可能完全反过来 — 就像 2018 年 crypto 崩盘后 GPU 短暂过剩一样。AI 需求的可持续性, 是这个判断最大的不确定性。

如果让我只保留一个判断: Amazon 的这次下单是 frontier workload 对 Nvidia 依赖的公开确认, 而不是 AWS 在 AI 上的胜利宣言。这件事的真正意义, 要到 2027 年下半年, 当 Anthropic 下一代模型到底跑在 Trainium 还是 Blackwell 上时, 才能完全看清。