一位独立工程师把账算到了底:8 卡 H200 服务器整机约 37 万美元,纯硬件回本周期在 14 到 36 个月之间 — 关键变量不是价格,而是利用率。

这是什么

这位用户在 r/LocalLLaMA 公开了完整计算过程。核心数据如下:

  • 硬件:8 卡 HGX H200 服务器报价 32-42 万美元,中位数 37 万
  • 租用:34 家供应商按需价 $4.40/卡-小时(9 月 18 日),折合整机 $35.20/小时
  • 纯硬件回本:100% 利用率 14.4 个月,60% 利用率 24 个月,40% 利用率 36 个月

但硬件只是冰山一角。还有四块隐藏成本:电力与机房散热(作者被 colo 报价超出预算)、折旧(建议把任何假设砍半 — 二手数据中心硬件残值薄)、运维时间、空闲小时。他的最终判断:连续 2 年保持 60% 以上利用率,自建胜;40% 以下,租胜。另一条路是把闲置算力挂到 offtake 网络(外部算力撮合平台)卖给其他团队,对冲成本。

行业怎么看

把账摊开后,至少有三个反对视角值得读者注意:

折旧被普遍低估。消费级 GPU 三年残值剩三成是常态,H200 这类专用卡更惨 — 你不是卖给普通买家,而是卖给另一家也在算同样账的 AI 团队,残值天然被压。

利用率很难稳定。训练是突发性的(一次大模型微调吃满集群两周然后空闲),推理相对平稳。小团队几乎跑不到 60% 利用率。

硬件迭代速度太快。B200、GB300 已在路上,今天 37 万买的设备 18 个月后账面腰斩,而云厂商新一代已上线 — 算回本期要把"代际折旧"加进去。

支持自建的声音也存在:模型路线稳定、需要数据不出域、对延迟敏感的企业(金融、医疗),租并不便宜。但前提是组织里有真能运维集群的人。

对普通人的影响

对企业 IT:预算 30 万美元以上自建 AI 集群对中型企业仍是重大 CAPEX。除非业务能稳定跑出 60% 以上利用率,否则按需租用是更可控的选择。

对个人职场:AI 基础设施成本决策开始进入中型企业 CFO 视野。能把"算力账"算清楚的人,正变成新稀缺岗位 — 这是 IT 或财务背景转型的新通道。

对消费市场:日常用的 AI 产品背后大概率跑在租来的算力上。关注 H100/H200 租赁价格,等于在预判明年订阅费会涨还是降。