这是什么
训练一个 7B 大模型需要 160GB 显存,一张顶配 GPU 装不下——这决定了 AI 行业只能是巨头的游戏。
为什么这么大?模型参数占 14GB,反向传播要算梯度又是一份 14GB,Adam 优化器(一种主流训练算法)还要为每个参数维护三份 FP32 缓冲区(动量、方差、权重副本),合计 84GB。再加上前向激活值(中间计算结果),总账 142–162GB。
微软的 DeepSpeed ZeRO 和 Meta 的 FSDP(全分片数据并行)干的事,本质是「分摊」:把参数、梯度、优化器状态切片分散到多张 GPU 上。ZeRO 三档(Stage 1/2/3)切的东西越来越多,Stage 3 把所有内容都打散,8 卡时每卡显存从 112GB 降到约 14GB。
我们注意到:这是大模型行业的「入场费」。技术能力只是其中一张牌,钱和算力才是更硬的门槛。
行业怎么看
支持方的判断:这套基础设施催生了英伟达的卖方市场,也撑起了 AWS、Azure、阿里云、腾讯云各自的 AI 训练服务。「显存经济学」是云厂商这两年财报亮点的主要解释。
另一面,也是我们更关心的:训练门槛升高,意味着独立研究团队和中小公司正在被挤出牌桌。所谓「AI 民主化」,在训练这一端更多是营销话术;微调(fine-tuning)和推理(inference,让训练好的模型答题)那端门槛确实低,但「从头训一个」仍是少数人的游戏。还有个隐性成本——这么多卡同时跑,电费和冷却是天文数字。
对普通人的影响
对企业 IT:想自己部署大模型?认清一点——自建训练能力是千万级起步,没有规模优势就用 API 或托管服务。
对个人职场:你不必懂这些技术。关键判断是:AI 服务的「贵」不是厂商要赚你钱,是底层的训练和推理成本就在那里。
对消费市场:理解这点就能看懂为什么手机 AI 助手、智能音箱升级都要收月租——硬件不赚钱,AI 这部分算力账要算到消费者头上。