返回首页
DeepSpeed
找到 2 篇关于此标签的文章
Megatron-LMvLLM
千亿大模型训练的开源链路首次完整跑通 — 但能用上的中国团队不到十家
工程师把 K8s(容器调度)、Megatron-LM(NVIDIA 开源的模型并行训练框架)、vLLM(推理加速引擎)拼成一条训练千亿参数模型的完整流水线,并写成对照文档。国产大模型的「基础设施焦虑」有了解法,但真正能跑起来的玩家仍屈指可数。
6d ago2 分钟
DeepSpeed微软
7B 模型训练要 160GB 显存 — 这是 AI 只剩巨头能玩的根本原因
训练一个 7B 大模型需要 160GB 显存,单张顶配 GPU 都装不下。这道算力门槛决定了 AI 行业只能是巨头的牌局 — 独立研究团队和中小公司,要么买 API,要么被淘汰。
Aug 132 分钟