返回首页
大模型训练
找到 2 篇关于此标签的文章
DeepSpeed微软
7B 模型训练要 160GB 显存 — 这是 AI 只剩巨头能玩的根本原因
训练一个 7B 大模型需要 160GB 显存,单张顶配 GPU 都装不下。这道算力门槛决定了 AI 行业只能是巨头的牌局 — 独立研究团队和中小公司,要么买 API,要么被淘汰。
Aug 132 分钟
QuadtrixTransformer
纯C++无依赖手搓Transformer成功,揭开大模型黑盒但难改算力格局
有开发者仅用C++17标准库,无任何依赖手写了一个0.83M参数的GPT模型并训练成功。这证明了大模型并非不可拆解的魔法,但手写代码与工业级框架75倍的效率差距也说明,底层创新仍需算力基建支撑。
May 22 分钟