找到 1 篇关于此标签的文章
一家叫 SupraLabs 的小团队本周用消费级显卡训练出 25M 参数的语言模型(约为 GPT-2 的六十分之一),并声称成绩追平自家 50M 旧版本。我们看完采样,倾向于把它归为社区实验秀——但它指向的「小模型跑在本机」趋势,值得记一笔。