一家叫 SupraLabs 的小团队本周用消费级显卡(RTX 5060 Ti 16GB + RTX 5060 8GB)训练出一款 25M 参数的语言模型(约为 GPT-2 的六十分之一),并声称成绩追平自家的 50M 旧版本——我们的判断是:这更像一场社区实验秀,而非可引用的产业信号,但它指向的反向趋势值得记一笔。

这是什么

Supra2-Medium-Base 是一款「基座模型」——也就是只完成预训练、未经过「指令微调」(就是用问答/对话数据再训练一遍)的底座,能续写文字但不能直接对话使用。团队在发布贴里贴了一段模型对「人工智能」的回答,文本充斥不通顺的重复句式,关于 25M 能不能打 50M 这件事,这份采样本身就是最直接的反驳。团队也承认指令微调版本「未来可能推出」,目前的形态更接近一项研究产物。

行业怎么看

社区反应两极。

怀疑者提出三个硬伤:第一,和自家旧版对比并不构成有意义的基准——Benchmark(评测指标)应当跨团队、跨规模才具备比较价值;第二,公开采样语法破碎,输出质量堪忧;第三,25M 量级能处理的任务复杂度本就有限,和真实业务场景存在量级差距。

支持者把这视作一个信号:在 OpenAI、Google 持续堆参数的同时,开源社区反向探索「小而专用」的路线,团队已预告将推出 25M 到 100M 的四款系列。

我们倾向于前者:当下 25M 模型的能力天花板离企业真实业务还很远。但把「小模型跑在本机」作为一条长方向去跟踪是合理的——这条路如果走通,意义不下于堆参数。

对普通人的影响

对企业 IT:短期内不要把这类小模型当成大模型替代品。但若未来几年本机小模型成本继续下降,数据隐私敏感场景(金融、医疗、政务)可能多一个本地部署的选项。

对个人职场:现阶段与日常办公无关。能用的本地 AI 助手仍依赖 7B 以上的模型量级,普通用户无需为 25M 模型改变任何工作流。

对消费市场:这个方向若走通,最大受益者是终端用户——未来手机、PC 不依赖云端也能跑有用的 AI,隐私和响应速度会有结构性改善。