这是什么
本周值得记一笔:Ling 3.0 Tiny 在 4GB 显存的旧 PC 上跑到了 36 token/秒,同环境下 Qwen 3.5 9B 只有 5 token/秒左右。这位 Reddit 用户还主观判断效果"很接近 Qwen 3.5 9B 和 Gemma 12"。
我们对这条单点帖子保持谨慎,但背后指向的趋势值得关心:消费级硬件跑得动、效果够用的小模型正在变多。Ling 3.0 Tiny 的关键参数是 80 亿总参数、每次推理只激活 13 亿 — 这是 MoE(Mixture of Experts,混合专家)架构的典型特征,让模型"看起来很大、用起来很小"。
行业怎么看
支持这条帖子的判断其实站得住:小模型路线(Phi、Gemma、Qwen 小尺寸、Llama 3.2 等)过去半年被 Microsoft、Google、阿里、Meta 同时加码,理由就是本地部署和个人设备都需要"小而能用"。
但单条 Reddit 体感需要打折扣。一是速度不等于质量,"接近 Qwen 3.5 9B"在生产环境里可能是"差一截";二是 Ling 这个系列在主流基准榜单上目前还缺乏存在感;三是 8B 总参数模型若要商用,许可、合规、微调成本并未消失,"下载即用"是错觉。
对普通人的影响
对企业 IT:如果本地推理成本真能压到这份上,私有部署、不上云的方案值得重新评估,但请先实测,不要被一条帖子带跑。
对个人职场:处理敏感文档、不愿把数据交给云端的人,多了一个"自己电脑跑 AI"的备选项,前提是你愿意折腾下载和环境配置。
对消费市场:手机和 PC 厂商更有理由把"内置 AI"做成卖点了 — 硬件门槛下来了,软件能不能接住是下一步看点。