这是什么
2B(20 亿参数)小模型在 5 项分类基准测试上拿到 83.1%,比商业化产品 Jev(由 TypeSafe 推出)公布的 83.0% 还高 0.1 个百分点——这件事说明开源小模型在"判断"这件事上已经追平闭源商业化产品。
模型叫 Jeff,本周由 Reddit 社区 r/LocalLLaMA 用户 firelex 发布。它是 Qwen3.5(阿里通义千问轻量版)和 Gemma(Google 开源小模型)的微调版本,专门做分类:给它一个情境和一串选项,直接吐出每个选项的概率,不生成文字。0.8B 版本在 M4 Max 芯片上每次判断约 28 毫秒,基本是实时响应。
训练成本才是这件事的重点。0.8B 训 2 小时、2B 训 3.5 小时,全程一张 RTX PRO 6000(96GB 显存工作站显卡),合成训练数据由两台 DGX Spark 本地生成。Apache 2.0 开源协议,可商用。
行业怎么看
这是"小模型追大模型"叙事里的又一具体案例。过去一年 Mistral、阿里、智谱都在押注小参数路线,开源社区持续证明 7B(70 亿参数)以下模型在垂直任务上能摸到大模型下限。firelex 自己就站在趋势里——他用阿里更新的 Qwen3.8-Flash-Next 生成合成训练数据,等于用更大模型的能力给小模型做定向优化。
但两点要警惕。第一,多步推理差距明显:Jeff 在 BBH(复杂推理基准)只有 64–68%,而 Jev 有 94%——小模型擅长"判断",不擅长"思考"。第二,合成数据有天花板。如果上游生成模型本身有偏见,下游小模型会被放大而不是稀释。一家企业如果把 Jeff 当作"大模型平替"上线,文档摘要、长链问答这些任务可能掉到 60% 出头,直接影响用户体验。
对普通人的影响
对企业 IT:值得重新评估 AI 用例的成本结构。一张 96GB 工作站显卡、几小时训练就能拿到 80%+ 准确率的判断模型,比订阅商业 API 便宜一个数量级。但要分清楚"判断任务"和"推理任务"——前者可以省,后者还得靠大模型。
对个人职场:标准化判断工具(合同条款分类、邮件优先级排序、工单路由)的成本正在下降。留意公司 IT 部门是否在试点本地小模型,未来一两年这类自动化可能会更普及。
对消费市场:28 毫秒响应速度意味着端侧 AI(设备本地运行、不上传云端)更近一步。未来你的手机或笔记本可能直接跑这种判断模型,隐私和延迟问题会同步改善。