本周开源 CLM 模型在「Agent 决策」任务上比闭源 Jev 快 4-13 倍——这是开源阵营在该方向首次追平闭源。事件来自 Hugging Face 上一款刚发布的新模型,名字叫 CLM(Contrastive Language Models),它让 Jev 不再是唯一选项。

这是什么

Jev 和 CLM 解决的是同一个问题:让 AI Agent(能自主操作浏览器、游戏、软件的 AI 程序)在每一步做出「快思考」级别的判断。两者都提供三个基础判断接口——Choice(在多个选项中选一个)、Noul(判断一句话是真还是假)、Score(按打分标准给输入打分)。

关键差异在于:Jev 是云端闭源 API,不能微调(在已有模型上用自己的数据继续训练);CLM 是开源模型,基于阿里通义千问 Qwen3-8B 构建,对外发布 75MB 的「决策头」权重(专门处理决策任务的小模块),企业可下载训练。

跑分上,CLM 在交互式 Agent(浏览器自动化、恐龙跑酷)上比 Jev 快 4 到 13 倍;针对编程 Agent 验证器(检查代码是否正确的子模块)专项微调后,CLM 在 Terminal-Bench 2.1 上达到 87.6%、DeepSWE 上达到 81.6%,而零样本(不微调、直接用)Jev 在 DeepSWE 上只有约 71%。

但 Jev 也有自己的优势。在伯克利函数调用排行榜 v4 上 Jev 得 99.2%,CLM-8B 是 95.2%。更关键的是上下文(模型一次能处理的文字长度):Jev 出厂支持 64K token,CLM-8B 只在 2K 到 8K 范围内做过校准,超出 8K 的部分表现不稳定。

行业怎么看

Reddit LocalLLaMA 社区开发者普遍兴奋:「终于不用被 API 绑定了」「75MB 头部权重相当于可私有化部署的决策模块」。

但也有冷静甚至反对的声音。第一种质疑来自基准:CLM 的 87.6% 是微调后跑出来的,Jev 的 71% 是零样本跑的,不在同一基准,要真比较得让 Jev 也用同样数据微调。第二种担忧更现实:8K 上下文对很多企业场景是硬伤,长合同、长对话、多工具调用都装不下。第三种风险来自概率校准,CLM 输出概率相对候选集计算,金融、医疗这类需要稳定阈值的场景用起来别扭。

值得关心的是:AI Agent 技术栈正在分层——大模型做「慢思考」,专门模块做「快思考」,开源已在快思考模块上追平闭源。这比「又一个千亿参数大模型」更值得关注。

对普通人的影响

对正在自建 AI Agent 的企业 IT 部门:CLM 多了一个免 API 调用费、可私有化部署的选项;但 8K 上下文短板意味着不能直接替换 Jev,需要先评估任务是否落在 CLM 优势区间。

对个人职场中的软件工程师:75MB 决策头权重把微调门槛从「训练大模型」降到「下载+小数据集训练」,有 Agent 项目经验的人可以亲手试。

对消费市场:暂时没有直接影响。普通用户日常用的仍是通用大模型(ChatGPT、文心一言、通义千问),Agent 决策层开源进展不会直接体现在消费产品里。