4B 模型(参数约 40 亿)用 1200 美元、15 天做出击败 GPT-5.6 Luna 的决策 AI。最值得我们关心的是分数以外的事:它做对了一件通用大模型一直没做对的事——知道什么时候该说"不知道"。

这是什么

开发者 Mohit 是服务过《财富》500 强公司的流程顾问。他在 Qwen3.5-4B(千问系列开源轻量模型)上微调出 ImaJev-4b:输入文字记录或最多两张照片,输出"退款""退货"等决策概率,并允许回答"不知道"。在 JevBench 91 个模型中排第一,在 DecisionBench 上排第三,超过 GPT-5.6 Luna 和 DeepSeek V4.1。成本约 1200 美元 GPU 租用费,权重 Apache-2.0 开源。

作者承认纯准确率只排第三,真正的强项是"校准"(置信度与实际正确率一致):说 90% 把握时确实有 90%,适合做财务、退款、客服这类容错率低的决策。

行业怎么看

乐观的一方认为,这印证了一个判断:通用大模型不擅长垂直业务决策,因为好决策意味着"知道不知道"。垂直小模型用更少的钱、更确定的答案,对企业才是真正可用的工具。

谨慎的一方指出三点。JevBench 和 DecisionBench 都是较新榜单,受测样本有限,第一名未必代表普遍优势;作者用"两个 AI 答案一致"的题目训练,等于把训练集筛窄了,可能在更复杂场景里反而退步——他自己第一次微调就让模型从 64.9 分掉到 42.3 分;"能说不知道"对流程自动化是双刃剑,太多 "unknown" 会把工作推回给人。

另一个被忽视的背景:底座用的是 Qwen3.5-4B,国内开源模型正成为海外个人开发者的默认起点。

对普通人的影响

  • 对企业 IT:理赔审核、退换货、客服分流开始有"够用且便宜"的选项,不必再为大模型 API 付费。
  • 对个人职场:流程性、判断性岗位(审核、运营、初级分析)最先感受到变化——不是被替代,而是被要求"用 AI 助手工作"。
  • 对消费市场:暂时影响不大,这类产品需要企业级集成,不会直接出现在消费者手机上。