一个 4.5 亿参数的小模型,在 5 万张浏览器截图上微调后,屏幕理解准确率从 1% 跳到 44%。这是本周 Reddit r/LocalLLaMA 开发者 u/ButtercupLyn100 公布的实验。我们注意到:这个 44 倍的提升说明,Agent 落地的瓶颈可能不在模型大小,而在有没有针对真实界面做专项训练。

这是什么

这位开发者用的是一个仅 4.5 亿参数的视觉语言模型(VLM,简单说就是能同时看图和读文字的 AI),在 5 万张浏览器截图上微调。屏幕问答准确率从 1%(接近瞎猜)拉到 44%。他用的不是 700 亿、1750 亿参数的「巨无霸」,而是一个小模型——这条路如果跑通,意味着屏幕理解可能不需要那么大的算力。

行业怎么看

我们注意到,这件事给「Computer Use」赛道(让 AI 像人一样操作电脑)提供了一个低成本思路。Anthropic 的 Computer Use、OpenAI 的 Operator 都靠大模型硬扛,推理成本高;垂直微调小模型,部署成本可能低一两个数量级。

但风险也明显:44% 离能上线还差得远,企业真实场景 95% 以上才是入门线,否则每三步就错一步。浏览器界面千变万化,CSS 改动、A/B 实验都可能导致性能雪崩,泛化能力才是真正考验。也有研究者提醒:单项 44% 不等于整套操作能完成,从「看懂屏幕」到「会点击、会填写」,中间还有执行层、规划层几道坎。

对普通人的影响

  • 对企业 IT:屏幕理解 Agent 的部署成本可能比想象低,中小企业不用再等大厂 API。
  • 对个人职场:RPA(让软件自动操作软件的工具)类岗位的入门门槛会降低,但天花板仍在「复杂决策」——AI 能干的越多,能拍板的人越值钱。
  • 对消费市场:浏览器自动化工具会更便宜,但用户截图被拿去训练,隐私和数据合规问题会更突出。