Liquid AI 这周发布的 LFM2.5-VL-3B 只有 3.1B 参数、约 2GB 大小,已经能在 iPhone 17 上本地跑通——但更值得我们说的是另一组数:它在 ScreenSpot-v2 桌面测试里从上一代的 6 分跳到了 78.7 分。

这是什么

Liquid AI 是 MIT 背景的美国创业公司,专做高效小模型。LFM2.5-VL-3B 是个视觉-语言模型(VL = Vision-Language,能看图也能读文字),参数只有 31 亿,权重约 2GB,能装进普通手机内存里独立运行,不依赖云端。

和上一代相比,关键提升不在"能不能认出图里是什么",而在"能不能指出在哪"。原帖作者的测试是:拿一张 Minecraft 里 Steve 的玩具照片问它,模型没有只回答"这是 Steve",而是逐部位描述了 Steve 的样子——这正是定位能力(localization)变强的表现。代价是推理时间 2 分 31 秒,在手机上仍然偏慢。

行业怎么看

乐观的一方认为这代表清晰趋势:模型够小、能在本地跑,意味着敏感图片(产线、文档、客户现场)不用上传也能完成视觉分析,对制造、医疗、政务场景是直接利好。

但也有声音指出三个问题——其一,2 分多钟的等待时间在手机端基本不可用,距离"生产可用"还很远;其二,云端大模型(GPT-4V、Gemini、Qwen-VL)的视觉能力仍然领先,本地小模型到底是"够用就好"还是"被甩开",行业没有共识;其三,原帖作者本人就是运行该模型的 App 创始人,测试结论存在利益相关。

对普通人的影响

对企业 IT:数据敏感行业(制造质检、零售巡店、医疗影像初筛)可以开始评估本地视觉方案,图片不出厂、不上云就能完成识别,是这一波端侧(device-side,即在终端设备上本地运行)模型最直接的落地场景。

对个人职场:短期不会改变日常办公——没人愿意等 2 分钟出一段描述。如果未来能把推理压到 10 秒内,本地视觉助手会成为出差、现场拜访时的实用工具。

对消费市场:会逐步出现在拍照识物、文档扫描类 App 里,但"能跑"不等于"好用",普通用户的体感短期仍不明显。