英伟达开源了视觉模型 LocateAnything,3B 参数、单卡可跑。它把目标检测、指代定位、文字检测、界面定位、点定位五类任务合并到一个模型——以前要拼凑五套系统,现在一个 API。
这是什么
LocateAnything 只做一件事:定位,分五种方式——检测框(框出目标)、指代定位(描述中的目标)、文字检测(图里的字)、界面定位(按钮图标)、点定位(中心坐标)。
技术上最值得说的是「平行框解码」(PBD)。传统做法把一个框拆成 x1、y1、x2、y2 四个数字逐个写,中间任一出错框就歪。LocateAnything 把四个数字并行生成,几何关系不被打散,速度成倍提升。出错就回退到逐字模式重写这一框,再切回并行。
模型本体:MoonViT-SO-400M 视觉编码器(图像理解模块)加 Qwen2.5-3B 语言解码器,3B 规模意味着单卡部署。训练数据 1200 万张图、1.38 亿条查询、7.85 亿个标注框。
行业怎么看
正方:LocateAnything 验证了「小而专」的可行性。主流叙事是「越大越强」,但部署成本高、需要多卡集群,把中小公司挡在门外。一个 3B 模型覆盖五类任务、单卡可跑,视觉 AI 落地门槛大幅降低——从「有没有」变成「要不要」的问题。
另一种声音值得警惕:它本质是把语言模型能力迁移到坐标输出,精度天花板受限于 3B 规模。密集场景小框误差可能累积;自动驾驶、医疗影像这类要求像素级准确的场景,未必能替代专用检测器。开源项目多,但生产环境稳定性、版本维护、文档支持是另一回事——「跑得通」和「跑得稳」之间还有距离。
对普通人的影响
对企业 IT:以前要买多套视觉检测服务、拼凑多个模型,现在可能只需一个 3B 模型加一张卡。中小公司第一次能自建视觉能力,不必依赖云厂商或大模型 API。
对个人职场:图像标注、质检、UI 测试相关岗位,工作流会变——从「画框导出比对」转向「写描述让 AI 标」。但短期需求不会消失,只是从操作转向审核。
对消费市场:手机、扫地机器人、智能家居的「看图能力」会更快普及。3B 模型能跑在端侧,设备不必每次联网请求云端,响应更及时、隐私更有保障。