Cohere Labs 这周在 Hugging Face 上正式开源了 North-Micro-Vision-Instruct —— 一个 24 亿参数的视觉语言模型(能同时处理图像和文字的 AI),按 Apache 2.0 协议放出,商用免费、可改可卖。当 OpenAI、Anthropic 还在拼万亿参数和闭源 API 时,有人把“小而精”路线摆上了台面认真做。

这是什么

几个关键数字:24 亿参数,其中 20 亿做语言理解、4 亿做视觉编码(把图像转成机器能处理的向量那部分)。Apache 2.0 协议意味着任何公司都可以拿去做商业产品。原生分辨率图像处理是这次的特点之一——大模型通常会把图片强行压缩到固定尺寸,这家不做这件事,保留原图比例和细节。支持的语言包括中、英、德、法、日、韩等十多种。

要注意区分:这不是又一个 ChatGPT 类聊天助手。Cohere 自己说得很清楚,这是给开发者做“二次开发底座”用的——拿它去微调(用自己数据再训练)、做成某个垂直场景里的工具,比如识别工厂零件、抽取发票信息、做文档结构化。

行业怎么看

支持者认为这是开源生态走向成熟的标志——2.4B 就能做视觉理解,意味着中小企业可以在自己的服务器甚至高端笔记本上跑出可用能力,不必被闭源 API 的价格、数据出境和隐私风险绑架。

但也有反对意见。一方面,24 亿参数在复杂推理、长上下文任务上和闭源大模型差距仍大,Cohere 自己也在文档里写明“不是推理模型、不支持 Agent 工作流(让 AI 自主调用外部工具完成多步任务)”。另一方面,有声音担忧开源小模型爆发会让模型层越来越商品化——能力不再稀缺,价值往上层应用转移,这对靠卖模型 API 赚钱的公司来说不是好消息。

值得加一句的是,中国的开源视觉模型(Qwen-VL、InternVL 等)也在走类似路线,Cohere 这步相当于在国际市场正面迎上中国玩家,竞争会更直接。

对普通人的影响

对企业 IT:可以开始评估“自建视觉 AI”是不是比接 API 更划算,特别是有数据合规要求或垂直场景的公司,多了一个选项。

对个人职场:视觉理解小模型门槛降低后,产品经理、运营、内容审核这类岗位会更快遇到 AI 协作场景,多了一个能用的工具。

对消费市场:短期内用户感受不到——这些是给开发者用的,不是消费品。但 6 到 12 个月后,更便宜的 AI 图像识别、文档抽取工具会陆续出现在你日常用的 App 里。