上周 Reddit 论坛 LocalLLaMA 上的一次非正式图片识别对比,让开源 AI 社区安静不下来:同样开源、参数规模相近的 Muse Glimmer 30B 和通义千问 Qwen 3.8 27B 并排跑,结果 Qwen 在 OCR(图片内密集文字识别)和图文关系理解两个细分任务上全环节失守——读不准密集字符、丢失 caption(图注)与画面的逻辑关系,Muse Glimmer 三项全胜。
这是什么
发帖人 MacaroonDancer 自称日常工作流重度依赖图片分类。他在原帖中披露:Qwen 3.8 在密集字符 OCR 与图文语义关联这两项上,表现几乎与 3.x 早期版本如出一辙——老毛病依旧。Muse Glimmer 则在这两个细分任务上准确度明显高出一截。
需要明确的边界:这是单个开发者在自己工作流上的非正式对比,不是 MMMU、ChartQA 这类标准基准测试,样本量、提示词、量化精度都未公开,可能存在选样偏差。但它点出的方向并不孤立——过去半年关于 Qwen 在多模态(让模型同时看图和读字的能力)上短板的讨论从未停过,这次只是把伤疤撕得更大。
行业怎么看
乐观方把这解读为开源生态对闭源阵营的反扑:曾几何时闭源产品(GPT-4V、Claude 这类不对外开放权重的模型)在多模态上一家独大,如今新一代开源小模型能在细分任务上针对性反超。对企业用户的直接意义是:选择多了、与厂商谈判的筹码变重了。
但我们必须指出三种风险与反对声音。第一,单个非正式测试不足以撼动 Qwen 在中文通用任务上的整体领先位置,把它外推为"开源全面超越阿里"是夸大;第二,社区目前对 Muse Glimmer 的第三方复现、官方文档、模型卡都还很薄,今天一次胜出不能等同于明天持续领先;第三,多模态正在快速分化——OCR、看图说话、视频理解是三套不同战场,一项赢不等于全面赢。
我们认为真正值得关心的是:阿里是否会因为这类用户反馈,在 Qwen 4 路线图里重新加大多模态的投入。
对普通人的影响
对企业 IT:在合同扫描、票据识别、表格抽取这些 OCR 重负载业务里,建议小规模验证 Qwen 的实际表现,别假设"国产开源标杆"就一定开箱即用。
对个人职场:日常用 AI 读截图、整理报销票据、解析图片细节的朋友,最近可以多保留一份人工核对,OCR 在密集字符上的漏字概率比你想象的高。
对消费市场:文心一言、通义千问、豆包这些国产模型在"读图准确度"上的实际差异,比厂商宣传要大得多。未来选 AI 工具可能要按具体场景挑,不再"用谁都一样"。