本周 r/LocalLLaMA 一名开发者翻到一份数据:Ling-3 Tiny(参数 1-2B)在 Artificial Analysis 推理榜上的跑分高于 Qwen3.5 9B(通义千问 9B 推理版)。这事本身不大,但戳中一个结构性问题 — 我们对开源大模型的注意力,是不是被几个明星实验室垄断了?

这是什么

Ling-3 由 inclusionAI 团队开源,Tiny 版参数在 1-2B 区间,主打本地部署(即模型直接跑在自有电脑或服务器上,数据不出门)。发帖人引用 Artificial Analysis 基准测试(固定题库评分)称其推理(reasoning,模型分步思考、解决复杂问题的能力)成绩高于 Qwen3.5 9B。参数小一个量级,跑分更高 — 如果实测也能复现,意味着小模型正在逼近中等模型的推理水位,这对本地化部署的成本结构是关键变量。

行业怎么看

原帖评论区目前偏中性:多数人第一反应是「跑分不等于体感」,要下载实测再判断。这是合理的怀疑 — 基准测试是固定题库,真实使用充满长尾场景,模型可能在特定题型上被针对性优化。

更值得警惕的是反向问题:开源社区的注意力是赢家通吃的,DeepSeek、Qwen、Llama 一有动作就上热搜,而 inclusionAI 这种中型实验室即使做出好模型也容易被埋没。这不是模型质量问题,是信息分发结构的问题。换句话说,呼吁「多关注几个开源实验室」本身也已经晚了 — 注意力集中是既定事实。

商业上的现实更冷静:小模型跑分再亮眼,企业采购时仍倾向有商业支持、有合规文档、有 SLA 的明星厂商。一份 benchmark 截图很难穿透采购流程。

对普通人的影响

对企业 IT:若 Ling-3 Tiny 实测真能替代 Qwen3.5 9B,本地部署的硬件门槛和电费会再降一档,对数据敏感型业务(金融、医疗、法务)意义不小。

对个人职场:选本地 AI 工具时不必迷信明星模型,可以多看几个榜单交叉验证,避免被单一实验室的版本节奏带跑节奏。

对消费市场:端侧 AI(直接跑在手机、电脑上、不依赖云端的 AI)能力在 2026 年会进一步向小模型分流,云端订阅的必要性继续被稀释。