一个 Java 前同事被公司逼着转做 Agent(让 AI 自主完成任务的应用形态),第一个问题就问「哪个大模型最强」 — 这恰恰是当下中国 AI 工程落地最常见的误判。掘金一篇工程笔记把这事拆得很干脆:先看模型在系统里干什么活,再谈参数和分数。

这是什么

我们注意到,这篇笔记的核心是把「大模型」从模糊的崇拜里拉出来,按两个维度分类。 一是「模态」(modality),即模型能接收和输出什么信息形式 — 文字、图片、音频、视频各算一种。多模态不等于「什么都行」,要看输入和输出分别支持什么。 二是「功能」,即模型在 Agent 系统里的角色,归成四类:
  • 生成模型:理解、推理、产出答案,扮演「大脑」。
  • Embedding 模型:把文档转成数字向量(让机器能比较语义远近),用于从海量资料快速召回候选片段。
  • Rerank 模型:对初筛结果精排,从「可能相关」筛到「确实相关」。
  • 分类模型:判断意图、风险等级,做内容路由。
笔记里有一个我们认为重要的判断:工具调用是模型生成参数,真正执行的是应用代码 — 权限、超时、重试都是系统层的事。这揭穿了「模型能调工具就是 Agent」的幻觉。

行业怎么看

主流叙事默认「模型越强,Agent 越能落地」,大家都在追旗舰 benchmark。 这篇笔记代表的是工程派反向意见:把生成、检索、排序拆给不同模型,整体成本更低、响应更快、效果更稳。这和近两年 RAG 架构(让 AI 先查资料再回答)在企业逐渐取代「全部塞进上下文」的做法,是同一条线。 但风险不能不提。多模型部署意味着四套运维、四份监控、版本对齐成本上升。Embedding 向量维度(BGE-M3 是 1024 维,BGE Small 是 384 维)也不是越高越好,存得下、算得快才是工程现实。用了多家供应商的模型,切换成本和数据合规风险同步上升,对中小公司而言不一定是减负。

对普通人的影响

  • 对企业 IT:我们建议采购 AI 别只盯榜单分数,先把任务拆清楚。同一笔预算花在「一个超大模型干所有事」,往往不如花在「四个便宜模型各管一摊」。
  • 对个人职场:未来调用 AI 会按场景分流 — 写报告和查公司制度,调的可能不是同一套系统。理解这层分工的人更值钱。
  • 对消费市场:「全能 AI」短期不会来。可见的趋势是各产品更专注:客服 AI 更准、搜索 AI 更快、写作 AI 更长 — 因为背后是不同模型各干各的。