这是什么
工程师 Doug Turnbull 分享了一个反直觉的分类技巧:不要让大模型(LLM)从你的现有标签里挑,而是让它先"自由发挥"生成新词——业界戏称 hallucinate(幻觉,意思是模型生成不在输入依据里的内容),再用向量嵌入(把文字转成一串数字,用于计算相似度)去找现有词库里最接近的几个。
他用家具电商举例:给模型一个查询"棕色咖啡桌",让它编出几个分类建议(比如"Furniture / Living Room Furniture / Coffee Tables"),再用这些新标签和已有的 1856 个真实标签做相似度比对,挑出最匹配的。
这套做法绕开了传统分类的两难:词表太大塞不进提示词,词表太小又覆盖不全。
行业怎么看
我们注意到,把这条分享出来的是 Simon Willison——英文圈最有影响力的 AI 实操博主之一,他把它放到博客显眼位置,本身就是一种背书。
更值得关心的是背后的思路:把"大模型擅长的事"和"你要它遵守的约束"分开处理。LLM 负责天马行空,向量检索负责拉回现实。这与过去两年业界力推的 RAG(Retrieval-Augmented Generation,先检索相关文档、再让模型基于检索结果回答)模式一脉相承。
但也有反对声音。搜索工程师社区指出,向量匹配本身有误差,对边角品类和新奇特商品容易匹配错。更大的隐患是:如果你的现有标签库本身就有冗余和错误,AI 再怎么"幻觉",错的还是错的——这套方法优化了流程,没优化源头。
对普通人的影响
- 对企业 IT:有商品库、内容库、文档库的中小企业,可以参考这个思路做低成本标签整理,不必立刻上专业分类系统。
- 对个人职场:做内容运营、电商运营的人值得记住这种"AI 出草稿、向量做校验"的人机分工模板。
- 对消费市场:电商搜索和推荐可能因此更准,但也可能偶尔出现"明明搜的是咖啡桌,推荐的是边几"的偏差,购物时多看一眼分类树。