这是什么

得物最近发了一篇技术长文,把交易搜索的'召回'环节彻底重构。'召回'是搜索系统的第一道关:从几亿商品里挑出几百个候选,再交给排序模型精排。传统做法是'判别式'——要么匹配关键词,要么把商品和搜索词都变成向量(数字串)算相似度。得物认为这有两个绕不开的坑:用户说'空军一号'但商品标题写'af1',字面完全对不上;新上架的冷门商品没有用户行为数据,向量模型也推不准。于是换思路:用大语言模型(能理解和生成文字的 AI)给商品'生成'标签——从图片里提取'薄纱''复古'这类视觉特征,从用户评论里挖口语化表达,用相关商品的标签给稀疏商品补血,把详情页图片里'100W 快充'这类隐藏文字 OCR(识别图片中的文字)出来,再把高频搜索词作为锚点补进索引。

行业怎么看

我们注意到,这是国内一线电商团队首次系统披露'生成式召回'的完整工程链路,值得同行重点研究。但有几个值得冷静的地方:第一,文中用到的 Qwen3-32B、Qwen2.5-VL-7B(能看图说话的视觉大模型)等调用成本不低,每条商品标签要过几轮大模型推理,规模放大后费用可能是传统向量检索的几十倍;第二,'模型过滤 + 规则过滤 + 人工审核'三层防线听起来完善,但漏出率和长期维护成本文中没有披露;第三,整套方案高度依赖 Qwen 系列模型的稳定输出,版本迭代后可能需要重新校准。我们认为,更稳妥的方向或许是'判别式 + 生成式'混合架构,而非彻底替换。

对普通人的影响

对电商企业 IT:这是一份'用大模型重构搜索'的施工手册,但抄作业前要算清推理成本账,不能只看效果。

对个人职场:搜索质量提升后,运营、买手等依赖'找货'的岗位会发现长尾商品被捞上来的概率变高。

对消费市场:未来 1-2 年,主流电商平台的搜索体验会有肉眼可见的提升——尤其搜新款、小众款、搜'那件说不清叫什么但我知道长啥样'的商品。