得物生成式召回:从向量检索到生成式范式

说明:本文技术细节主要来自得物技术团队在掘金发布的社区文章,官方文档未在审核证据中提供,具体实现与结论需以官方发布为准。文中“社区文章称”代表该文章作者的陈述,不代表官方已核验事实;“工程分析与迁移思考”为作者基于社区文章的分析,非官方事实。

一、召回范式演进与挑战

社区文章称,得物交易搜索团队过去一年的核心目标,是不再让模型只做“选择题”,而是把生成式建模引入召回,探索从“检索”到“生成”的范式跃迁。传统召回无论是倒排索引的关键词匹配,还是基于ANN的Embedding相似度计算,本质都是在给定候选集中“寻找”最相似结果。它面临三类问题:关键词受限于词汇鸿沟,例如“af1”与“空军一号”、“yeezy”与“椰子”;向量召回在长尾Query和冷启动商品上因行为稀疏而乏力;召回-粗排-精排级联存在信息漏斗,高价值商品一旦召回遗漏,后链路无法补救。

社区文章称,得物的路径并非直接跳到生成式,而是先补商品与Query表征。

二、基石构建:语义理解与表征升级

2.1 基于LLM的文本索引语义增强

社区文章称,第一层是LLM文本索引语义增强。视觉理解方面,用Qwen2.5-VL-7B-Instruct加LoRA SFT提取颜色、纹理、材质、设计细节和风格;数据构建从商品原始文本经NER与归一化得到结构化属性池,再用32B大模型清洗非视觉属性。推理后用规则初筛,再对高风险子集做二值化图文一致性判断。社区文章称,得物商品白底图让模型更聚焦商品本体。

社区语料方面,用Qwen3-4B从动态和评论中挖掘卖点、场景、痛点与趋势词;语料圈选看质量分、点赞评论,优先高信息密度内容;批量解析动态页关联的N个商品,并注入标题、话题标签、商品标题。商品关系推理方面,对长尾商品引入I2I关系图谱,用历史转化好的相似商品的标题、类目、关键属性,驱动Qwen3-32B生成拓展词。详情页OCR用DeepSeek-OCR提取,再交给Qwen3筛选、规范化。线上行为锚点则筛选高频曝光且相关性2档的Query-Item组合,把后链路验证过的Query作为已验证锚点。

社区文章称,所有标签进入独立tag_recall召回域,便于快速验证、灵活调控和可控回滚;质量由模型过滤、规则过滤、人工审核三层防线保证。

2.2 基于MLMM的多模态向量表征

社区文章称,第二层是多模态向量表征。商品图像承载形状、风格、纹理、质感与氛围,仅靠文本和行为统计对“复古棕调跑鞋”“奶油风沙发”这类长尾Query存在表征盲区。其方案分两阶段:预训练用Chinese-CLIP双塔,图像侧ViT-B/16取中层特征,文本侧RoBERTa-wwm取中层特征,编码标题及LLM增强标签,通过对比学习对齐商品图文。

召回建模采用四塔:Query侧文本编码器产出Query Embedding;商品侧有文本塔、图像塔、多模态塔,后两者通过Cross Attention融合,文本/图像特征作为KV,互补模态或查询意图作为Q,得到MM Embedding。社区文章称,训练联合优化Query与商品文本、图像、多模态向量对齐,因Query-图像跨模态对齐更难,损失权重为20:1:1。推理时用Query向量对全量商品多模态向量做ANN检索。正样本来自高相关性且曝光靠前的Q-I Pair,并逐步引入点击成交;负样本用Batch内负采样、全局随机负采样与Batch内正样本间负例共享,缓解SSB并扩大覆盖。

三、生成式召回架构探索

社区文章称,生成式召回的核心突破,是承认判别式方法有表征瓶颈与架构瓶颈。生成式建模建模P(Context,Item),推理时以用户上下文为条件自回归解码P(Item|Context),让召回从“搜寻者”变为“生产者”。社区文章称,得物围绕四层推进:HLLM深度语义表征、HSTU生成式序列建模、基于语义ID的统一生成式召回、召粗一体化。

3.1 基于HLLM的深度语义表征

社区文章称,HLLM以Qwen3-0.6B为共享基座,解耦Item LLM、Query LLM、User LLM:Item LLM编码商品并取[ITEM]隐状态;Query LLM用Prompt编码实时搜索词并取[QUERY]输出;User LLM以Next-Item Prediction为目标,输入Query表征与历史商品序列,输出动态用户表征。Item与Query共享大部分参数,User独立;训练用真实点击下一商品为正、随机采样为负,InfoNCE端到端串行联合训练。

在线推理产出用户实时兴趣表征,再到Item LLM预构建的商品向量库ANN检索;高频Query缓存,新用户或行为稀疏用户降级用按Query离线挖掘的高转化商品候选序列兜底。

3.2 基于HSTU的生成式行为序列建模

社区文章称,HSTU则把用户行为序列当作新模态。得物将搜索、推荐、社区等全场景行为编码为多类别Token流,显式包含谁、场景、时间、商品、行为、意图等信息,用Teacher Forcing学习下一个token概率;对非商品Token做损失掩码,仅对item_id预测计算损失。

社区文章称,离线实验显示HSTU在HitRate上显著优于SASRec,消融覆盖参数量、Embedding Dim和序列长度,指标随规模与序列长度上升,初步验证搜索召回也存在Scaling Law。面对千万级商品词表,采用Sampled Softmax,负采样综合流行度偏置校正、Batch内负采样和难负样本挖掘。

3.3 语义ID与统一生成式召回

社区文章称,v2引入语义ID Hash替代原始item_id:以多模态预训练商品向量为输入,经RQ-VAE编码为层级语义离散整数序列,再Hash映射为Hash ID。社区文章称其收益包括语义注入和显存释放,词表从千万级商品ID压缩至百万级Hash ID,为模型Scale-up腾出空间。社区文章在此处截断,更完整的SID与召粗一体化细节未给出。

四、工程分析与迁移思考(非官方事实)

以下为作者基于社区文章的分析,非官方事实。

这条路径对企业搜索/RAG的启示不是“立刻用生成式替换向量检索”,而是分层改造。

第一,先做索引侧语义增强,把LLM抽取、OCR、社区语料、行为锚点做成独立召回域,灰度验证和回滚成本最低;RAG可对应做文档标签扩展、多路召回融合。

第二,当图文或跨模态是核心时,再引入多模态双塔或四塔,但Query-图像对齐通常更难,需要像社区文章所述那样显式调权。

第三,生成式召回适合长尾重、冷启多、级联信息损失明显的场景;HLLM仍依赖ANN检索商品向量,工程上要准备高频Query缓存和冷启兜底;HSTU更接近自回归生成,则要解决词表压缩、语义ID、负采样和生成约束。

第四,选型上可将传统向量检索作为低延迟基线,把生成式召回作为独立第二路或融合路,先验证供给覆盖和长尾收益,再决定是否走向召粗一体化。RAG场景可借鉴其“语义ID+分层表征+意图编码”的思路,但社区文章未提供得物在RAG上的直接实践,迁移需按自身数据条件评估。

再次说明:本文基于掘金社区文章整理,未独立核验官方文档。文中涉及的产品功能、版本、参数、性能数字、政策与结论,请以得物官方发布为准。