ARTICLE · 人工智能
美团搜索 3.0:LLM 语义表征在排序模型的探索与应用
一语总结美团搜索团队系统介绍了三期将 LLM 语义表征引入服务零售精排模型的实践,从单点可行性验证到系统性表征体系重构,再到跨场景迁移复用,并沉淀了难负样本、Prompt 简化、覆盖率修复等可迁移经验。
文章详细介绍了美团搜索团队在 2025 Q4 至 2026 Q2 期间,将 LLM 语义表征引入服务零售精排模型的三期迭代实践。一期选用轻量开源基座,新增三个特殊 Token 作为聚合锚点,通过 Attention Mask 隔离实现 Query-POI 双侧表征独立提取,以 cosine 相似度分桶注入精排,验证了可行性。二期系统性重构:训练数据扩展为五元组(含难负样本),从全参数微切换为 LoRA,从 BCE 分类目标转向 InfoNCE + Triplet 对比学习,从 MLP 降维改为 MRL-E 多尺度策略,构建 Query-POI-Deal 三元联合表征体系,并通过底层+顶层双重融合注入精排。三期将成熟表征迁移到下挂精排,重点解决了 Query 覆盖率从 81.24% 到 98.92% 的修复问题,并探索了 PEPNet 门控注入方式。最终三期累计带来服务零售订单显著正向、长尾 NDCG@5 +2.21pp 等线上收益。文章还从文本表征 Producer、表征在排序中的应用 Consumer、难负样本策略三个维度对比了业内工作,提炼了中等参数量平衡点、难负样本关键性、Prompt 做减法、覆盖率优先于模型复用、语义与统计互补五条核心洞察。
- 三期迭代从单点验证到体系化重构再到跨场景迁移,逐步构建完整语义表征体系。
一期用 64 维 cosine 相似度验证可行性,二期系统性升级为 Query-POI-Deal 三元对比学习,三期将表征迁移到下挂精排并补充全域交叉统计特征。
- 从点击率分类目标转向 InfoNCE + Triplet 对比学习是核心升级。
排序需要的是相对序关系而非绝对匹配判断,InfoNCE 利用 batch 内负样本构建对比任务,配合同请求同商家曝光未点击的难负样本和 Triplet Loss,迫使模型学习精细判别能力,Q2I-Order-AUC 提升 11.02pp。
- Embedding 场景的 Prompt 设计应做减法而非加法。
与传统 LLM 任务指令越详细越好的直觉相反,精简信息陈述+总结引导效果最优,因为 Prompt 的作用是引导模型聚合语义信息而非完成复杂任务,过多指令会干扰语义聚焦。
- 表征迁移的核心风险不在模型参数而在覆盖率。
商家精排与下挂精排的 Query 分布本质不同(商家意图词 vs 商品意图词),直接复用导致双覆盖率仅 73.61%,重新圈选样本后升至 89.81%,覆盖率缺口会直接压低特征有效性。
- 语义特征与统计特征是互补关系而非替代关系。
语义特征捕捉 Query 与商品的内容匹配,统计特征捕捉用户行为模式偏好,两者从不同角度刻画用户-商品关系,叠加效应比预期更强,三期 +0.32% 订单即为两类特征叠加结果。
美团搜索 3.0:LLM 语义表征在排序模型的探索与应用
文章详细介绍了美团搜索团队在 2025 Q4 至 2026 Q2 期间,将 LLM 语义表征引入服务零售精排模型的三期迭代实践。一期选用轻量开源基座,新增三个特殊 Token 作为聚合锚点,通过 Attention Mask 隔离实现 Query-POI 双侧表征独立提取,以 cosine 相似度分桶注入精排,验证了可行性。二期系统性重构:训练数据扩展为五元组(含难负样本),从全参数微切换为 LoRA,从 BCE 分类目标转向 InfoNCE + Triplet 对比学习,从 MLP 降维改为 MRL-E 多尺度策略,构建 Query-POI-Deal 三元联合表征体系,并通过底层+顶层双重融合注入精排。三期将成熟表征迁移到下挂精排,重点解决了 Query 覆盖率从 81.24% 到 98.92% 的修复问题,并探索了 PEPNet 门控注入方式。最终三期累计带来服务零售订单显著正向、长尾 NDCG@5 +2.21pp 等线上收益。文章还从文本表征 Producer、表征在排序中的应用 Consumer、难负样本策略三个维度对比了业内工作,提炼了中等参数量平衡点、难负样本关键性、Prompt 做减法、覆盖率优先于模型复用、语义与统计互补五条核心洞察。
文章金句
"让更匹配的商品和商家排在前面,即使用户看到的选项变少了,转化效率反而更高。
"在表征训练中,信息质量比信息量更重要。
"Embedding 质量的天花板在负例质量,不在 backbone。
"表征迁移的核心风险不在模型,而在覆盖率。
"语义特征和统计特征是互补的,不是替代的。