Generative Retrieval
PulseAugur coverage of Generative Retrieval — every cluster mentioning Generative Retrieval across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
CHAP框架通过分层对齐增强个性化生成检索
研究人员推出了一种新颖的个性化生成检索框架CHAP,该框架解决了当前系统的局限性。CHAP利用分层语义对齐模块,跨多个粒度更好地匹配动态查询意图与静态项目表示。它还结合了用户行为建模和残差级联生成机制,以提高推理速度并减少信息丢失。在公共和专有数据集上的实验,包括在线A/B测试,都证明了CHAP的有效性和实际价值。
-
新的HF-SID方法增强了基于位置服务的生成检索
研究人员推出了一种新方法HF-SID,用于在基于位置服务的生成检索中生成语义ID(SID)。现有的SID难以保留对准确检索至关重要的细粒度细节,例如地理坐标的连续性、数值属性的变化尺度以及层级归属。HF-SID通过将坐标转换为连续的3D笛卡尔形式,并将数值编码为单个单元,并辅以具有类型感知嵌入的Geo-CPT和Num-CPT来解决这些限制。基于结构的对比学习目标进一步优化了这些表示,从而实现了3个标记的SID,且没有额外的解码成本。
-
电子商务搜索因新的生成检索研究而得到提升 · 跟踪 4 个来源
arXiv 上发表的四篇研究论文提出了电子商务搜索中生成检索的新方法。这些方法旨在通过联合训练嵌入模型和码本、整合产品集群信息以及优化相关性指标来提高产品搜索的准确性和用户参与度。提出的框架解决了诸如误差累积、嘈杂的用户参与信号以及需要更好的查询意图一致性等问题,其中一些框架在生产环境中展示了检索指标和业务成果的显著改进。
-
PRQ-KMeans 增强了用于AI检索和推荐的语义ID分词
研究人员推出了一种新颖的语义ID分词方法PRQ-KMeans,该方法改进了生成式检索和推荐系统中实体的表示。该技术通过优化质心更新和采用投影残差,解决了现有残差量化分词器的局限性。实验表明,PRQ-KMeans表现优越,在工业搜索和公共推荐数据集上均取得了HitRate和MRR的显著提升。
-
UniGD框架统一生成-判别模型用于工业搜索广告
研究人员开发了UniGD,一个统一生成和判别模型用于工业搜索广告的新框架。该方法旨在克服当前将这些模型分开级联的系统的局限性,这些系统会导致性能不佳和成本增加。UniGD将检索和相关性评分整合到一个模型中,采用冲突感知梯度增强(CAGE)等技术来管理冲突目标,并使用代码本锚定表示模块(CAM)来获得更丰富的语义理解。在快手平台上进行的在线A/B测试表明,广告收入增加了5.78%,推理延迟降低了33%,同时在NQ320K和MS300K等…
-
新的CRID方法增强生成式检索,提升电商GMV
研究人员开发了一种名为集群排序标识符(CRID)的新方法来改进生成式检索系统。CRID将文档标识符解耦为语义聚类和商业价值排名,这有助于避免冲突并将标识符的目标与业务目标对齐。在大型电子商务数据集上的实验表明,CRID的性能优于现有的基于嵌入的检索方法,并在全流量部署期间使商品交易总额(GMV)提高了1.06%。
-
新研究解决了生成式检索和多模态RAG中的失败问题
两篇新研究论文探讨了生成式检索(GR)和检索增强生成(RAG)系统的进展。第一篇论文介绍了一种GR失败模式的分类法和一个用于分析基于n-gram的方法(如SEAL和MINDER)的工具,识别出诸如模糊文档ID和低标识符多样性等问题。第二篇论文提出了UniversalRAG,一个旨在从跨越多种模态和粒度的异构源检索和整合知识的框架,解决了纯文本RAG的局限性,并提出了模态感知路由来克服“模态鸿沟”。
-
ThinkGR框架通过思维链推理增强生成式检索
研究人员开发了ThinkGR,一个将思维链(CoT)推理整合到生成式检索系统中的新颖框架。该方法允许在单一生成过程中进行迭代思考和文档识别,解决了处理复杂、多步查询的局限性。ThinkGR采用混合解码策略和两阶段训练方法,以连接自由形式的思维生成与结构化检索目标。实验表明,ThinkGR在四个多跳检索基准测试中取得了最先进的成果,平均性能提高了6.86%。