MS MARCO
PulseAugur coverage of MS MARCO — every cluster mentioning MS MARCO across labs, papers, and developer communities, ranked by signal.
5 天有情绪数据
-
新的基准测试评估葡萄牙语文本嵌入模型,揭示性能差距
发布了两个新的基准测试 MTEB-PT 和 MTEB-PT(巴西葡萄牙语),专门用于评估葡萄牙语的文本嵌入模型。这些基准测试解决了现有评估中葡萄牙语代表性不足的问题,而现有评估通常依赖于翻译的数据集或多语言平均值。新的基准测试包含大量葡萄牙语原生任务,涵盖语义文本相似性、分类、检索和重新排序等多个类别。初步评估表明,模型性能高度依赖于任务,并且在多语言基准测试上的排名并不能可靠地预测葡萄牙语特定性能,这凸显了进行原生语言评估的必要性。
-
新的 RAG 研究增强了 LLM 的检索、遗忘和忠实性
多篇研究论文正在探索检索增强生成 (RAG) 的进展,以提高大型语言模型的性能和效率。Apple 的 CLaRa 框架在连续潜在空间中统一了检索和生成,以实现更好的压缩和端到端优化。其他研究侧重于 RAG 的机器学习遗忘,以删除敏感信息;RAG 的测试时适应,以处理领域转移;以及基于图的匹配,以改进多跳推理。此外,还在开发量化检索器-生成器对齐和抑制模型内部知识的方法,以增强 RAG 系统的忠实性。
-
新方法增强了密集嵌入排序器的可解释性
研究人员开发了一种名为ChunkGroupSHAP的新方法,以提高信息检索中使用的密集嵌入排序器的可解释性。该技术跨文档对语义相关的文本块进行聚类以创建共享特征,解决了词级别解释与密集表示之间的不匹配问题。在MS MARCO和FinQA等数据集上的实验表明,最佳解释粒度取决于排序器和语料库,这表明需要与表示粒度和语料库结构都保持一致的特征单元。
-
GPUSparse系统利用GPU并行化加速学习稀疏检索
研究人员开发了GPUSparse,一个旨在通过利用GPU并行化来加速学习稀疏检索模型的新系统。该系统解决了当前稀疏检索方法中存在的CPU瓶颈问题,该问题阻碍了实时性能。GPUSparse引入了GPU并行倒排索引、批处理的scatter-add评分算法以及融合的Triton内核,在保持高检索质量的同时实现了显著的加速。
-
TileMaxSim内核将GPU检索模型速度提升220倍
研究人员开发了TileMaxSim,这是一种新的面向IO的GPU内核,旨在显著加速多向量检索模型(如ColBERT)中使用的MaxSim评分过程。现有实现效率低下,仅利用了可用GPU带宽的一小部分。TileMaxSim通过采用多查询SRAM分块、维度分块和融合乘积量化评分来解决此问题,在NVIDIA H100 GPU上实现了高达80.2%的峰值HBM带宽。这带来了显著的速度提升,能够实现每秒对8200万份文档进行评分,并大大降低了检索任务的延迟。
-
AI代理因搜索索引分布缺陷而失败,而非提示问题
AI代理中一个常见的问题是,由于底层搜索索引的问题,其搜索结果表面上看起来正确,但却导致事实性错误答案。这不是一个提示问题,而是一个分布问题,索引本身是一组冻结的过往相关性判断,而不是语义真相的体现。像BEIR和MTEB这样的标准检索基准可能会加剧这个问题,它们奖励检索与历史相关性匹配的文档,即使代理错误地解释了它们,导致基准测试得分高但实际查询表现不佳。
-
新的索引框架SPI提升向量数据库中RAG的性能
研究人员推出了一种名为语义金字塔索引(SPI)的新型向量数据库索引框架,旨在增强检索增强生成(RAG)管道。SPI根据查询的复杂性和语义粒度自适应检索深度,将嵌入组织成多个分辨率级别。这种方法允许在不进行完全索引重建的情况下高效地流式插入新向量,并支持渐进式的粗粒度到细粒度搜索。
-
新研究解决全双工对话系统中的噪声和效率问题
两篇新研究论文探讨了全双工语音对话系统的进展,该系统允许同时进行听和说。一篇论文介绍了抗干扰自适应融合(IRAF),通过动态调整音频流的贡献来提高对背景噪声和干扰说话者的鲁棒性。另一篇论文提出了一种使用语义语音活动检测的LLM增强对话管理器,以高效处理轮流和减少计算负载。
-
新的ECI方法无需训练即可对密集检索的难例负样本进行排名
研究人员开发了一种新的无需训练的方法,称为有效对比信息(ECI),用于评估密集检索系统的难例负样本来源。该技术使用冻结的嵌入来对候选负样本进行排名,绕过了微调和下游评估的需要。ECI在MS MARCO和BEIR等基准测试中表现强劲,能有效地为检索模型识别最佳负样本来源。
-
网络搜索查询显示18%的地理空间焦点,超出GIS能力
研究人员分析了超过一百万个网络搜索查询,发现其中近18%与地理空间信息相关。这一比例远高于之前的估计。该研究对这些查询进行了分类,显示成本、营业时间、联系方式等实际需求占主导地位,而这些需求通常超出了传统地理信息系统(GIS)和知识图谱的能力范围。研究结果表明需要混合检索系统,并强调了当前大型语言模型地理推理基准的局限性。
-
SilentRetrieval 攻击通过投毒文档劫持 RAG 系统
研究人员开发了“SilentRetrieval”,这是一种旨在破坏检索增强生成 (RAG) 系统的新型两阶段攻击。该方法使用对抗性数据投毒注入经过处理的文档,这些文档在语义上得以保留且流畅,使其难以检测。该攻击在劫持各种基准测试和 LLM 的 RAG 输出方面取得了很高的成功率,即使在低投毒率下也是如此,尽管防御措施会以牺牲延迟为代价来减轻其有效性。
-
新的SCI-Defense框架对抗LLM排名操纵攻击
研究人员开发了SCI-Defense,一个旨在对抗针对基于LLM的排名系统的操纵攻击的新型框架。这些被称为生成式引擎优化(GEO)的攻击,涉及对手将误导性信号注入产品描述中以人为地提高其排名。SCI-Defense集成了困惑度检测、语义完整性评分和候选间检测,以识别和阻止这些操纵。在亚马逊产品描述和MS MARCO网页上的评估表明,SCI-Defense在对抗各种攻击类型方面具有高精度和高召回率,优于现有的防御机制。
-
新的逐层令牌压缩技术提升文档重排速度
研究人员开发了一种名为逐层令牌压缩(LTC)的新方法,以提高信息检索中使用的基于Transformer的文档重排模型的效率。与仅应用于初始嵌入层的先前令牌压缩技术不同,LTC在中间Transformer层调整令牌池化。这种方法在速度上显示出显著提升,将passage ranking的每秒推理查询数提高了高达25%,将document ranking的每秒推理查询数提高了116%,同时保持了重排质量。该方法也适用于长上下文列表式重排,甚…
-
大型语言模型为神经排序模型的新型对抗性攻击提供动力
研究人员开发了一个名为 CRAFT 的新框架,用于攻击信息检索中使用的神经排序模型。该框架利用大型语言模型生成对抗性内容,然后用于微调和优化排序模型。实验表明,CRAFT 在各种排序架构中显著提高了对抗性推广率和排名提升效果,凸显了现实世界检索系统的潜在漏洞。
-
研究人员提出参数化记忆头以改进生成检索模型
研究人员开发了一种名为后适应记忆调优(PAMT)的新方法,以应对生成信息检索模型中灾难性遗忘的挑战。PAMT引入了一个模块化的参数化记忆头,可以在不改变现有模型核心参数的情况下对其进行增强。该记忆头在解码过程中允许稀疏查询和残差校正,指导文档标识符的生成,同时保留来自先前文档集的知识。实验表明,PAMT在对新文档性能影响极小的情况下,显著提高了对旧信息的保留能力。
-
Rabtriever模型高效检索理由,降低LLM计算成本
研究人员开发了一种新颖的方法Rabtriever,以提高基于理由的信息检索的效率。该方法采用生成式重排器的策略内蒸馏,灵感来自联合嵌入预测架构(JEPA)。Rabtriever通过将传统方法的二次复杂度优化为线性复杂度,显著降低了计算成本,同时在各种检索任务上保持了可比的准确性。