MS MARCO
PulseAugur coverage of MS MARCO — every cluster mentioning MS MARCO across labs, papers, and developer communities, ranked by signal.
8 天有情绪数据
-
新的俄罗斯套娃哈希表示提高了RAG检索效率
研究人员开发了俄罗斯套娃哈希表示(MHR),这是一种用于检索增强生成(RAG)系统中紧凑语义检索的新颖方法。MHR通过一个将全宽度训练与前缀组织分开的两阶段过程来解决存储大型向量索引的挑战。这使得在各种字节预算下都能进行高效检索,而无需重新编码整个语料库,并在MS MARCO和BEIR等数据集上显示出改进的性能。
-
新的“Embedding Surgery”技术增强了密集检索系统
研究人员开发了一种名为“embedding surgery”的新技术,以提高密集检索系统的性能。该方法允许在查询时对文档嵌入进行局部、最小的更新,并由各种形式的反馈指导。该方法被表述为一个凸优化问题,以强制执行排序约束,同时最小化对嵌入的更改。在多个基准测试上的实验表明,即使存在噪声反馈,排序指标也得到了显著改进,并且这些更新可以高效地应用,而无需进行昂贵的索引重建。
-
新的TRIS防御系统对抗RAG模型的知识投毒
研究人员开发了TRIS(Tri-Layer Retrieval Integrity Sieve,三层检索完整性筛查器),以对抗检索增强生成(RAG)系统中的知识投毒。该中间件防御系统通过采用跨嵌入空间聚类、结构过滤和LLM一致性验证来净化检索到的证据。TRIS显著降低了包括黑盒和白盒投毒方法在内的各种攻击的成功率,同时恢复了RAG模型的干净准确性。
-
监督微调对大型语言模型指令敏感性的影响因模型规模而异
一篇新发表在arXiv上的研究调查了监督微调(SFT)如何影响大型语言模型的指令敏感性。研究人员发现,SFT在Qwen3(1.7B和4B参数)等较小模型中会持续降低指令敏感性,从而在不同的指令表述下都能提高性能。然而,对于Qwen3-8B和Gemma-2-9B等较大的模型,SFT对敏感性的影响不太明显,并且可能有所不同,一些模型显示出持续的方向性对比,而另一些则不然。研究还强调,评估方法的选择,例如自由生成与强制选择,可能导致关于模型…
-
新的土耳其 LLM MoganBert-TR 使用 CLM-to-MLM 课程训练
研究人员开发了 MoganBert-TR,一个新的土耳其编码器基础模型,以及配套的嵌入模型 MoganBert-Embed。MoganBert-TR 使用新颖的 CLM-to-MLM 课程,在过滤后的土耳其语语料库上从头开始训练,与传统的 MLM 方法相比,在检索任务上表现出显著的改进。该模型在 TrGLUE 和 TabiBench 等基准测试中取得了最先进的成果,而 MoganBert-Embed 在嵌入性能方面表现出色,尽管规模较…
-
新的 arXiv 论文探讨了密集检索中的隐私、效率和大语言模型集成
四篇新的 arXiv 论文探讨了密集检索的进展,密集检索是大语言模型在信息检索任务中的关键组成部分。第一篇论文介绍了一种使用学习到的深度哈希进行隐私保护的方法,以有效地过滤候选文档,在保持检索质量的同时降低计算成本。另一篇论文提出了 AnchorQE,一种无需训练的方法,通过优化生成的查询扩展与原始查询的集成方式来改进密集检索。第三篇论文 LLM-QL,通过将查询似然最大化作为辅助任务来利用大语言模型,以增强检索器的性能。最后,Ada…
-
向量数据库准入控制应对工作负载漂移下的检索热点
研究人员开发了一种新的向量数据库准入控制机制,以减轻检索热点(单个文档主导搜索结果)的影响。该系统维护一组哨兵查询,确保文档仅在与这些哨兵的相似度低于预定阈值时才被接纳。研究表明,虽然这种方法会产生辅助索引的维护成本,但即使在工作负载漂移下也能有效控制文档的暴露度,这在真实数据集上得到了验证,并已在PostgreSQL/pgvector中实现。
-
新研究探讨静态剪枝和基于LLM的查询扩展在检索系统中的应用
两篇新研究论文探讨了改进信息检索系统的方法。第一篇论文《稀疏检索机制下的静态剪枝》研究了静态剪枝技术如何在不同检索引擎中应用,发现索引端剪枝能持续降低延迟和索引大小,而查询剪枝常被现代系统内化。第二篇论文《Dense Expands, Sparse Anchors》介绍了DESA,一种通道非对称查询扩展方法,它使用LLM生成互补的段落,提高了检索效果并降低了混合检索系统的访问深度。
-
七种向量数据库性能基准测试
一篇新的研究论文对包括 FAISS、Qdrant、Milvus、Weaviate、Chroma、pgvector 和 LanceDB 在内的七种主流向量数据库系统进行了全面的实证评估。该研究分析了六个不同数据集上的超过 400 万个向量,衡量了检索质量、查询延迟、吞吐量和资源利用率。主要发现表明,FAISS 提供了最高的单节点吞吐量,Weaviate 提供了出色的召回率,Qdrant 在完整数据库中提供了最佳延迟,而 LanceDB …
-
新研究评估用于科学问答的RAG流程 · 已追踪2个来源
研究人员推出了SciRet,一项使用CORD-19数据集研究用于科学问答的检索增强生成(RAG)的研究。该研究评估了一个固定的RAG流程在三种不同语料库规模下的表现,发现混合检索方法比仅稀疏或仅密集的方法更具鲁棒性。然而,在MS MARCO上训练的交叉编码器重排序器在科学语料库上降低了精度,表明可能存在领域不匹配问题。使用RAGAS测量的生成答案的忠实度随着语料库规模的增大而提高。
-
PLAID-PRF 使用质心感知伪相关反馈增强密集检索
研究人员推出了一种用于增强 ColBERT 等多向量密集检索模型的新方法 PLAID-PRF。该技术利用 PLAID 框架内的质心类令牌来执行伪相关反馈 (PRF),根据检索到的顶部结果有效地重构查询向量。PLAID-PRF 利用内部 PLAID 质心向量,保持了较低的计算成本,在 MS MARCO 和 BEIR 等各种基准测试中显示出检索效率的显著提高。
-
新的基准测试评估葡萄牙语文本嵌入模型,揭示性能差距
发布了两个新的基准测试 MTEB-PT 和 MTEB-PT(巴西葡萄牙语),专门用于评估葡萄牙语的文本嵌入模型。这些基准测试解决了现有评估中葡萄牙语代表性不足的问题,而现有评估通常依赖于翻译的数据集或多语言平均值。新的基准测试包含大量葡萄牙语原生任务,涵盖语义文本相似性、分类、检索和重新排序等多个类别。初步评估表明,模型性能高度依赖于任务,并且在多语言基准测试上的排名并不能可靠地预测葡萄牙语特定性能,这凸显了进行原生语言评估的必要性。
-
新的 RAG 研究增强了 LLM 的检索、遗忘和忠实性
多篇研究论文正在探索检索增强生成 (RAG) 的进展,以提高大型语言模型的性能和效率。Apple 的 CLaRa 框架在连续潜在空间中统一了检索和生成,以实现更好的压缩和端到端优化。其他研究侧重于 RAG 的机器学习遗忘,以删除敏感信息;RAG 的测试时适应,以处理领域转移;以及基于图的匹配,以改进多跳推理。此外,还在开发量化检索器-生成器对齐和抑制模型内部知识的方法,以增强 RAG 系统的忠实性。
-
新方法增强了密集嵌入排序器的可解释性
研究人员开发了一种名为ChunkGroupSHAP的新方法,以提高信息检索中使用的密集嵌入排序器的可解释性。该技术跨文档对语义相关的文本块进行聚类以创建共享特征,解决了词级别解释与密集表示之间的不匹配问题。在MS MARCO和FinQA等数据集上的实验表明,最佳解释粒度取决于排序器和语料库,这表明需要与表示粒度和语料库结构都保持一致的特征单元。
-
GPUSparse系统利用GPU并行化加速学习稀疏检索
研究人员开发了GPUSparse,一个旨在通过利用GPU并行化来加速学习稀疏检索模型的新系统。该系统解决了当前稀疏检索方法中存在的CPU瓶颈问题,该问题阻碍了实时性能。GPUSparse引入了GPU并行倒排索引、批处理的scatter-add评分算法以及融合的Triton内核,在保持高检索质量的同时实现了显著的加速。
-
TileMaxSim内核将GPU检索模型速度提升220倍
研究人员开发了TileMaxSim,这是一种新的面向IO的GPU内核,旨在显著加速多向量检索模型(如ColBERT)中使用的MaxSim评分过程。现有实现效率低下,仅利用了可用GPU带宽的一小部分。TileMaxSim通过采用多查询SRAM分块、维度分块和融合乘积量化评分来解决此问题,在NVIDIA H100 GPU上实现了高达80.2%的峰值HBM带宽。这带来了显著的速度提升,能够实现每秒对8200万份文档进行评分,并大大降低了检索任务的延迟。
-
AI代理因搜索索引分布缺陷而失败,而非提示问题
AI代理中一个常见的问题是,由于底层搜索索引的问题,其搜索结果表面上看起来正确,但却导致事实性错误答案。这不是一个提示问题,而是一个分布问题,索引本身是一组冻结的过往相关性判断,而不是语义真相的体现。像BEIR和MTEB这样的标准检索基准可能会加剧这个问题,它们奖励检索与历史相关性匹配的文档,即使代理错误地解释了它们,导致基准测试得分高但实际查询表现不佳。
-
新的索引框架SPI提升向量数据库中RAG的性能
研究人员推出了一种名为语义金字塔索引(SPI)的新型向量数据库索引框架,旨在增强检索增强生成(RAG)管道。SPI根据查询的复杂性和语义粒度自适应检索深度,将嵌入组织成多个分辨率级别。这种方法允许在不进行完全索引重建的情况下高效地流式插入新向量,并支持渐进式的粗粒度到细粒度搜索。
-
新研究解决全双工对话系统中的噪声和效率问题
两篇新研究论文探讨了全双工语音对话系统的进展,该系统允许同时进行听和说。一篇论文介绍了抗干扰自适应融合(IRAF),通过动态调整音频流的贡献来提高对背景噪声和干扰说话者的鲁棒性。另一篇论文提出了一种使用语义语音活动检测的LLM增强对话管理器,以高效处理轮流和减少计算负载。
-
新的ECI方法无需训练即可对密集检索的难例负样本进行排名
研究人员开发了一种新的无需训练的方法,称为有效对比信息(ECI),用于评估密集检索系统的难例负样本来源。该技术使用冻结的嵌入来对候选负样本进行排名,绕过了微调和下游评估的需要。ECI在MS MARCO和BEIR等基准测试中表现强劲,能有效地为检索模型识别最佳负样本来源。