BM25
PulseAugur coverage of BM25 — every cluster mentioning BM25 across labs, papers, and developer communities, ranked by signal.
- used by reciprocal rank fusion 90%
- uses reciprocal rank fusion 70%
- uses LLM 70%
- used by Faiss 70%
- used by chromadb 70%
- used by Beir 70%
- uses pgvector 70%
- uses Faiss 70%
- instance of Beir 70%
- competes with Splade 70%
- competes with Dense Passage Retrieval for Open-Domain Question Answering 70%
- used by DeepDoc 70%
22 天有情绪数据
-
新诊断工具JuryProbe识别大型语言模型事实核查小组的风险
研究人员开发了JuryProbe,一种旨在识别依赖多个大型语言模型(LLM)判断的事实核查系统中风险的新诊断工具。该工具旨在检测隐藏的危险,即判断者之间的协议可能源于共同的盲点而非独立验证。JuryProbe使用校准探针来估计共识风险,特别关注假阴性。当检测到高风险场景时,系统会将声明引导给能够使用可信参考进行验证的判断者,从而提高准确性并减少不必要的参考检查。
-
新方法解决临床LLM推理中的“中间迷失”效应
研究人员发现,将大型语言模型应用于临床长上下文推理存在一个重大挑战,特别是“中间迷失”(LitM)效应,即长文档中间的信息检索可靠性较低。该问题被称为临床中间迷失(CLitM)问题,并使用MedAlign数据集进行了系统表征。提出了一种名为查询条件临床抑制(QCCS)的新方法作为解决方案,在预测电子健康记录处理的指令遵循准确性方面,其性能优于传统的检索方法和全上下文处理。
-
新的元服务器简化了数千个 MCP 工具的发现并增强了安全性
作者开发了 mcp-anything,一个旨在解决 MCP(Meta-Command Protocol)生态系统内发现问题的元服务器。这个新服务器允许用户搜索数万个 MCP 服务器,克服了手动查找和配置单个服务器的流程。mcp-anything 不再需要用户管理大量服务器,而是提供了五个元工具来搜索、描述和调用其他 MCP 服务器,同时还优先考虑了 SSRF 防护和防止任意代码执行等安全功能。
-
RAG系统通过纠正性检索和仔细分块得到改进 · 跟踪4个来源
检索增强生成(RAG)系统可能因检索相关信息不佳而失败,即使生成模型本身是可靠的。像纠正性RAG(CRAG)这样的技术引入了一个评估步骤,以评估检索到的文档并触发纠正措施,例如重新检索或知识细化,以提高答案质量。开发者还必须仔细考虑分块策略,因为固定大小的块可能导致不完整或误导性的上下文,而较大的块可能会稀释语义含义。一个全面的RAG生命周期清单涵盖了文档管理、嵌入、检索、推理、提示、请求处理、缓存、评估和生产部署,以构建健壮的系统。
-
新框架提升企业金融领域LLM的可审计性
提出了一种名为知识驱动分析框架(KDAF)的新框架,用于增强企业金融领域大型语言模型(LLM)的可信度。该框架侧重于信息的可审计性和可追溯性,这对于受监管的金融工作流程至关重要。评估表明,虽然KDAF在答案准确性方面并未显著优于BM25等传统方法,但它在引用可追溯性和为检索到的事实提供完整出处链方面表现出色。
-
RAG 模式通过动态检索路由增强代理
本文介绍了一种用于检索增强生成(RAG)系统的动态检索路由模式,特别适用于代理式应用。与执行单一检索步骤的传统 RAG 不同,该模式将检索集成到代理的决策循环中,允许进行多次、特定策略的检索调用。所提出的架构包括一个检索路由器,该路由器对查询进行分类,以选择最佳检索方法,例如向量搜索、BM25 关键字匹配、网络搜索或混合方法。这种动态方法使代理能够优化其查询、在任务中途切换检索策略,并仅在需要时有条件地检索信息,从而提高处理复杂、多跳问题的性能。
-
新基准通过LLM重构增强希腊法律法定检索
研究人员推出了GreekBarRetrieval,一个旨在改进希腊法律问答中法定检索的新基准。该基准源自GreekBarBench,包含283个律师考试问题和6,308篇候选法定文章。实验表明,虽然稠密检索最初优于稀疏方法,但基于LLM的查询重构,特别是十轮类似ReAct的循环,显著提高了BM25的性能和整体检索指标。
-
新的Polaris系统利用偏好数据训练LLM以改进表格检索
研究人员开发了Polaris,一个旨在增强自然语言到SQL(NL2SQL)任务中表格检索能力的新颖系统。Polaris训练一个大型语言模型来生成针对检索效果而非仅仅流畅性进行优化的表格描述。该系统通过使用查询-表格相关性判断来创建偏好对,并通过直接偏好优化(DPO)对LLM进行微调,从而利用现有的表格检索基准。实验表明,Polaris的性能显著优于AutoDDG等当前最先进的方法,展示了重新利用检索基准来训练LLM以生成面向检索的元数据的潜力。
-
内容质量而非检索技术是 RAG 精确度的关键
检索增强生成 (RAG) 系统经常因内容质量问题而非检索架构缺陷而失败。知识库中信息矛盾、政策过时和元数据缺失等问题会导致错误答案,即使检索已优化。实施强大的内容运营,包括定期审计、元数据丰富(如市场、产品和生效日期)以及自动矛盾检测,对于提高 RAG 系统准确性至关重要。
-
AI 代理的混合排序器在内存召回基准测试中表现不如 BM25
一位用户对他们的 AI 代理的内存召回能力进行了基准测试,将一个已发布的混合排序器与一个 BM25 部分进行了比较。混合排序器在 recall@5 上得分 0.275,显著逊色于在同一实时语料库上得分 0.925 的 BM25 部分。
-
混合 RRF 检索修复了卡纳达语文学作品上的 RAG 故障
一位开发者详细介绍了为扫描的卡纳达语小说构建检索增强生成(RAG)系统所面临的挑战,并强调检索而非语言模型是主要瓶颈。由于卡纳达语的黏着语性质以及文学文本的稀缺性,最初在 ChromaDB 中使用标准多语言嵌入的方法失败了,导致了不准确和幻觉般的响应。解决方案涉及一种结合了 BM25 和密集嵌入以及倒数排名融合(Reciprocal Rank Fusion)的混合检索系统,以及用于精确页面查询的正则表达式路由器,显著提高了忠实度和上下文召回率。
-
研究发现,RAG 检索性能因查询类型和语言而异
一篇新发表在 arXiv 上的研究调查了检索增强生成(RAG)架构的有效性,特别是在孟加拉国农业咨询服务的背景下。研究强调,总体检索分数可能会掩盖不同查询类型和语言条件下显著的性能差异。对于孟加拉语的农业查询,BM25 和 Hybrid RRF 表现强劲,但与正式的安全查询相比,密集检索方法在处理农民的口语化查询时遇到了困难。研究还发现,嵌入任务配置和段落长度会极大地改变报告的 R@10 分数,这凸显了在低资源 RAG 评估中按语言和…
-
佛罗里达大学鳄鱼队使用检索增强翻译技术处理低资源语言
佛罗里达大学鳄鱼队的研究人员开发了一种针对低资源机器翻译的新方法,专门针对东北印度语言。他们的系统提交给了WMT26共享任务,采用了检索增强的少样本翻译流程。在推理时,Gemini 2.5 Flash模型通过利用从特定语言训练库中通过BM25检索到的并行示例进行条件化来翻译输入文本,而无需进行模型微调。
-
研究发现:代码助手召回率优化可能阻碍问题解决
arXiv上的一项新研究表明,在代码助手中优化检索配置以提高recall@k可能会适得其反,降低问题解决率。研究发现,禁用一个特定的文件去重标志(该标志降低了召回率)实际上提高了GPT 5.6 "Sol"和Qwen3.6-27B等模型的单次解决率。这种效应在词汇BM25检索器上未被观察到,这表明在固定预算的代码修复任务中,检索策略与LLM性能之间存在复杂的相互作用。
-
孟加拉语KBQA框架HybridRAG-BN在竞赛中拔得头筹
研究人员开发了HybridRAG-BN,一个专为孟加拉语知识库问答(KBQA)设计的、新颖的检索增强框架。该框架结合了混合检索方法(包括BM25和BGE-M3嵌入)以及用于答案生成和验证的微调Gemma 4 31B Instruct模型。该系统还包含一个使用DuckDuckGo的后备机制,用于处理未解决的查询。HybridRAG-BN在一次竞赛中取得了第一名,其token级F1分数分别为0.71654和0.72912,证明了其有效性。
-
RAG 系统通过混合搜索和重排在向量搜索之外得到增强
本文深入探讨了超越简单向量搜索来增强检索增强生成(RAG)系统。文章解释说,虽然嵌入对于语义相似性至关重要,但它们本身是不够的。文章提倡一种混合方法,将语义搜索与 BM25 等词汇搜索方法相结合,并纳入重排以优化结果。诸如查询优化、元数据过滤和上下文压缩等技术被强调为构建健壮的 RAG 管道的关键,这些管道可以通过提高准确性和效率来可靠地处理实际查询。
-
新的FinRank基准测试AI在金融答案中引用证据的能力
研究人员推出了FinRank,这是一个新的基准,旨在通过关注答案在SEC文件中特定证据的依据来评估金融问答系统。与主要评估答案正确性的传统方法不同,FinRank强调识别正确的支持性段落、报告期和披露上下文。该基准包含从22家公司10-K和10-Q文件中提取的1,185条手动创建的问答记录,并包含手工策划的硬否定样本来挑战系统。初步结果表明,即使是先进的模型也难以完成这项关注来源的检索任务,这凸显了对更强大的金融AI系统的需求。
-
Guardian Crawler系统增强了从嘈杂网络数据中发现知识的能力
研究人员开发了Guardian Crawler,一个新颖的检索优先系统,旨在从嘈杂的网络数据中进行知识发现和证据支持的摘要生成。该系统结合了BM25检索与先进的重排技术以及约束式检索增强生成,并包含明确的文档引用。在合成语料库上的实验表明,基于风险的重排实现了卓越的描述性检索分数,最佳配置的NDCG@10达到了0.94。尽管该系统作为受控测试平台显示了可行性,但仍需要进一步验证其在实时网络数据上的统计优势和忠实度。
-
混合搜索融合 BM25 和密集向量以改进信息检索
一种新的信息检索方法结合了词汇搜索(BM25)和密集向量搜索,以克服各自的局限性。BM25 在匹配精确关键词和稀有术语方面表现出色,而密集向量则捕捉语义含义和同义词。通过使用倒数排名融合(RRF)融合两种方法的排名列表,RRF 优先考虑在任一列表中排名靠前的文档,检索系统可以提高召回率。这种混合方法已集成到 Weaviate、Elasticsearch 和 Qdrant 等几种流行的向量数据库中,为查找相关信息提供了更强大的解决方案。
-
Remembrane 提供单 SQLite 文件中的本地优先 AI 代理内存
Remembrane 是一种新的、本地优先的 AI 代理持久化内存解决方案,旨在克服基于云或依赖复杂框架的替代方案的局限性。它将代理的全部内存存储在单个 SQLite 文件中,无需任何依赖项,从而提供确定性和可测试性。Remembrane 采用独特的混合检索系统,结合了向量搜索和 BM25 关键字搜索,以实现精确、可解释的排名,并纳入了诸如近期性、重要性和从任务结果中学到的有用性等因素。该系统还支持通过内存历史进行时间旅行和冲突感知检…