BM25
PulseAugur coverage of BM25 — every cluster mentioning BM25 across labs, papers, and developer communities, ranked by signal.
14 天有情绪数据
-
本地 RAG 工具 TraceFind 可检测代码库中的文档谎言
Angellina Joyce Paul 开发了 TraceFind,一个本地检索增强生成(RAG)系统,旨在识别代码文档与实际实现之间的差异。该工具索引代码库和文档,使用户能够用自然语言提问,并获得带有精确文件和行号引用的答案。TraceFind 的一个关键功能是能够检测并报告文档说明与底层代码之间的矛盾,确保开发者的准确性。
-
研究解释信息检索中的查询扩展性能
一篇新的研究论文探讨了信息检索系统中查询扩展(QE)性能的可变性。该研究提出了两种互补的视角来解释这些差异:理想扩展查询(IEQ)的概念和使用 Cohen's d 的可分离性度量。在多个 TREC 数据集上进行的实验表明,更接近 IEQ 的扩展查询通常能带来更好的检索效果,并且相关和非相关文档的可分离性为 QE 性能提供了有价值的补充见解。
-
NavTree系统使用确定性树进行长文档问答,优于LLM摘要
研究人员开发了NavTree,一种用于长文档问答的新型检索系统。与依赖LLM生成的摘要进行分层检索的先前方法不同,NavTree在导航中使用了确定性平衡分段树,在索引过程中不产生LLM成本。该方法侧重于信息的结构化导航而非摘要内容。在与扁平检索方法和RAPTOR的抽取式实现进行的评估中,NavTree表现出优越的性能,特别是在长文档的多跳问答任务中,显著优于BM25。
-
专家称,第一个 RAG 聊天机器人不需要向量数据库
在构建检索增强生成(RAG)聊天机器人时,尤其是在文档数量较少的情况下,向量数据库可能是不必要的。像 BM25 这样的传统关键词评分方法可以有效地查找相关信息并在本地运行,从而避免了与嵌入式 API 和外部数据库相关的成本和复杂性。这种方法将数据保留在服务器上,直到最终的模型调用,为许多 RAG 应用提供了更简单、更透明的解决方案。
-
AI 代理与金融科技在新加坡峰会上汇聚,Agent Colony 正式上线
专注于 AI 代理和稳定币的 Agentic Money 2026 峰会在 TOKEN2049 周期间的新加坡举行。与此同时,Agent Colony,一个专为自主 AI 代理设计的独家 API 平台,也已上线。此外,还提到了一个使用 Django 等技术构建的 PDF 工具包 Convertica,以及关于用于信息检索的 BM25 关键词评分的讨论。
-
Jylus 声称减少 98.77% 的输入可提高大型语言模型准确率
Jylus 是一家专注于人工智能应用开发的公司,他们开发了一种通过减少输入上下文来提高大型语言模型准确性的方法。他们的研究使用 Gemini 3.1 Flash Lite 对 528 个问题的基准进行了测试,结果显著减小了输入量,同时提高了准确率。该技术旨在帮助模型区分相关信息与潜在冲突或过时的数据,这是需要历史上下文的应用中常见的问题。
-
RAGFlip论文衡量检索器升级中的负面翻转
一项新的研究论文RAGFlip引入了一种评估检索器升级的方法,重点关注查询级负面翻转。当新的检索器未能找到先前检索器(如BM25)成功识别的相关段落时,就会发生这种翻转。研究发现,所有评估的替换检索器(BGE-large、E5-large-v2和SPLADE)都提高了整体覆盖率,但在各种数据集和深度上仍然表现出负面翻转。这些回归尤其在较小的检索深度下更为显著,突显了在检索器评估中,除了聚合指标外,还需要查询级兼容性。
-
10 份用于 RAG、代理和网关的 AI 参考架构
本文介绍了十种 AI 项目的参考架构,这些架构旨在做到厂商中立且易于理解。这些图示说明了常见的模式,例如具有基本或高级搜索功能的检索增强生成 (RAG)、与模型上下文协议 (MCP) 服务器交互的 AI 代理、具有编排器和工作程序的多个代理系统,以及用于管理模型调用和成本的 LLM 网关。这些架构还包括用于输入和输出验证的护栏,以及用于关键操作的人工干预流程。
-
新的基准JobCCC解决了代码混合职位推荐问题
研究人员开发了JobCCC,这是一个针对孟加拉国等低资源、代码混合环境的对话式职位推荐新基准。该基准包含一个包含超过22,000个职位发布和近1,000个来自Reddit的多轮对话的数据集,并标注了用户偏好和真实职位。他们提出的W-SCAR框架旨在平衡语义相关性与用户偏好和资格标准,通过避免破坏性地修剪潜在合适的职位来优于传统方法。
-
本地RAG应用开发揭示了简单技术的惊人有效性
作者详细介绍了他们构建完全本地化RAG应用程序LocalCortex的经验,以及在评估各种检索和生成技术中学到的经验教训。他们发现许多看似有前景的优化几乎没有或根本没有产生积极影响,有些甚至降低了性能。关键的改进来自于简单的添加,例如用于嵌入的任务前缀,以及在未找到相关信息时拒绝回答的严格相关性阈值。该应用程序使用Ollama运行Llama 3和nomic-embed-text等模型,并使用Qdrant进行搜索,在113个评估问题集上…
-
新研究表明,LLM代理通过工具拒绝信号得到改进
一篇新的arXiv论文探讨了当检索工具不提供相关信息时,被称为“冷冻代理”的大型语言模型如何反应。研究人员发现,一个简单的、未宣布的拒绝信号显著提高了Qwen3和Claude Haiku 4.5等模型的弃权率(针对无法回答的问题),从而大大减少了错误答案。研究还强调,拒绝信号的措辞会影响代理行为,解释比纯粹的标记或软警告更有效。
-
5 个会破坏生产系统的 RAG 错误
构建生产级的检索增强生成(RAG)系统需要仔细考虑,而不仅仅是简单的演示。关键错误包括依赖主观质量评估,而不是命中率和 token F1 等量化评估指标;以及使用固定大小分块,这可能会分割重要的上下文信息。将向量搜索与关键词匹配(如 BM25)相结合可以提高特定术语的检索效果,而设置相关性阈值可以防止模型在找不到相关信息时生成答案。最后,将索引视为静态实体是有问题的;需要一个健壮的摄取管道来处理文档更新、删除和版本控制,尤其是在医疗保…
-
小型语言模型未能达到微任务资格基准
一篇新的arXiv论文研究了小型语言模型(SLM)在代理组合中执行微任务的资格。研究发现,即使在最优配置和FP16精度下,测试的Qwen模型也未能达到定义的资格阈值。量化到4位精度会进一步降低性能,差距与模型大小相关而非精度。研究表明,SLM应置于满足所需阈值的基线系统之后使用,而不是作为这些微任务的主要组成部分。
-
TAGGRAPH框架评估LLM智能体记忆系统 · 已追踪3个来源
研究人员开发了TAGGRAPH,一个用于评估LLM智能体记忆系统的新颖框架。该系统使用具有共享对话记忆的受控评估框架,采用局部图配置和个性化PageRank扩散。虽然AdaptiveGraph在LongMemEval-S基准测试中表现强劲,但传统的BM25和OpenClaw方法最终获得了更高的检索分数。研究强调了词汇归一化和提取质量对图检索的显著影响,表明检索策略应与记忆设置和稳健的词汇基线结合进行评估。
-
新研究探讨 LLM 驱动的检索增强和隐私
研究人员正在探索使用大型语言模型 (LLM) 增强信息检索的新颖方法。一种名为 RARS 的方法通过在文档结构的不同级别上显式分配相关性,专注于分层检索的多分辨率相关性。另一种名为 MERGE 的方法采用小型 LLM 的集成来丰富查询,然后由大型模型进行最终综合,旨在提高在标准基准测试上的性能。此外,一种名为 RICE 的免训练技术表明,LLM 可以通过仅使用上下文示例来提示生成有效的密集检索表示。PILLAR 通过将稀疏和密集检索阶…
-
显式的文档关系在 RAG 实验中提升了 LLM 的推理能力
一项实验探讨了在检索保持不变的情况下,文档之间明确陈述的关系是否能改善检索增强生成(RAG)系统中 LLM 的推理能力。研究发现,提供明确的关系上下文,例如“被取代”或“矛盾”,显著提升了 DeepSeek 和 GPT-4o-mini 模型的性能。这表明,增强对信息之间联系的理解,而不仅仅是提高检索准确性,可能是推进 LLM 推理能力的关键因素。
-
设备端AI工具路由研究强调神经弃权的需求
研究人员探索了AI助手在设备端的工具路由,区分了工具选择和弃权(当没有工具适用时)。传统的单一语言模型方法在本地设备的延迟和内存方面成本高昂。一种替代方法用检索器取代语言模型,检索器对本地操作进行排序,但无法指示何时没有合适的动作。研究发现,虽然BM25可以有效地为词汇匹配的请求选择工具,但神经组件对于准确的弃权至关重要。使用像multilingual-e5-base这样的冻结编码器仅用于弃权,可以使许多请求保持在本地,同时正确识别需…
-
Quanta Python库统一了RAG管道的检索系统
研究人员开发了Quanta,一个开源Python库,旨在简化将不同检索系统集成到单一检索增强生成管道中的过程。Quanta在一个API下统一了密集向量搜索(包含量化嵌入)、BM25全文检索和知识图谱遍历。它通过使用加权倒数排名融合(weighted reciprocal rank fusion)来组合信号,并使用知识图谱作为候选扩展器而非相关性评分器来区分自己。
-
Lit3R系统在文献支持的问答任务中排名第四
来自 tus-nlp 的研究人员开发了 Lit3R,这是一个用于科学文献证据支持问答的系统。该系统集成了检索、重排和大型语言模型组件,无需进行任务特定训练。通过迭代组合各种检索方法,并使用 LLM 进行验证和证据综合,Lit3R 在 LitTraceQA 共享任务排行榜上取得了第四名的成绩。
-
VEKTOR 通过新更新增强了工具调用和记忆检索功能
VEKTOR 已在其平台发布了更新,增强了对 Ollama 等本地 LLM 提供商的工具调用能力,并将此功能扩展到所有发送模式,包括 LIGHTNING、CASCADE 和 COUNCIL/CRITIQUE。此次升级旨在通过使模型能够访问实时信息而不是猜测,提供更具代理(agent-like)的体验。此外,VEKTOR 通过一键式嵌入模型升级到 bge-small-en-v1.5 改进了记忆检索,增加了更长答案的响应空间,并为提供商问…