一篇新研究论文介绍了一种名为 Hierarchical BM25 的方法,旨在使词汇搜索在大规模文档集合(例如十亿篇文档)中变得实用。传统的 BM25 索引在如此大的规模下计算成本高昂且速度缓慢,需要大量的内存和磁盘访问。Hierarchical BM25 将内存占用量大幅减少至约 4.4 GB,且不随语料库大小变化,并将查询延迟显著提高至约 300 毫秒。该方法牺牲了精确排名,以换取固定的内存和延迟限制,从而能够对超大型数据集进行交互式搜索。 AI
影响 能够对海量文本数据集进行更高效、可扩展的搜索,可能影响依赖于大规模信息检索的 AI 应用。
排序理由 介绍一种新的信息检索技术的学术论文。[lever_c_demoted from research: ic=1 ai=0.7]
在 arXiv cs.IR (Information Retrieval) 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →