PulseAugur
中
实时 00:19:37
实体 ColBERTv2

ColBERTv2

PulseAugur coverage of ColBERTv2 — every cluster mentioning ColBERTv2 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
7
90 天内 7
发布 · 30天
0
90 天内 0
论文 · 30天
7
90 天内 7
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 7 条
  1. RESEARCH · CL_266509 ·

    新研究探讨LLM长上下文检索和RAG策略 · 追踪9个来源

    近期研究探索了大型语言模型(LLMs)如何处理长上下文,研究调查了性能提升背后的机制。一篇论文检查了思维链(CoT)推理,发现它能够实现定向检索和比广泛检索更紧凑的表示。另一项研究分析了不同的位置编码选择,如RoPE和滑动窗口注意力,如何将模型从位置检索转移到语义检索,从而影响问答等任务的性能。此外,研究比较了各种检索增强生成(RAG)策略,强调了重排序和后期交互对于科学问答的重要性,并引入了学习检索动作和自我评估探索的新框架,以增强知识检索。

  2. RESEARCH · CL_242937 ·

    EigenLI框架为后期交互模型提供谱近似

    研究人员开发了EigenLI,一个用于近似信息检索中后期交互模型的新框架。该方法利用文档标记嵌入固有的低秩结构来压缩表示,显著降低了索引成本和存储占用。EigenLI识别文档内的主要特征方向,以创建简化的交互表示,在实证测试中优于传统的聚类和池化方法。

  3. TOOL · CL_180208 ·

    新的CE-QE方法通过基于语义证据来增强词汇检索

    研究人员开发了一种名为交叉编码器查询扩展(CE-QE)的新方法,以改进信息检索系统。该技术解决了传统词汇检索方法(如BM25)的局限性,这些方法在查询和文档词汇不同时无法找到相关文档。CE-QE通过分析应用于语义检索结果的交叉编码器的相关性分数来识别关键术语,并将它们添加到原始BM25查询中。这种方法避免了伪相关反馈中常见的查询漂移,并且不像其他方法那样依赖于生成文本,而是直接使用检索到的段落中的术语。

  4. TOOL · CL_111511 ·

    TileMaxSim内核将GPU检索模型速度提升220倍

    研究人员开发了TileMaxSim,这是一种新的面向IO的GPU内核,旨在显著加速多向量检索模型(如ColBERT)中使用的MaxSim评分过程。现有实现效率低下,仅利用了可用GPU带宽的一小部分。TileMaxSim通过采用多查询SRAM分块、维度分块和融合乘积量化评分来解决此问题,在NVIDIA H100 GPU上实现了高达80.2%的峰值HBM带宽。这带来了显著的速度提升,能够实现每秒对8200万份文档进行评分,并大大降低了检索任务的延迟。

  5. TOOL · CL_86556 ·

    新的HKVM-RAG方法提升多跳RAG性能

    研究人员开发了HKVM-RAG,一种增强多跳检索增强生成(RAG)系统的新方法。该方法将检索到的文本组织成超图结构,并使用这些结构作为证据检索的键。这种键值分离将键空间设计隔离开来,允许跨不同图变体进行一致的评估。该系统在2WikiMultiHopQA和MuSiQue等基准测试中展示了F1分数的显著提高,并且与密集感知控制器结合使用时,在多个基准测试中的表现明显优于现有方法。

  6. RESEARCH · CL_76802 ·

    新的 HKVM-RAG 方法增强了 LLM 的多跳检索能力

    研究人员开发了 HKVM-RAG,一种用于组织检索文本的新方法,以改进多跳检索增强生成 (RAG) 系统。该方法分离键值对,使用超图结构比传统方法更有效地表示证据链。实验表明,在 2WikiMultiHopQA 和 MuSiQue 等基准测试中,F1 分数显著提高,优于现有技术。

  7. RESEARCH · CL_58549 ·

    新的检索方法用稀疏编码取代 K-means,实现更快、更准确的结果

    研究人员推出了一种名为单阶段稀疏检索(SSR)的新方法,用于高效的多向量检索,该方法绕过了传统的 K-means 聚类。SSR 利用稀疏自编码器创建高维、稀疏的 token 嵌入表示,从而可以使用倒排索引代替压缩。这种方法显著减少了索引时间和检索延迟,同时提高了准确性,在 BEIR 基准测试中优于现有基线。