ColPali
PulseAugur coverage of ColPali — every cluster mentioning ColPali across labs, papers, and developer communities, ranked by signal.
5 天有情绪数据
-
H Company 发布采用单塔架构的 NeoMME 多模态编码器
H Company 推出了 NeoMME,这是一系列专为高效文档检索设计的新型多模态编码器。这些模型提供 2.6 亿和 8 亿参数两种尺寸,独特地将文本和图像处理集成在单个 Transformer 塔内,无需单独的视觉塔和因果解码器。NeoMME-Retriever 变体在 ViDoRe v3 等基准测试中表现出竞争力,以显著少于其他领先模型的参数实现了强劲的结果。这些模型检查点以 Apache 2.0 许可发布,并兼容 Huggin…
-
Hugging Face发布高效多模态编码器NeoMME,研究表明编码器在印度语言NER任务上表现更优
Hugging Face推出了NeoMME,一个旨在提高效率的新型多语言多模态编码器系列。与许多生成式模型不同,NeoMME使用单个双向Transformer处理文本和图像块,并采用掩码离散扩散目标从头开始训练。在针对视觉文档检索进行微调后,NeoMME-Retriever表现出强大的性能,并显著降低了存储需求。此外,一项关于Naamapadam的研究发现,在大多数印度语言的命名实体识别任务中,基于编码器的模型性能远超生成式架构。
-
PULSAR系统通过池化索引增强企业视觉文档搜索
一篇新的研究论文介绍PULSAR,一个面向企业视觉文档RAG的、以视觉为先的检索系统。PULSAR已部署于Mubadala Investment Company,采用池化、晚交互式索引来高效搜索如pitch decks和board packs等密集型文档。与传统的OCR和口语化方法相比,此方法显著降低了延迟和成本,同时保持了高检索准确性。自2026年3月部署以来,PULSAR已处理了大量交易中的文档和页面,提高了答案事实的召回率。
-
新的 LëtzCross 基准测试评估卢森堡语文档的跨语言多模态检索
研究人员推出 LëtzCross,这是一个专为卢森堡语 PDF 文档设计的跨语言页面级检索任务的新基准测试。该基准测试旨在评估多模态检索系统在低资源、跨语言场景下的表现,结合了文本问答和视觉基础查询。初步比较显示,像 ColPali 这样的页面图像检索方法在不同查询语言上优于传统的基于 OCR 的纯文本检索器,而包括卢森堡语在内的多语言微调在卢森堡语查询上取得了最佳效果。
-
新Trident方法增强长文档多模态问答能力
研究人员开发了一种名为Trident的新方法,以改进长文档的多模态问答。Trident包含两个组件:Trident-R,一个LLM重排器,从候选文档创建结构化语义记录;以及Trident-S,一个生成端模块,用特定视角提示VLM。该方法显著提高了检索F1分数和生成准确性,在长文档数据集上优于现有基线。
-
ColGraphRAG通过晚期交互图像检索增强多模态问答能力
研究人员推出了一种新颖的多模态问答方法ColGraphRAG,该方法通过专注于图谱链接图像的晚期交互评分来增强证据检索。此方法旨在通过确保相关视觉资产(包括特定图像块和标记)在用于下游推理的结构化证据图中得到充分表示来提高准确性。在MultimodalQA基准上的初步评估表明,这种晚期交互评分技术能够更好地检索图像候选对象,并随后提高问答性能,尤其是在视觉证据至关重要的场景中。
-
研究发现:视觉RAG对图表至关重要;文本RAG失败 · 跟踪3个来源
一个关于在金融PDF上进行检索增强生成(RAG)架构的三部分系列研究得出结论:基于视觉的RAG对于从图表中准确提取信息至关重要,在此方面显著优于基于文本的方法。虽然文本RAG可以相当准确地处理纯文本和表格,但它无法解释视觉数据。相反,图RAG虽然在响应方面高度忠实,但在处理金融文件中常见的直接数据查找时遇到困难,导致正确性得分较低。研究强调,标准的RAGAS指标可能具有误导性,因为忠实度并不总是与准确性相关,尤其是在系统谨慎地避免回答…
-
新的GPU内核加速AI检索任务,减少内存使用
研究人员开发了Flash-MaxSim,这是一种新颖的感知IO的融合GPU内核,旨在优化晚期交互检索评分。该新内核计算与标准实现相同的分数,但避免了物化大型中间相似性张量,从而显著减少了内存使用并提高了速度。Flash-MaxSim在A100 GPU上实现了高达3.9倍的性能提升,并使用了高达16倍的推理内存,从而能够处理以前无法实现的更大批次大小和语料库大小。
-
ColPali RAG 系统消除了 OCR,提高了文档检索性能
一个名为 ColPali 的新系统已被开发出来,用于改进文档的检索增强生成 (RAG)。它通过直接将图像块编码为向量,绕过了对光学字符识别 (OCR) 和文本分块的需求。虽然 ColPali 在 ViDoRe 基准测试上表现优于先前的方法,但其存储成本却显著更高。