PulseAugur
中
实时 22:34:31
实体 ViDoRe V3

ViDoRe V3

PulseAugur coverage of ViDoRe V3 — every cluster mentioning ViDoRe V3 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
8
90 天内 8
发布 · 30天
0
90 天内 0
论文 · 30天
6
90 天内 6
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 8 条
  1. TOOL · CL_286652 ·

    视觉文档检索索引易受内容重建攻击

    一篇新发表在arXiv上的研究论文详细介绍了一种多向量视觉文档检索系统的漏洞,其中存储的索引可用于重建原始文档。研究表明,通过分析这些索引中的补丁向量,可以重现文档的大部分内容,包括敏感信息。研究人员测试了两种保护措施:令牌池化和打乱顺序,发现虽然它们会降低召回率,但一个能够恢复顺序的模型仍然可以有效地反转打乱顺序的索引,这凸显了对这些存储索引加强安全性的必要性。

  2. SIGNIFICANT · CL_274640 ·

    Cohere 发布 Embed 5,具备多模态能力和双层级方法

    Cohere 推出了 Embed 5,这是一个专为企业搜索、RAG 和代理检索设计的新型嵌入模型系列。该模型分为两个层级:Embed 5 Pro 提供最高质量,Embed 5 Fast 提供更低的延迟和成本,两者都支持多模态输入和超过 100 种语言。一个关键特性是,两个层级共享同一个嵌入空间,允许用户使用 Pro 进行索引,然后使用 Fast 进行查询,而无需重新索引。Cohere 声称 Embed 5 Pro 在特定基准测试中优于…

  3. RESEARCH · CL_238928 ·

    H公司发布单塔多模态编码器系列NeoMME

    H公司推出了NeoMME,这是一个专为提高效率而设计的新型多模态编码器系列。这些模型提供2.6亿和8亿参数两种尺寸,无需独立的视觉塔和因果解码器,通过单一Transformer架构处理文本和图像数据。这种简化的方法旨在降低计算开销,同时保持强大的性能,其中2.6亿参数的NeoMME-Retriever在文档检索基准测试中取得了有竞争力的结果。

  4. RESEARCH · CL_229094 ·

    Hugging Face发布高效多模态编码器NeoMME,研究表明编码器在印度语言NER任务上表现更优

    Hugging Face推出了NeoMME,一个旨在提高效率的新型多语言多模态编码器系列。与许多生成式模型不同,NeoMME使用单个双向Transformer处理文本和图像块,并采用掩码离散扩散目标从头开始训练。在针对视觉文档检索进行微调后,NeoMME-Retriever表现出强大的性能,并显著降低了存储需求。此外,一项关于Naamapadam的研究发现,在大多数印度语言的命名实体识别任务中,基于编码器的模型性能远超生成式架构。

  5. TOOL · CL_228704 ·

    新的SearchWiki框架学习导航知识维基以进行主动信息检索

    研究人员开发了SearchWiki,一个旨在将语料库合成为结构化、可导航知识维基的框架。该系统训练了一个名为WikiResearcher-9B的智能体,通过多轮工具使用主动搜寻信息,并将知识组织在文档概述、跨文档主题页面和页面级来源记录中。在各种基准测试上的评估表明,WikiResearcher-9B(一个经过RL微调的Qwen 9B模型)的性能显著优于基线模型,并能媲美或超越更大的外部模型,这凸显了与扁平检索方法相比,通过结构化语料…

  6. RESEARCH · CL_229616 ·

    新框架提升多模态文档检索的准确性和效率 · 跟踪4个来源

    研究人员开发了新的多模态文档检索框架,以提高对视觉丰富的文档进行问答的准确性。MIDR将多模态推理转移到索引时间,在准确性和效率方面比ColQwen2.5等现有方法取得了显著的进步。Doc-REFRAG通过压缩视觉标记并选择性地扩展相关标记,解决了现实世界多图像场景中的挑战,在多个基准测试中表现优于基线,且延迟更低。

  7. TOOL · CL_226791 ·

    PULSAR系统通过池化索引增强企业视觉文档搜索

    一篇新的研究论文介绍PULSAR,一个面向企业视觉文档RAG的、以视觉为先的检索系统。PULSAR已部署于Mubadala Investment Company,采用池化、晚交互式索引来高效搜索如pitch decks和board packs等密集型文档。与传统的OCR和口语化方法相比,此方法显著降低了延迟和成本,同时保持了高检索准确性。自2026年3月部署以来,PULSAR已处理了大量交易中的文档和页面,提高了答案事实的召回率。

  8. RESEARCH · CL_40912 ·

    新方法增强VLM文档布局理解能力

    研究人员开发了一种新方法,以提高视觉语言模型(VLM)对文档布局的理解能力,特别是对于训练期间未见过的结构文档。该方法使用一个轻量级检测器预先解析布局信息,并将其注入VLM的提示中,使模型能够更好地区分布局和内容处理。该技术显著提高了在分布外基准测试上的性能,减少了错误,并提高了结构准确性,同时只增加了少量的延迟。