MMLongBench-Doc
PulseAugur coverage of MMLongBench-Doc — every cluster mentioning MMLongBench-Doc across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
新系统通过视觉检索和证据链构建增强文档问答能力
研究人员开发了一种新颖的长上下文文档问答系统,特别适用于包含图表和信息图等视觉元素的文档。该系统名为VisRAG-Ret,利用冻结的Qwen2.5-VL-7B-Instruct模型,并包含三个新模块:一个能力感知视觉路由器(CAVR)用于分类页面类型,一个弱到强页面选择(WSPS)机制用于提炼答案可得性,以及一个视觉证据链(VET)用于为生成器创建布局锚定的路径。这种方法显著提高了在DocVQA、ChartQA和MMLongBench…
-
新的MCite-RL框架通过引用增强的强化学习提升多模态RAG
研究人员开发了MCite-RL,一个旨在提高多模态检索增强生成(RAG)系统可靠性的新框架。该方法使用代理强化学习方法来增强视觉引用准确性,并确保引用来源与生成答案之间更好的对齐。MCite-RL采用迭代式视觉引用优化过程和奖励机制,该机制可同时优化答案质量和来源可追溯性,并在Wiki-VISA和FinRAGBench-V等基准测试中显示出有效性。
-
D2-ScaleAgent 框架增强长文档理解能力
研究人员推出 D2-ScaleAgent,一个旨在增强对长篇幅且富含视觉信息的文档理解能力的新型框架。该智能体系统采用双维度缩放范式,根据查询难度动态调整检索和推理过程。它包含一个 Verifier 智能体,负责管理一个持续更新的证据库,从而实现外向缩放以进行扩展检索,以及内向缩放以进行细粒度推理,并具备自适应剪枝和子智能体选择功能。实验表明 D2-ScaleAgent 在 MMLongBench-Doc 和 LongDocURL 等…
-
新Trident方法增强长文档多模态问答能力
研究人员开发了一种名为Trident的新方法,以改进长文档的多模态问答。Trident包含两个组件:Trident-R,一个LLM重排器,从候选文档创建结构化语义记录;以及Trident-S,一个生成端模块,用特定视角提示VLM。该方法显著提高了检索F1分数和生成准确性,在长文档数据集上优于现有基线。
-
新框架应对长文档和演进式文档理解挑战
研究人员开发了新的框架来应对理解长文档和演进式文档的挑战。InSight-doc 是一个代理式视觉感知框架,能自适应地分配视觉分辨率,以提高文档视觉问答的准确性并降低延迟。另外,TIDE 对大型语言模型在时间演进式文档上的表现进行基准测试,突显了其在版本解析和时间准确性方面的显著弱点。DocAtlas 提出了一种可变状态交互方法,将文档理解视为一个信息检索过程,并提供了搜索、阅读和笔记记录等工具,在基准测试中表现出改进的性能。
-
新的基准和框架应对超长文档理解挑战
研究人员推出了两个新框架,以提高大型语言模型理解和回答超长文档问题的能力。DocTrace 专注于创建可追溯的证据图,展示信息在推理过程中是如何组成的,在 MMLongBench-Doc 等基准测试中取得了比现有模型显著的改进。另外,XL-DocBench 提供了一个新的人工验证的超长文档理解基准,其中包含跨越多达 2,303 页的问题,需要进行多文档比较,突显了当前系统在处理此类复杂任务时的困难。
-
新的VLD-RAG框架增强了AI处理长篇、视觉文档的能力
研究人员开发了VLD-RAG,一个新颖的代理式框架,专为长篇、富含视觉信息文档的检索增强生成而设计。该系统构建了一个多模态索引,保留了页面布局,并结合了文本和视觉信号。通过采用结合关键词和语义搜索的混合检索策略,VLD-RAG能够识别相关的证据页面,并利用协调的代理工作流进行证据收集、引用验证和检索请求的迭代优化。在LongDocURL和MMLongBench-Doc等基准测试上的评估表明,与现有的基于视觉的方法相比,VLD-RAG在…
-
新的TAP-RAG框架改进了长文档上的多模态问答
研究人员推出了一种新颖的TAP-RAG框架,旨在改进长文档上的多模态问答。该系统采用任务感知策略控制器(TAPC),通过分析查询来确定最佳证据收集策略。TAP-RAG利用专门的执行器,TA-QFD用于文本和结构证据,TAVE用于视觉信息,以提高准确性。该框架在DocBench和MMLongBench-Doc等基准测试中表现出色,优于标准的多模态RAG基线。
-
新基准 SynthDocBench 揭示视觉语言模型 (VLM) 在长上下文文档理解方面的不足
研究人员推出了一种新颖的合成基准测试 SynthDocBench,旨在评估视觉语言模型 (VLM) 的长上下文视觉文档理解能力。与现有基准测试不同,SynthDocBench 系统地控制了文档长度、布局复杂性和问题类型等因素,以隔离模型故障模式。对七个前沿 VLM 的评估揭示了显著问题,包括随着文档长度增加而导致的性能下降、文档中间部分尤其具有挑战性的位置偏差,以及长文档中图表理解能力的崩溃,这表明当前模型可能过度拟合了基准测试的伪影。
-
新框架学会动态编排AI检索器以进行文档推理
研究人员开发了一种新颖的多模态文档推理代理框架,该框架学会动态编排各种检索方法。这种面向失败的演进方法允许一个元代理在多个步骤中自适应地指导任务代理协调词汇、语义和多模态检索器。演进后的代理在MMLongBench-Doc和DocBench等基准测试中表现出更高的性能,通过学会调用、组合和整合来自不同模态和页面的证据,超越了现有系统。
-
MAGE-RAG 框架增强长文档的多模态问答能力
研究人员推出 MAGE-RAG,一个旨在改进长文档多模态问答的新框架。该系统构建了一个自适应证据图,整合了文本、图像、表格和布局信息。在查询时,证据控制器动态选择和修剪相关信息,为大型语言模型创建紧凑、结构化的输入,从而平衡证据覆盖率和噪声抑制。
-
EviProp 方法通过图扩散改进长文档检索
研究人员开发了 EviProp,一种从长而富含视觉信息的文档中检索相关页面的新方法。与现有独立评估页面相关性的方法不同,EviProp 将文档建模为多模态的块-页图。它使用种子相关性扩散,结合查询-页面相似度与块级信号来提高检索准确性。在基准数据集上的实验表明,EviProp 的性能优于传统方法,并能带来更好的下游问答性能。
-
新的CDS方法推动多模态文档问答发展
研究人员开发了一种新的检索方法,称为约束主导集(CDS),用于多模态文档问答。该技术解决了当前系统中难以处理长文档的局限性,通过选择互补证据而非近乎重复的证据。CDS将查询编码为结构约束,自动平衡相关性和冗余性,并通过实现全局均衡来避免贪婪启发式方法。当与Qwen3-VL-32B阅读器一起使用时,CDS在VisDoMBench上设定了新的最先进水平,并显著提高了MMLongBench-Doc的性能。
-
MARDoc框架通过结构化记忆增强多模态长文档问答能力
研究人员推出了一种新颖的框架MARDoc,旨在改进长篇多模态文档的问答能力。该系统使用三个专门的代理:用于检索的Explorer,用于将交互处理成结构化记忆的Refiner,以及用于反馈的Reflector。通过采用动态结构化记忆而非持续增长的上下文,MARDoc旨在减少噪声并保留关键信息,以实现更有效的多跳推理。
-
具备视觉能力的LLM与OCR在文档问答方面进行测试
一项基准测试将具备视觉能力的大型语言模型与基于OCR的管道在长篇、富含图像的文档问答方面进行了比较。评估使用了MMLongBench-Doc数据集中的30个PDF文件,评估了模型解释文档中图表、图像和表格的能力。结果突显了每种方法在处理复杂视觉信息进行文档问答方面的优缺点。