DocBench
PulseAugur coverage of DocBench — every cluster mentioning DocBench across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新的TAP-RAG框架改进了长文档上的多模态问答
研究人员推出了一种新颖的TAP-RAG框架,旨在改进长文档上的多模态问答。该系统采用任务感知策略控制器(TAPC),通过分析查询来确定最佳证据收集策略。TAP-RAG利用专门的执行器,TA-QFD用于文本和结构证据,TAVE用于视觉信息,以提高准确性。该框架在DocBench和MMLongBench-Doc等基准测试中表现出色,优于标准的多模态RAG基线。
-
新框架整合视觉、语言与图谱,赋能AI
两篇新研究论文介绍的框架,旨在将多模态数据整合到图学习和检索系统中。第一篇OMG-VLM利用视觉-语言模型从具有异构文本和图像属性的图中学习,性能优于现有的图神经网络和基于LLM的方法。第二篇MMGraphRAG通过链接文本和视觉信息构建可解释的多模态知识图谱,旨在减少LLM的幻觉并在复杂的多模态场景中提高推理能力。两篇论文都强调了整合不同数据模态对于高级AI应用日益增长的重要性。
-
新框架学会动态编排AI检索器以进行文档推理
研究人员开发了一种新颖的多模态文档推理代理框架,该框架学会动态编排各种检索方法。这种面向失败的演进方法允许一个元代理在多个步骤中自适应地指导任务代理协调词汇、语义和多模态检索器。演进后的代理在MMLongBench-Doc和DocBench等基准测试中表现出更高的性能,通过学会调用、组合和整合来自不同模态和页面的证据,超越了现有系统。
-
MARDoc框架通过结构化记忆增强多模态长文档问答能力
研究人员推出了一种新颖的框架MARDoc,旨在改进长篇多模态文档的问答能力。该系统使用三个专门的代理:用于检索的Explorer,用于将交互处理成结构化记忆的Refiner,以及用于反馈的Reflector。通过采用动态结构化记忆而非持续增长的上下文,MARDoc旨在减少噪声并保留关键信息,以实现更有效的多跳推理。