PulseAugur
实时 07:47:57
English(EN) HierDoc: Hierarchical Page-to-Region Evidence Routing for Long-Document Visual Question Answering

HierDoc框架增强长文档视觉问答能力

研究人员开发了HierDoc,一个用于长文档视觉问答的新型框架,通过采用分层方法来改进证据检索。该方法首先从文档中选择相关页面,然后在这些页面中识别特定区域进行详细分析。这种使用GRPO和结构化集奖励优化的两阶段过程,与之前将页面和区域选择分开处理的方法相比,能够更精确地获取证据。HierDoc在相关基准测试中展示了最先进的性能,优于现有的开源系统,并显示出显著的准确性提升。 AI

影响 提高了处理和查询长文档的准确性和效率,可能使依赖于详细文档理解的AI应用受益。

排序理由 详细介绍文档分析新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

HierDoc框架增强长文档视觉问答能力

报道来源 [1]

  1. arXiv cs.CV TIER_1 English(EN) · Rongjian Gu, Wengang Zhou, Junyu Xiong, Yonghui Wang, Bing Yin, Bei Wang, Houqiang Li ·

    HierDoc:用于长文档视觉问答的分层页面到区域证据路由

    arXiv:2607.29638v1 Announce Type: new Abstract: Multi-page document visual question answering requires locating sparse evidence at both the page and region levels. Existing approaches typically emphasize one level over the other: page-centric methods focus on page acquisition, wi…