OmniDocBench
PulseAugur coverage of OmniDocBench — every cluster mentioning OmniDocBench across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新的DocPO框架通过定制奖励增强文档解析
研究人员推出了一种新的文档解析框架DocPO,该框架利用具有定制步进感知奖励的强化学习。该方法旨在通过在训练过程中逐步锐化奖励信号来提高复杂文档解析任务的准确性,从而放大高分输出中的细微差别。在OmniDocBench和DocElemHard等基准数据集上的实验表明,DocPO通过其步进感知退火机制的增强,在不需要额外人工监督进行奖励构建的情况下,始终优于现有方法。
-
LayoutLite 模块通过减少视觉令牌来提高 OCR 效率
研究人员开发了 LayoutLite,这是一个旨在提高使用视觉语言模型的光学字符识别 (OCR) 系统效率的新型模块。这个即插即用的模块通过在令牌级别执行隐式布局分析来工作,从而在低信息视觉令牌到达语言解码器之前识别并移除它们。通过采用强化学习方法进行无人工标注的训练,LayoutLite 可以显著减少视觉令牌数量和推理成本,这在 OmniDocBench 和 FireRed-OCR、Logics-Parsing-V2 等专用 OCR…
-
PaddlePaddle发布HPD-Parsing模型,创纪录吞吐量 · 跟踪2个来源
PaddlePaddle发布了HPD-Parsing,这是一款利用分层并行解码范式的新型轻量级文档解析模型。该模型在OmniDocBench v1.6基准测试中取得了94.91%的新SOTA分数,并拥有4,752 TPS的峰值吞吐量。HPD-Parsing模型旨在通过协调全局文档结构并将局部内容生成分派到并发分支来克服传统解析器的顺序瓶颈,从而显著提高推理效率。
-
研究发现LLM裁判在表格识别再生任务中不可靠
一项新的研究论文对使用大型语言模型(LLM)作为裁判来评估和选择闭环再生任务(尤其是在表格识别方面)的输出的可靠性提出了质疑。研究发现,LLM裁判信号较弱,常常导致平局和不可复现的排名。尽管迭代改进提高了候选输出,但LLM裁判未能持续识别出更好的输出。研究表明,LLM的评估能力并不直接转化为优化效用,并且有效的迭代改进需要确定性的验证信号。
-
Youtu-Parsing模型通过新颖的解码策略加速文档分析
研究人员推出Youtu-Parsing,这是一种新颖的文档解析模型,旨在实现高效、高性能的内容提取。该系统利用Vision Transformer进行特征提取,并利用Youtu-LLM-2B语言模型进行布局分析,采用包括令牌和查询并行化的高并行解码策略。与传统方法相比,这种方法实现了显著的加速,最高可达5-11倍,特别是对于表格等结构化文档,并且可以同时预测多个边界框的内容。Youtu-Parsing在各种文档元素(包括罕见字符和多语…
-
新型OCR系统可解析具有结构感知的长篇金融文档
研究人员推出LingDT-VL-OCR,一个专为解析超长金融文档设计的新型系统。该系统旨在将复杂的金融PDF转换为具有可审计来源的准确、结构化输出。LingDT-VL-OCR包含一个跨页内容整合算法和一个文档级标题层级重建模块,以在页面间保持结构一致性并构建完整的目录树。此外,它还采用了一种难度自适应课程学习策略用于表格解析,以及一个CellBBoxRegressor模块用于精确的单元格定位。
-
新框架增强了复杂文档的阅读顺序推断能力
研究人员开发了一种新颖的、无需训练的框架,用于推断复杂文档布局中的阅读顺序,这对于数字化历史手稿尤其有益。这种基于图的方法将 OCR 文本行视为节点,并使用语言模型信号(如条件似然和 BERT 的下一句预测)对过渡进行评分。为了减轻级联错误,它采用了最大遗憾推断规则,优先考虑高机会成本的承诺。该方法在处理 Glossa Ordinaria 的挑战性布局时,在后继边准确率上显著优于 XY-cut 和 LayoutReader 等现有技术…
-
百度发布Unlimited OCR,挑战长文本AI记忆机制 · 追踪1个来源
百度已开源一款名为Unlimited OCR的新OCR模型,该模型通过模仿人类阅读习惯,在处理长文档方面表现出色。与传统的逐页处理文档然后拼接结果的OCR系统不同,Unlimited OCR采用了新颖的参考滑动窗口注意力(R-SWA)机制。这使其能够在不增加通常随文档长度而增加的内存和计算开销的情况下,保持连续阅读状态,并在OmniDocBench基准测试中达到了新的最先进水平。
-
Papers with Code 整合开源 OCR 模型和基准测试
创建了一个新资源来跟踪开源光学字符识别 (OCR) 模型,整合了关于顶级模型、基准测试以及其论文和代码链接的信息。该计划重点介绍了百度最近发布的具有参考滑动窗口注意力机制的 3B 参数 Unlimited OCR 模型,以及可通过 API 获得的 Mistral 的 OCR 4。该平台旨在简化各种应用(如代理 RAG 和 AI 代理的数据摄取)的 OCR 模型选择。
-
百度发布Unlimited OCR,具有恒定的KV缓存用于长文档
百度发布了Unlimited OCR,这是一个30亿参数的混合专家模型,专为高效的长文档解析而设计。该模型利用参考滑动窗口注意力(R-SWA)来保持恒定的KV缓存,克服了传统OCR模型在处理长输出时面临的内存和速度限制。这项创新使得Unlimited OCR能够在一个前向传播中处理数十页文档,并在OmniDocBench v1.5等基准测试中取得了最先进的性能。
-
ABot-OCR模型直接将页面转录为Markdown
研究人员推出ABot-OCR,这是一种新颖的端到端视觉语言模型,旨在将页面图像直接转录为Markdown。该方法通过单次前向传播处理整个页面,避免了对复杂模块化系统的需求。该模型利用专用的数据引擎进行监督,并采用一种称为解耦异构文档优化(Decoupled Heterogeneous Document Optimization)的结构约束强化学习方法来提高准确性并确保标记的完整性。ABot-OCR在OmniDocBench基准测试中取…
-
新方法增强VLM文档布局理解能力
研究人员开发了一种新方法,以提高视觉语言模型(VLM)对文档布局的理解能力,特别是对于训练期间未见过的结构文档。该方法使用一个轻量级检测器预先解析布局信息,并将其注入VLM的提示中,使模型能够更好地区分布局和内容处理。该技术显著提高了在分布外基准测试上的性能,减少了错误,并提高了结构准确性,同时只增加了少量的延迟。
-
新的PureDocBench基准揭示文档解析远未解决
研究人员推出了PureDocBench,一个用于文档解析的新基准,它解决了现有OmniDocBench数据集存在的问题,该数据集存在标注错误和潜在的污染。PureDocBench是程序化生成且可追溯源的,在干净、数字降级和真实世界文档场景中提供了更可靠的评估。对40个模型的初步评估显示,文档解析远未解决,模型之间存在显著的性能差距,并且公式识别存在共同的瓶颈。
-
RTPrune 通过新颖的令牌剪枝技术将 DeepSeek-OCR 推理速度提升 1.23 倍
研究人员开发了 RTPrune,一种新颖的两阶段令牌剪枝方法,旨在提高 DeepSeek-OCR 推理的效率。该方法模仿了模型两次阅读的过程,首先优先处理高范数令牌以获取显著信息,然后使用最优传输理论合并剩余令牌。RTPrune 还包含针对 OCR 任务定制的动态剪枝比例,实现了准确性和效率之间的卓越平衡。