olmOCR-Bench
PulseAugur coverage of olmOCR-Bench — every cluster mentioning olmOCR-Bench across labs, papers, and developer communities, ranked by signal.
-
Marker 2 文档转换器吞吐量达 5 倍,在基准测试中击败竞争对手
Datalab 发布了 Marker 2,这是一个经过重写的大幅改进的开源文档转换管道。新版本与 MinerU 相比,吞吐量提高了 5 倍,在单个 Nvidia B200 GPU 上达到每秒 2.9 页,并在 olmOCR-bench 上获得 76.0% 的分数。Marker 2 使用 Surya OCR 2 和更快的 pdftext 模块这三个核心组件重建,并提供针对质量、速度或纯 CPU 操作进行了优化的多种转换路径。
-
Youtu-Parsing模型通过新颖的解码策略加速文档分析
研究人员推出Youtu-Parsing,这是一种新颖的文档解析模型,旨在实现高效、高性能的内容提取。该系统利用Vision Transformer进行特征提取,并利用Youtu-LLM-2B语言模型进行布局分析,采用包括令牌和查询并行化的高并行解码策略。与传统方法相比,这种方法实现了显著的加速,最高可达5-11倍,特别是对于表格等结构化文档,并且可以同时预测多个边界框的内容。Youtu-Parsing在各种文档元素(包括罕见字符和多语…
-
通用大语言模型引领医疗决策;Infinity-Parser2 在文档解析基准测试中领先
arXiv 上发表的一项最新调查评估了 18 个用于医疗应用的大语言模型 (LLM),发现通用模型在决策任务上优于专用模型,而专用模型在诊断方面表现更好。此外,一款名为 Infinity-Parser2 Pro 的新型文档解析模型在使用包含 500 万个样本的开放数据集 olmOCR-Bench 时,取得了 87.6% 的基准测试分数。
-
Infinity-Parser2 模型通过合成数据和多任务强化学习推进文档解析
研究人员推出了 Infinity-Parser2,这是一个用于端到端文档解析的大型多模态模型。该模型利用可控数据合成管道和多任务强化学习来克服标注解析数据的稀缺性。主要贡献包括创建了 500 万样本的双语语料库 Infinity-Doc2-5M,以及一个用于跨八个联合训练目标的联合强化学习的新颖奖励系统。Infinity-Parser2-Flash 和 Infinity-Parser2-Pro 两个变体已发布,其中后者在 olmOCR…