Social Sciences DataLab
PulseAugur coverage of Social Sciences DataLab — every cluster mentioning Social Sciences DataLab across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
Chandra OCR模型在PDF解析基准测试中占据主导地位
最近对PDF解析能力的比较显示,Datalab的OCR模型Chandra的表现优于所有其他测试过的解析器,成功处理了合并单元格的HTML表格、LaTeX,甚至难以辨认的手写体文本。LightOnOCR-1B虽然在其规模下表现出惊人的速度和准确性,但在处理手写体和内容幻觉方面遇到了困难。比较中还包括了MinerU、Granite-Docling和PaddleOCR-VL等其他几个解析器,它们在不同文档类型和挑战中的表现各不相同。
-
用于 RAG 的科学论文解析在表格和方程方面遇到困难
用于检索增强生成(RAG)系统的科学论文解析仍然充满挑战,因为复杂的布局、方程和表格经常导致提取错误。这些错误,例如表格中的数字不正确或方程格式错误,可能很微妙且不易察觉,从而可能导致 RAG 管道中的幻觉。作者提出了一种验证过程,用于将提取的内容与源进行交叉检查,并在置信度阈值以下标记不匹配项,该方法在对 500 篇论文的测试中成功识别了许多不匹配项。
-
Marker 2 文档转换器吞吐量达 5 倍,在基准测试中击败竞争对手
Datalab 发布了 Marker 2,这是一个经过重写的大幅改进的开源文档转换管道。新版本与 MinerU 相比,吞吐量提高了 5 倍,在单个 Nvidia B200 GPU 上达到每秒 2.9 页,并在 olmOCR-bench 上获得 76.0% 的分数。Marker 2 使用 Surya OCR 2 和更快的 pdftext 模块这三个核心组件重建,并提供针对质量、速度或纯 CPU 操作进行了优化的多种转换路径。
-
Datalab 的 Lift 9B 模型在 Schema-First PDF 提取方面处于领先地位
Datalab 的 Lift 是一款新推出的拥有 90 亿参数的视觉语言模型,专为 Schema-First 文档提取而设计。与首先将文档解析为中间格式再提取字段的传统方法不同,Lift 旨在一次性直接从 PDF 和图像输出 Schema 形状的 JSON。在 Datalab 自行进行的基准测试中,Lift 的字段准确率达到了 90.2%,高于其最接近的开源竞争对手 NuExtract3 的 81.5%。Lift 被定位为一种专门的工…
-
开源模型助力企业AI实现PDF到JSON的转换
新的开源模型正在涌现,用于将PDF中的非结构化数据转换为可用的JSON格式,满足企业AI应用的关键需求。这些模型主要分为两类:针对发票和表单等已知字段的模式驱动提取,以及能够将整个页面(包括布局和表格)重构为结构化JSON或Markdown的文档解析。Datalab的lift和NuMind的NuExtract 3等模型提供了本地、经济高效的模式驱动提取解决方案,而IBM的Docling则为各种文件类型提供了全面的文档解析功能。
-
Papers with Code 整合开源 OCR 模型和基准测试
创建了一个新资源来跟踪开源光学字符识别 (OCR) 模型,整合了关于顶级模型、基准测试以及其论文和代码链接的信息。该计划重点介绍了百度最近发布的具有参考滑动窗口注意力机制的 3B 参数 Unlimited OCR 模型,以及可通过 API 获得的 Mistral 的 OCR 4。该平台旨在简化各种应用(如代理 RAG 和 AI 代理的数据摄取)的 OCR 模型选择。
-
Datalab 发布 lift,一个用于结构化 PDF 提取的 9B 参数开放权重视觉模型
Datalab 推出了 lift,一个 9B 参数的开放权重视觉模型,专为从 PDF 和图像中提取结构化数据而设计。该模型以 JSON 模式作为输入,并生成符合该模式的 JSON 对象,在基准数据集上实现了 90.2% 的字段准确率。lift 可一次性处理整个多页文档,并提供模式约束解码,以确保输出的结构有效性。