PulseAugur
实时 03:05:58
实体 optical character recognition

optical character recognition

PulseAugur coverage of optical character recognition — every cluster mentioning optical character recognition across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
38
90 天内 94
发布 · 30天
0
90 天内 0
论文 · 30天
20
90 天内 48
层级分布 · 90 天
主题
关系
情绪 · 30 天

19 天有情绪数据

最近 · 第 1/5 页 · 共 94 条
  1. TOOL · CL_212255 ·

    开发者使用 Kaggle 数据集构建 NanoOCR,准确率达 97%

    一位开发者从头开始构建了 NanoOCR,这是一个光学字符识别模型,使用了 Kaggle 数据集中约 45,000 张 PNG 图片(涵盖 36 个类别)进行训练。该模型使用 PyTorch 和 Colab 通过监督学习构建,准确率高达 97%,并使用 FastAPI 进行服务。开发者正在寻求进一步改进的建议。

  2. TOOL · CL_212193 ·

    ArmorOCR框架通过新的AdvSpot基准增强了对抗性OCR感知能力

    研究人员推出ArmorOCR,一个新颖的两阶段训练框架,旨在增强光学字符识别(OCR)在对抗性攻击下的鲁棒性。该框架通过提出AdvSpot来解决现有OCR基准的局限性,AdvSpot是第一个专门用于基于基础的对抗性OCR评估的基准,包含390张具有区域级标注的图像,涵盖各种对抗性OCR类型。ArmorOCR利用On-Policy Self-Distillation (OPSD) 从转换后的观测中获取对抗性OCR感知能力,并通过Grou…

  3. TOOL · CL_212086 ·

    新的智能体框架解决了多页文档视觉问答问题

    研究人员推出 Doc-V*,一个无 OCR 的智能体框架,专为多页文档视觉问答而设计。该系统采用粗粒度到细粒度的交互式方法,解决了处理长而视觉密集型文档的挑战。Doc-V* 首先进行广泛概述,然后使用语义检索和定向页面获取来收集证据,这些证据随后在结构化工作内存中进行聚合以进行推理。与检索增强生成基线相比,该框架在各种基准测试中的域外性能提高了高达 47.9%。

  4. RESEARCH · CL_210621 ·

    新的代理系统简化文档处理和图表生成

    研究人员开发了DocClaw,这是一个统一的代理系统,旨在在单一框架内处理各种智能文档处理任务,如光学字符识别和文档问答。该系统允许代理与文档交互,通过调用相关工具并整合观察结果来逐步完善信息。此外,AutoFigure被介绍为一个用于根据文本描述生成科学图表的工具包,能够为代理文档智能系统等复杂流程创建图表。

  5. TOOL · CL_210509 ·

    新管道从历史报纸中提取数十亿词元

    研究人员开发了机构报纸管道(Institutional Newspapers Pipeline),这是一个模块化系统,旨在从历史报纸扫描件中提取高质量、结构化数据。该管道与波士顿公共图书馆合作开发,通过分割、OCR和各种文本分析步骤处理扫描件,以分类类型、检测阅读顺序、识别命名实体并生成嵌入。该系统应用于1795年至1930年间发布的超过140万份公共领域报纸扫描件,产生了163亿词元,并形成了一个开放数据集。

  6. RESEARCH · CL_210273 ·

    新的OCR方法改进梵文手稿数字化

    研究人员开发了一种用于光学字符识别(OCR)的迭代微调方法,以改进复杂历史梵文手稿的数字化。该方法可适应手稿特定的布局和外观,减少了对大量手动注释的需求。该研究还对多模态大型语言模型在为此任务创建的新数据集上的性能进行了基准测试。

  7. TOOL · CL_208220 ·

    ShapeCraft 库提供了实用的 LLM 结构化输出用例

    ShapeCraft 是一个用于 LLM 结构化输出的库,它提供了超越简单数据提取的实用应用程序。通过分配类别和优先级,它可以将非结构化的支持工单转换为可操作的数据;通过定义供应商、总计和项目符号的模式,它可以解析收据和发票等复杂文档。该库还通过确保提取和验证所有必需字段来促进表单驱动的聊天机器人,并支持使用 GBNF 语法进行离线模型执行,以保证输出约束。此外,ShapeCraft 还支持具有独立重试和并发控制的文件批量处理,确保文…

  8. RESEARCH · CL_210205 ·

    开放模型在高风险公共部门数据提取方面面临挑战

    一项新的研究论文评估了包括OCR、LLM和VLM在内的开源模型在处理高风险公共部门应用中的结构化信息提取性能。研究发现,尽管视觉语言模型(VLMs)的整体表现优于传统的OCR+LLM流程,但即使是顶尖的开放模型在零样本(zero-shot)设置下也难以保证可靠性。研究强调,模型规模与性能并非线性相关,并着重指出了输入质量,特别是OCR输出的结构完整性,在实现准确结果方面起着至关重要的作用。

  9. COMMENTARY · CL_207703 ·

    LLM vs. OCR:为文档处理选择正确的工具

    一篇近期文章探讨了使用大型语言模型(LLM)和光学字符识别(OCR)进行文档处理的实际区别。作者分享了分析80份文档的见解,重点关注在这些技术之间进行选择时,成本、延迟以及产生幻觉的可能性等因素。文章强调,LLM并非总是适合所有文档处理任务的最佳解决方案。

  10. RESEARCH · CL_206682 ·

    新基准揭示多模态大语言模型在手写和视频OCR方面存在困难

    引入了两个新基准OmniHandwritingOCR和MME-VideoOCR,用于评估多模态大语言模型(MLLMs)的光学字符识别(OCR)能力。OmniHandwritingOCR侧重于真实的手写文本和数学表达式,揭示出当前模型在处理复杂公式时存在困难,并且经常出现幻觉式的修正。MME-VideoOCR在视频场景下评估MLLMs,突出了其在处理运动模糊、时间变化以及需要整体视频理解的任务方面的局限性,即使是Gemini 2.5 P…

  11. TOOL · CL_205895 ·

    代理式LLM框架增强植物性状提取

    研究人员开发了一种新颖的代理框架,该框架结合了基于规则的系统和大型语言模型(LLMs),用于从文档中提取和注释描述性植物性状。该系统利用OCR进行文本转换,利用分割进行内容组织,并利用基于LLM的丰富化来扩展性状词汇并解决歧义。在对三个区域性植物数据集的测试中,该框架成功地为近5000个物种提取了超过55,000个性状注释,LLM集成将注释覆盖率提高了59%。该系统证明了其在大规模植物数据提取方面的鲁棒性和可扩展性。

  12. TOOL · CL_205096 ·

    docTR 库支持端到端文档智能管道

    本教程演示了如何使用 docTR 库构建端到端文档智能管道。它涵盖了光学字符识别 (OCR)、布局分析和知识信息提取 (KIE) 等关键步骤。该过程包括生成合成发票文档、配置 OCR 预测器以提高速度和准确性,以及实现双通道识别和自定义管道钩子等高级功能。教程还详细介绍了如何处理旋转文档、重建阅读顺序、提取结构化数据以及将结果导出为包括可搜索 PDF 在内的各种格式。

  13. RESEARCH · CL_205645 ·

    ConceptFormer框架利用潜在概念改进视觉文档检索

    研究人员推出ConceptFormer,一个旨在增强视觉文档检索的新型框架。该方法学习自适应的潜在概念,以更好地将查询与相关文档对齐,即使证据分散在文本、布局和视觉结构中。与依赖文本描述或原始视觉注释的先前方法不同,ConceptFormer使用查询条件潜在概念作为中间表示。实验表明,ConceptFormer显著提高了检索准确性,在NDCG@10方面比现有的基于视觉和OCR的基线取得了实质性进展。

  14. TOOL · CL_199489 ·

    泰米尔语和马拉雅拉姆语 OCR 在复杂元音符号放置方面遇到困难

    泰米尔语和马拉雅拉姆语脚本的光学字符识别 (OCR) 主要在元音符号方面面临挑战,原因是其放置方式以及与辅音的复杂交互。这些脚本是元音音节文字,其中元音符号附加到辅音上,导致处理视觉顺序而非存储顺序的 OCR 引擎出错。问题因分为两部分的元音符号(显示为独立的墨迹区域)以及与辅音融合形成独特字形的元音符号而加剧。通过检查音节簇开头或位于其他依赖元音符号之前的依赖元音符号,可以帮助识别和纠正这些 OCR 错误。

  15. TOOL · CL_199491 ·

    由于预处理和训练数据限制,带尼库德的希伯来语文本的光学字符识别面临挑战

    带尼库德(元音符号)的希伯来语文本的光学字符识别(OCR)常常难以处理这些符号,因为在识别模型看到文本之前,多个预处理阶段会移除这些精细的标记。这些阶段包括分辨率缩放、二值化阈值处理、去噪点滤波和行分割裁剪。此外,主要在省略尼库德的现代希伯来语上训练的模型,即使尼库德得以保留,也缺乏识别这些标记所需的训练数据。常见的混淆出现在外观相似的元音符号之间,例如卡马茨(qamats)和帕塔赫(patah),或塞戈尔(segol)和舍瓦(she…

  16. TOOL · CL_199492 ·

    OCR引擎因独特的字形而在德语Fraktur字体上失败

    光学字符识别(OCR)引擎在处理历史德语Fraktur字体时遇到困难,因为其字形特征与现代拉丁字体相比存在显著差异。这些差异,如断笔画和密集的垂直笔画,导致错误率很高,因为OCR模型缺乏对这些独特字形的足够训练数据。关键的混淆出现在字母'k'和't'、'n'和'u'以及'B'和'V'之间,而长s(ſ)由于与'f'的细微视觉区别和位置使用规则而尤其成问题。此外,连字和诸如Sperrsatz之类的字母间距技术进一步增加了准确转录和搜索的难度。

  17. RESEARCH · CL_199488 ·

    泰语、高棉语、韩语和埃塞俄比亚文字的OCR挑战详述

    像泰语、高棉语、韩语和埃塞俄比亚语这样的文字的光学字符识别(OCR)面临着不同于标准拉丁字母文本的独特挑战。泰语OCR由于词语之间没有空格,在词语分割方面存在困难,需要基于词典的方法。高棉语OCR面临堆叠的辅音下标和可能被标准识别模型丢失或误解的小型变音符号的问题。韩语OCR因历史上混合使用谚文和汉字而变得复杂,在有限的谚文数据集上训练的模型可能会错误地替换汉字。埃塞俄比亚文字是一种音节文字,其字符家族内部存在系统性的混淆,这意味着错…

  18. TOOL · CL_197599 ·

    从褪色的热敏打印收据中提取数据

    热敏打印收据会随着时间的推移因化学反应和物理过程而降解,使得数据提取变得困难。这些收据上的打印不是物理压痕,而是化学变化,这种变化会逆转或褪色。标准的OCR和生成式放大技术通常效果不佳,因为它们会生成虚假数据而不是恢复现有信息。为了提高数据恢复能力,建议使用漫射光将收据平铺扫描,禁用自动校正,使用自适应局部阈值,并可能尝试背光。

  19. TOOL · CL_194823 ·

    FineBooks 项目着手解决低质量数据问题以推进 AI 发展

    FineBooks 项目正在解决阻碍 AI 发展的低质量数据问题。通过利用先进的光学字符识别 (OCR) 模型,该项目旨在恢复数百万页的历史知识。该倡议旨在改善用于训练 AI 系统的的数据,从而加速其进展。

  20. TOOL · CL_193735 ·

    PragyaDoc框架解决了印度医疗文件获取问题

    研究人员开发了PragyaDoc,一个文档智能框架,旨在改善低资源环境下的医疗文件理解能力,尤其是在印度。该框架解决了大多数医疗信息为英文造成的语言障碍,将农村人口和ASHA(印度社区卫生工作者)排除在外。PragyaDoc采用四层流水线,包括OCR、几何-词汇融合、领域结构化以及用于医疗推理和本地化的双LLM,旨在使关键健康信息在印度多样的语言中都能被获取。