Doctr
PulseAugur coverage of Doctr — every cluster mentioning Doctr across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
DeepDoctection 1.2.x 支持端到端的文档智能管道
本教程演示了如何使用 deepDoctection 1.2.x 版本构建一个端到端的文档智能管道。该过程将版面检测、表格结构识别、OCR 和阅读顺序重建集成到一个单一工作流中。用户可以使用 DocLayNet 等模型进行版面检测,使用 DocTR 进行 OCR 来配置管道,然后检查生成的 Page 对象以理解文档表示。该框架是可扩展的,允许自定义对象类型和管道组件来提取特定实体和分类文档。
-
docTR 库支持端到端文档智能管道
本教程演示了如何使用 docTR 库构建端到端文档智能管道。它涵盖了光学字符识别 (OCR)、布局分析和知识信息提取 (KIE) 等关键步骤。该过程包括生成合成发票文档、配置 OCR 预测器以提高速度和准确性,以及实现双通道识别和自定义管道钩子等高级功能。教程还详细介绍了如何处理旋转文档、重建阅读顺序、提取结构化数据以及将结果导出为包括可搜索 PDF 在内的各种格式。
-
本地文档AI需要OCR、RAG和本地推理
构建一个完全本地化的文档AI系统,需要的不仅仅是在本地机器上运行一个语言模型。它需要一个完整的管道,包括用于文档解析的光学字符识别(OCR)、用于搜索和选择相关信息的检索系统(RAG),以及用于生成响应的本地推理。如果没有强大的OCR和解析能力,检索系统可能无法找到准确的信息,导致本地LLM给出错误的答案。许多被宣传为“本地AI”的系统是不完整的,它们依赖外部服务来完成OCR或嵌入等关键步骤,从而损害了真正的本地运行。
-
HalalBench 基准测试解决了多语言食品包装成分提取的 OCR 挑战
研究人员推出了 HalalBench,这是一个新的多语言基准测试,旨在评估光学字符识别(OCR)在食品包装成分标签上的性能。该基准测试解决了这些标签带来的独特挑战,例如曲面、多语言密集文本和小字体,这些在现有的 OCR 基准测试中通常找不到。HalalBench 包含一千多张图像,涵盖 14 种语言的数万个标注,初步评估显示,包括一些领先的 OCR 引擎在内的性能不佳,尤其是在处理日语文本时。