研究人员开发了DocOCR-Eval,一个旨在评估和选择文档理解任务的光学字符识别(OCR)工具的新框架,而无需真实标签注释。该框架采用三阶段校正和排序策略来近似基于注释的排序,即使在标签稀缺的情况下也证明是有效的。研究表明,聚合多个多模态大语言模型(MLLMs)的结果可以增强与基于注释的排名的对齐,为部署文档解析系统提供了实际指导。 AI
影响 提供了一种选择最佳OCR工具的实用方法,有望提高文档理解任务的效率。
排序理由 详细介绍OCR工具新评估框架的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- DocOCR-Eval
- Gotit.pub
- Hugging Face
- IArxiv
- MLLMs
- optical character recognition
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →