研究人员推出NaviDC-OCR,一个旨在增强数字和摄像头捕获文档解析的新框架。该系统通过引入变形感知学习来更好地处理几何失真,并采用自适应采样机制来处理复杂布局,从而解决了现有方法的局限性。NaviDC-OCR还采用内容-结构解耦学习策略来显式建模公式和表格,从而改进了结构化表示。该框架在OmniDocBench v1.6、Wild-OmniDocBench和PureDocBench等多个基准测试中展示了最先进的性能,并在ICDAR 2026 Sci-ImageMiner挑战赛中获得第一名。 AI
影响 该框架可以提高从各种文档类型中提取信息的准确性和效率,从而使依赖结构化数据的应用程序受益。
排序理由 该项目是一篇研究论文,详细介绍了一种新的文档解析框架。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Hugging Face
- ICDAR 2026 Sci-ImageMiner Challenge
- NaviDC-OCR
- OmniDocBench v1.6
- PureDocBench
- Wild-OmniDocBench
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →