PulseAugur
实时 11:49:19
English(EN) NaviDC-OCR: Navigating Document Parsing Across Digital and Camera-Captured Documents

NaviDC-OCR框架通过变形感知学习增强文档解析

研究人员推出NaviDC-OCR,一个旨在增强数字和摄像头捕获文档解析的新框架。该系统通过引入变形感知学习来更好地处理几何失真,并采用自适应采样机制来处理复杂布局,从而解决了现有方法的局限性。NaviDC-OCR还采用内容-结构解耦学习策略来显式建模公式和表格,从而改进了结构化表示。该框架在OmniDocBench v1.6、Wild-OmniDocBench和PureDocBench等多个基准测试中展示了最先进的性能,并在ICDAR 2026 Sci-ImageMiner挑战赛中获得第一名。 AI

影响 该框架可以提高从各种文档类型中提取信息的准确性和效率,从而使依赖结构化数据的应用程序受益。

排序理由 该项目是一篇研究论文,详细介绍了一种新的文档解析框架。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

NaviDC-OCR框架通过变形感知学习增强文档解析

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Peng Cai, Zhaofan Zou, Shifa Liu, Yikun Wang, Jiawei Tang, Kaicheng Yang, Meng Tong, Zhongjiang He, Hao Sun ·

    NaviDC-OCR:跨越数字和相机捕获文档的文档解析导航

    arXiv:2608.12898v1 Announce Type: cross Abstract: Document parsing aims to transform unstructured documents into structured and machine-readable representations. Recent advances in Vision-Language Models (VLMs) have significantly advanced document parsing. However, existing appro…