PulseAugur
实时 08:34:35
English(EN) LayoutLite: Token-Level Implicit Layout Analysis for Efficient Document OCR

LayoutLite 模块通过减少视觉令牌来提高 OCR 效率

研究人员开发了 LayoutLite,这是一个旨在提高使用视觉语言模型的光学字符识别 (OCR) 系统效率的新型模块。这个即插即用的模块通过在令牌级别执行隐式布局分析来工作,从而在低信息视觉令牌到达语言解码器之前识别并移除它们。通过采用强化学习方法进行无人工标注的训练,LayoutLite 可以显著减少视觉令牌数量和推理成本,这在 OmniDocBenchFireRed-OCRLogics-Parsing-V2 等专用 OCR 模型上的实验得到了证明,在识别质量影响极小的情况下,延迟和 FLOPs 降低了 40% 以上。 AI

影响 通过减少令牌长度和推理成本来加速基于 VLM 的 OCR 系统。

排序理由 关于改进 OCR 效率新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

LayoutLite 模块通过减少视觉令牌来提高 OCR 效率

报道来源 [1]

  1. arXiv cs.CV TIER_1 English(EN) · Xudong Liu, Bicheng Wan, Yulin Jin ·

    LayoutLite: Token-Level Implicit Layout Analysis for Efficient Document OCR

    arXiv:2607.22200v1 Announce Type: new Abstract: End-to-end OCR systems based on vision-language models have achieved strong performance in complex document OCR, but their efficiency is limited by the large number of visual tokens produced from document images. Many of these token…