PulseAugur
实时 11:44:05
English(EN) A Benchmark of State-Space Models vs. Transformers and BiLSTM-based Models for Historical Newspaper OCR

Mamba模型提供更快的OCR速度,但在历史文本上准确性落后于Transformer

研究人员对状态空间模型(SSMs),特别是Mamba,与Transformer和BiLSTM在历史报纸的光学字符识别(OCR)方面进行了基准测试。研究表明,虽然Mamba模型提供了显著的计算优势,将推理时间减半并显示出更好的内存扩展性,但与基于Transformer的模型相比,它们在严重退化的文本上的准确性略低。进一步的消融研究表明,Mamba在段落等长序列上的性能高度依赖于超参数调整,并且可能需要大量数据,在真实手写体上落后于Transformer,尽管它在干净的合成文本上仍然更快。 AI

影响 Mamba为OCR提供了计算效率,但Transformer在处理具有挑战性的手写体和长序列的准确性方面仍然更胜一筹。

排序理由 两篇研究论文将状态空间模型(Mamba)与Transformer和BiLSTM在OCR任务上进行了比较。

在 arXiv cs.LG 阅读 →

AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →

Mamba模型提供更快的OCR速度,但在历史文本上准确性落后于Transformer

报道来源 [2]

  1. arXiv cs.LG TIER_1 English(EN) · Merveilles Agbeti-Messan, Pierrick Tranouez, St\'ephane Nicolas, Cl\'ement Chatelain, Thierry Paquet ·

    状态空间模型与Transformer及基于BiLSTM的模型在历史报纸OCR上的基准测试

    arXiv:2604.00725v2 Announce Type: replace-cross Abstract: End-to-end OCR for historical newspapers remains challenging, as models must handle long text sequences, degraded print quality, and complex layouts. While Transformer-based recognizers dominate current research, their qua…

  2. arXiv cs.CV TIER_1 English(EN) · Thierry Paquet ·

    将状态空间模型从行扩展到段落:基于 Mamba 的 OCR 消融研究

    End-to-end OCR increasingly relies on autoregressive sequence models, where the quadratic cost of Transformer attention limits efficient transcription of long, paragraph-level text. State-Space Models (SSMs) such as Mamba offer linear-time decoding and have recently been shown to…