PulseAugur
实时 04:02:02

新方法修复长文本场景文字识别问题

研究人员发现场景文字识别(STR)模型存在一种关键的失效模式,这类模型通常在短文本片段上进行训练,但在实际应用中遇到的长文本时会遇到困难。研究诊断出该问题主要源于编码器的宽度而非解码器的长度。虽然表示层面的修复能带来一些改进,但一种新颖的推理时解决方案涉及将长图像切分成重叠的块,独立解码每个块,然后使用编辑距离对齐来拼接结果。该方法在长文本基准(LTB)等基准测试中显著提高了单词准确率,在无需模型重新训练的情况下,达到了或超过了最先进的性能。 AI

影响 提高了AI模型从图像中读取长文本的准确性,这对于标牌和产品标签等应用至关重要。

排序理由 学术论文,详细介绍了一种新的场景文字识别方法。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新方法修复长文本场景文字识别问题

报道来源 [1]

  1. arXiv cs.CV TIER_1 English(EN) · Zobeir Raisi, John Zelek ·

    超长场景文本识别:双轴诊断与无训练修复

    arXiv:2607.23194v1 Announce Type: new Abstract: Scene Text Recognition (STR) models are trained almost exclusively on word crops of at most 25 characters, yet real deployments (signage, product labels, dense captions) require reading much longer text. This paper diagnoses that fa…