研究人员发现,场景文本识别模型在遇到罕见的词语组合时存在显著的性能差距。尽管在标准基准测试中取得了进展和较高的总体准确率,但模型在处理不常见的单词和字符组合时遇到了困难。即使使用了扩展的视觉骨干网络,这个问题仍然存在,这表明问题不在于容量,而在于自回归解码器的词汇先验。虽然像CTC解码这样的架构更改显示出希望,但目前的缓解技术只能提供边际改进。 AI
影响 突出了当前场景文本识别模型的局限性,表明需要进行架构更改来处理罕见输入的长尾问题。
排序理由 详细介绍计算机视觉领域特定研究发现的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →