实体
ICDAR 2015
ICDAR 2015
PulseAugur coverage of ICDAR 2015 — every cluster mentioning ICDAR 2015 across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
新的二维位置编码提升Transformer场景文本识别能力
研究人员开发了一种新颖的二维旋转位置嵌入(2D-RoPE-STR)方法,以改进基于Transformer的场景文本识别(STR)。这种新方法通过更好地捕捉文本图像的二维空间结构来解决现有的一维位置编码的局限性,这对于处理弯曲、旋转和透视失真的文本至关重要。该方法引入了各向异性维度分配,并将旋转耦合扩展到编码器-解码器交叉注意力中,从而实现更准确的自回归解码。在六个标准基准上的评估显示,性能有了显著提升,尤其是在处理不规则文本布局方面。
-
新的SAME-Net框架在场景文本识别方面达到最先进水平
研究人员开发了一种新的端到端场景文本识别框架SAME-Net,它统一了文本检测和识别,而无需字符级标注或单独的文本校正模块。该系统包含一个新颖的软注意力掩码嵌入(SAME)模块,该模块使用Transformer编码器生成精炼的、边界感知的掩码,有效减少背景噪声。这种方法通过可微分反向传播实现检测和识别目标的联合优化。SAME-Net在Total-Text和ICDAR 2015等具有挑战性的数据集上展示了最先进的性能。