KHATT
PulseAugur coverage of KHATT — every cluster mentioning KHATT across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新数据集和管道推动阿拉伯手稿 OCR 研究
研究人员推出了 AraMS-28k,这是一个用于历史阿拉伯手稿识别的大规模数据集,包含 14 本书的 28,600 条带注释文本行。该数据集包括主要文本和页边行线的详细注释,以及用于重建非线性阅读顺序的插入锚点。该数据集是使用 RefLAM 创建的,RefLAM 是一个利用多模态大语言模型和人工审查的新型管道,与手动注释相比,吞吐量提高了 75 倍。此外,一项研究探讨了视觉语言模型 (VLM) 在阿拉伯手稿 OCR 中的有效性,发现其…
-
手写文本识别 (HTR) 系统在阿拉伯字母与拉丁字母识别上持续存在性能差距
一篇新发表在 arXiv 上的研究分析了拉丁字母和阿拉伯字母手写文本识别 (HTR) 系统的性能差距。研究人员使用了一个统一的卷积循环神经网络 (CRNN) 模型,跨多个数据集和训练规模进行性能比较。研究结果表明,阿拉伯字母的错误率持续更高,尤其是在低资源环境下。尽管随着数据量的增加,这种差距会缩小,但在完全规模下依然存在,部分原因归结于标注质量问题以及阿拉伯字母更高的视觉变异性和重尾字符频率分布。
-
新框架通过AI和人工审核提升阿拉伯文HTR数据集质量
研究人员开发了一种新颖的两阶段框架CER-HV,旨在提高用于训练手写文本识别(HTR)模型的数据集质量,特别是针对阿拉伯文脚本语言。该框架结合了卷积循环神经网络(CRNN)进行自动错误检测和“人在回路”验证过程。当应用于阿拉伯文数据集时,CER-HV成功识别了转录和分割错误等标签错误,在数据集清理和模型重新训练后,评估CER提高了多达1.8个百分点。
-
跨语言手写文本识别模型通过序列建模提高低资源性能
研究人员调查了跨语言迁移学习如何改进低资源阿拉伯语脚本语言的手写文本识别(HTR)。他们的研究表明,序列建模,而不仅仅是共享的视觉表示,是这些改进的关键,尤其是在数据稀缺的情况下。在阿拉伯语、乌尔都语和波斯语数据集上的实验表明,结合了卷积和序列建模的CRNN模型在多脚本训练时,其性能显著优于仅CNN的模型。这表明在低资源环境下,上下文理解在有效的HTR迁移学习中起着至关重要的作用。