实体
SynthOCR-Gen
SynthOCR-Gen
PulseAugur coverage of SynthOCR-Gen — every cluster mentioning SynthOCR-Gen across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
新的合成数据集提升波斯语OCR能力
研究人员推出了Persian Pixel,一个旨在提高波斯语光学字符识别(OCR)能力的大规模合成数据集。该数据集包含超过343,000个图像-文本对,使用SynthOCR-Gen框架生成,以准确模拟波斯语脚本的复杂性,包括连写连接和风格变化。Persian Pixel旨在克服标注数据的稀缺性,从而能够训练TrOCR和Donut等先进的OCR模型,并推动波斯语文档分析的发展。
-
发布了用于克什米尔语的新合成OCR数据集Koshur Pixel
研究人员推出Koshur Pixel,一个专为克什米尔语设计的新型合成OCR数据集。该数据集包含超过613,000个图像-文本对,使用SynthOCR-Gen框架从KS-PRET-5M语料库生成。Koshur Pixel旨在解决克什米尔语等低资源语言的标注数据稀缺问题,由于其波斯-阿拉伯文Nastaliq脚本,这带来了独特的挑战。该数据集包含各种字体、文本粒度和增强策略,以模拟真实世界的文档条件,从而促进OCR系统的开发和克什米尔语文…