PulseAugur
实时 02:24:29
实体 Haq Nawaz Malik

Haq Nawaz Malik

PulseAugur coverage of Haq Nawaz Malik — every cluster mentioning Haq Nawaz Malik across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_158618 ·

    新的合成数据集提升波斯语OCR能力

    研究人员推出了Persian Pixel,一个旨在提高波斯语光学字符识别(OCR)能力的大规模合成数据集。该数据集包含超过343,000个图像-文本对,使用SynthOCR-Gen框架生成,以准确模拟波斯语脚本的复杂性,包括连写连接和风格变化。Persian Pixel旨在克服标注数据的稀缺性,从而能够训练TrOCR和Donut等先进的OCR模型,并推动波斯语文档分析的发展。

  2. TOOL · CL_105162 ·

    发布了用于克什米尔语的新合成OCR数据集Koshur Pixel

    研究人员推出Koshur Pixel,一个专为克什米尔语设计的新型合成OCR数据集。该数据集包含超过613,000个图像-文本对,使用SynthOCR-Gen框架从KS-PRET-5M语料库生成。Koshur Pixel旨在解决克什米尔语等低资源语言的标注数据稀缺问题,由于其波斯-阿拉伯文Nastaliq脚本,这带来了独特的挑战。该数据集包含各种字体、文本粒度和增强策略,以模拟真实世界的文档条件,从而促进OCR系统的开发和克什米尔语文…

  3. TOOL · CL_93324 ·

    新模型恢复克什米尔语文本中的注音符号

    研究人员开发了 Koshur Diacritizer,这是一种字节级序列到序列模型,旨在恢复克什米尔语文本中的注音符号。该模型解决了数字克什米尔语中省略注音符号的常见问题,这阻碍了自然语言处理应用。为了支持这项工作,发布了一个包含超过 23,000 个对齐句子对的新数据集,以及模型和源代码,以建立克什米尔语注音恢复的可复现基线,并帮助其他低资源语言的研究。