实体
Geʽez script
Geʽez script
PulseAugur coverage of Geʽez script — every cluster mentioning Geʽez script across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 1
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
泰语、高棉语、韩语和埃塞俄比亚文字的OCR挑战详述
像泰语、高棉语、韩语和埃塞俄比亚语这样的文字的光学字符识别(OCR)面临着不同于标准拉丁字母文本的独特挑战。泰语OCR由于词语之间没有空格,在词语分割方面存在困难,需要基于词典的方法。高棉语OCR面临堆叠的辅音下标和可能被标准识别模型丢失或误解的小型变音符号的问题。韩语OCR因历史上混合使用谚文和汉字而变得复杂,在有限的谚文数据集上训练的模型可能会错误地替换汉字。埃塞俄比亚文字是一种音节文字,其字符家族内部存在系统性的混淆,这意味着错…
-
新的 VEXMLM 模型提升了非洲语言的性能
研究人员开发了 VEXMLM,这是一种新的语言模型,旨在提高低资源非洲语言(特别是使用埃塞俄比亚文字的阿姆哈拉语和提格利尼亚语)的性能。该模型解决了主要在拉丁字母脚本上训练的多语言模型中常见的词汇外比率高和子词碎片化问题。VEXMLM 使用自定义的 SentencePiece 分词器和扩展词汇表,在 19 种非洲语言的问答、命名实体识别和情感分析任务中取得了显著的进步。