研究人员开发了UniLipi,一种新颖的统一多脚本光学字符识别(OCR)模型,专为历史印度手稿设计。该单一框架可以处理13种不同的印度文字,克服了现有特定文字OCR系统的局限性。UniLipi通过利用感知文字的合成数据生成,能够处理手稿中的挑战性条件,如行几何形状的变化、污渍或插图的干扰以及低资源场景。该模型的学习表示也对当代印度手写体有效,并可扩展到藏文、意大利文、拉丁文和标准中文等非印度文字。 AI
影响 这种统一的OCR方法可以加速跨多种文字的历史手稿遗产的数字化和计算访问。
排序理由 该集群描述了一篇详细介绍用于历史手稿的新OCR模型的论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →