一篇新发表在arXiv上的研究调查了手写梵文文本识别的标注效率。研究人员衡量了使识别器有用的转录次数,并比较了四种预训练模式。有监督的合成预训练仅用81个转录词就达到了0.50的字符错误率,显著优于需要355个词的随机初始化。研究还发现,虽然预训练提供了可观的节省,但其优势随着目标准确率的提高而减弱,在某些情况下,掩码图像建模显示了负迁移。 AI
影响 这项研究为优化专业脚本的数据标注提供了见解,可能降低AI模型训练的成本。
排序理由 该集群包含一篇详细介绍机器学习方法研究的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Character Error Rate
- Devanagari
- encoder
- Hugging Face
- masked image modelling
- random initialisation
- supervised synthetic pretraining
- zero-shot learning
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →