研究人员推出了BanglaWild,这是一个新的基准,旨在评估光学字符识别(OCR)系统和视觉语言模型(VLM)的孟加拉语场景文本识别能力。该基准包含2,535张图像,并附有详细的转录和错误注释。评估显示,同一家族中较大的模型并不总是优于较小的模型,而视觉识别错误是大多数系统中错误的主要来源,这挑战了此前对孟加拉语OCR的假设。 AI
影响 该基准将能够更准确地评估OCR和VLM在孟加拉语文本上的表现,有可能推动多语言AI能力的提升。
排序理由 该项目是一篇研究论文,介绍了一个新的场景文本识别基准。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Bangla
- BanglaWild
- Hugging Face
- LLM-as-a-Judge
- Lora
- optical character recognition
- Vision--Language Models
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →