PulseAugur
实时 22:30:14

New benchmark PorTEXTO targets European Portuguese visual text extraction

研究人员推出 PorTEXTO,这是一个旨在改进欧洲葡萄牙语 (pt-PT) 视觉文本提取的新基准。该基准解决了现有 OCR 基准中 pt-PT 资源稀缺的问题,这些基准通常侧重于资源丰富的语言或历史文本。PorTEXTO 采用了一个标注流程,结合了大型视觉语言模型 (LVLM) 的转录和母语人士的人工审核,以确保为当代应用提供高质量和文化相关性。研究发现,专门的多语言数据显著提升了 pt-PT 的性能,其效果超过了模型大小或分辨率,凸显了对开放式 pt-PT OCR 资源的需求。 AI

影响 旨在提高欧洲葡萄牙语的 OCR 性能,可能使需要该语言文本提取的应用受益。

排序理由 该项目是一篇介绍新基准数据集的研究论文。 [lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

New benchmark PorTEXTO targets European Portuguese visual text extraction

报道来源 [1]

  1. arXiv cs.CV TIER_1 English(EN) · Jo\~ao Cardeira, Diogo Gl\'oria-Silva, Manuel Letras da Luz, Rafael Ferreira, Diogo Tavares, David Semedo, Jo\~ao Magalh\~aes ·

    PorTEXTO: 视觉文本提取的欧洲葡萄牙语基准

    arXiv:2606.19096v2 Announce Type: replace Abstract: European Portuguese (pt-PT) is largely absent from OCR benchmarks, which skew toward high-resource languages. The few benchmarks that cover pt-PT focus on historical artifacts and literature. This work addresses modern OCR appli…