研究人员开发了 Synth-JDoc,这是一个旨在提高大型视觉语言模型 (LVLM) 光学字符识别 (OCR) 能力的新型数据集,特别针对日语文本。该数据集使用 HTML 和 CSS 直接从文本合成文档图像,并结合了垂直和水平书写风格的多样化布局。为了增强真实性和鲁棒性,合成的文档包含由文本到图像模型生成的嵌入式图像,并经过噪声和降级滤镜处理。实验表明,在 Synth-JDoc 上微调的模型优于在先前合成数据集上训练的模型,显著提高了 LVLM 在阅读垂直书写的日语文本方面的性能。 AI
影响 增强了 LVLM 处理复杂日语文档的能力,可能改进需要准确 OCR 的应用程序。
排序理由 该条目描述了在 arXiv 上发布的新数据集和研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →