研究人员推出了 PM4Bench,这是一个旨在评估大型视觉语言模型 (LVLM) 多语言能力的新基准测试。该基准测试使用了跨越 10 种语言的平行语料库,并包含一个将文本直接嵌入图像中的视觉设置,模拟现实世界的代理交互。实验表明,光学字符识别 (OCR) 显著影响了跨语言性能差距。为解决此问题,开发了一种使用合成的、无标签数据的以 OCR 为中心的强化学习策略,该策略提高了多语言视觉问答能力并减小了跨语言差异。 AI
影响 这项研究为开发多语言 LVLM 提供了一种更公平、更有效的方法,有可能改善其在不同语言环境中的部署。
排序理由 该集群描述了一篇介绍 LVLM 基准测试和训练方法的新学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Grpo
- Hugging Face
- Jiang Wu
- LVLMs
- optical character recognition
- PM4Bench
- visual question answering
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →