研究人员推出了 ChitraMiti-12.8k,这是一个新的基准,旨在评估视觉语言模型 (VLM) 在孟加拉语几何推理中的视觉基础和模态依赖性。该基准包括合成几何问题和来自学校教科书的补充图。对几个 VLM 的评估显示,虽然结构化描述可以作为视觉输入的代理,但模型在跨模态验证方面存在困难,并且即使在正确回答的情况下,也容易被文本不准确之处误导。在 ChitraMiti-12.8k 上进行微调显示出改进,但与最强的零样本模型相比,仍然存在显著的性能差距。 AI
影响 该基准可以推动低资源语言的多模态推理评估,推动 VLM 开发朝着更鲁棒的跨模态验证方向发展。
排序理由 该集群包含一篇介绍新 AI 模型评估基准的学术论文。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →