研究人员开发了CURV,一个新颖的课程学习框架,旨在提高多模态大语言模型(MLLMs)在图表问答(CQA)方面的视觉基础推理能力。CURV将CQA重新构建为多步视觉推理过程,通过空间注意力集中整合逻辑推理和动态视觉基础。为了支持该框架,创建了一个名为CCQA的新数据集,该数据集具有三级课程,并可进行可扩展的合成生成,以适应各种图表类型和推理复杂性。实验表明,CURV的性能显著优于现有方法,在CQA任务上取得了高达20.50%的提升,并证明了其在真实世界和域外多模态推理挑战中的泛化能力。 AI
影响 这项研究可能带来更准确的分析图表等视觉数据的AI系统,从而改进数据分析和报告领域的应用。
排序理由 该集群描述了一篇详细介绍新框架和数据集以提高AI模型能力的新研究论文。
在 Hugging Face Daily Papers 阅读 →
- arXiv
- CCQA
- computer science
- Hugging Face
- Chart question answering
- Curriculum learning
- MLLMs
- multimodal large language models
- spatial attention concentration
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →