研究人员开发了一种名为STEER(Structure-Token Evidence-anchored Reasoning,结构-Token证据锚定推理)的新方法,以提高大型视觉语言模型理解科学图表的能力。当前模型通常将图表视为普通图像,无法准确解释坐标轴、图例和标记中的定量数据。STEER通过冻结视觉编码器并添加编码图表结构、将推理步骤锚定到特定图节点以及使用专门的表格提取器进行指导的模块来解决此问题。该方法在ChartQA、CharXiv和ChartQAPro等图表理解基准测试中显著提高了性能,通过减少对OCR捷径的依赖,其表现优于ChartGemma、LLaVA-CoT和Qwen2-VL-7B等模型。 AI
影响 提高了AI从科学图表中提取定量数据并进行推理的能力,可能有助于研究和数据分析。
排序理由 该集群包含一篇详细介绍科学图表理解新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →