研究人员推出了一种名为视觉化任务语义(VTS)的新颖方法,用于评估多模态大型语言模型(MLLMs)在多大程度上理解图像中以视觉形式呈现的指令。当问题被移入图像时,在六个MLLMs和四个基准测试中,准确率平均下降了17.8个百分点,这表明模型在处理视觉指令方面与处理文本相比存在显著差距。为了解决这个问题,研究团队开发了提示-区域对齐技术,该技术将问题区域与类型化语义对齐,在推理时无需OCR或区域元数据即可将VTS准确率从58.0%提高到66.3%。 AI
影响 突出了MLLMs遵循视觉指令能力的一个关键限制,可能指导未来模型开发朝着更好的多模态推理方向发展。
排序理由 一篇介绍新方法和基准测试以评估MLLMs的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →