PulseAugur
实时 10:57:56
English(EN) When Prompts Become Pixels: Prompt-Region Grounding for Multimodal Reasoning

新的VTS方法揭示MLLMs在视觉指令方面存在困难

研究人员推出了一种名为视觉化任务语义(VTS)的新颖方法,用于评估多模态大型语言模型(MLLMs)在多大程度上理解图像中以视觉形式呈现的指令。当问题被移入图像时,在六个MLLMs和四个基准测试中,准确率平均下降了17.8个百分点,这表明模型在处理视觉指令方面与处理文本相比存在显著差距。为了解决这个问题,研究团队开发了提示-区域对齐技术,该技术将问题区域与类型化语义对齐,在推理时无需OCR或区域元数据即可将VTS准确率从58.0%提高到66.3%。 AI

影响 突出了MLLMs遵循视觉指令能力的一个关键限制,可能指导未来模型开发朝着更好的多模态推理方向发展。

排序理由 一篇介绍新方法和基准测试以评估MLLMs的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的VTS方法揭示MLLMs在视觉指令方面存在困难

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Yongxin Wang, Ruizhe Zhou, Yueling Tang, Yingying Zhu, Xuemin Zhao, Xiaojun Chang, Xiaodan Liang ·

    当提示词变成像素:用于多模态推理的提示词-区域对齐

    arXiv:2608.04726v1 Announce Type: new Abstract: Multimodal large language models increasingly reason over screenshots and documents where the task itself may be written in pixels. Yet benchmarks usually place questions in text, leaving it unclear whether models use the same instr…