研究人员调查了多模态大语言模型中潜在视觉推理的有效性,发现潜在标记并未有效关注输入,对最终答案的因果影响有限。这表明潜在标记编码的视觉信息很少,并且表现出高度相似性。作为替代,研究人员提出了 CapImagine 方法,该方法教会模型显式地使用文本进行想象,在以视觉为中心的基准测试中表现优于复杂的潜在空间基线。 AI
影响 提出了一种更有效的语言模型视觉推理方法,有可能提高多模态任务的性能。
排序理由 详细介绍新方法并挑战现有方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →