研究人员推出AMIGO,一个旨在评估代理式视觉语言模型(VLMs)在长时程、多图像场景下的新基准。与以往侧重单图像交互的评估不同,AMIGO通过提出一系列关注属性的“是/否”问题,来挑战模型从图库中识别隐藏目标图像的能力。该基准旨在评估模型选择信息性问题、跨轮次跟踪约束以及随着证据累积进行细粒度区分的能力。对开源VLMs的初步评估显示,仅成功率可能具有误导性,因为模型可能在没有充分证据验证或违反交互协议的情况下获得正确答案。 AI
影响 该基准有望推动更强大、更具交互性的视觉语言模型的发展,使其能够进行复杂的多轮推理。
排序理由 该条目描述了一个用于评估AI模型的新基准,该基准在一篇学术论文中提出。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →