一篇新的研究论文介绍了一个用于评估大型视觉语言模型(LVLM)中交互式视觉基础的框架。研究强调,当前的 LVLM 在需要对话来完善或获取目标信息的任务方面存在困难,表现远低于人类基线。研究还发现,LVLM 的校准性很差,报告的置信度常常超过实际准确率,这表明在视觉匹配、信息检索和综合能力方面需要进一步发展。 AI
影响 突出了 LVLM 在交互式任务方面的重大能力差距,为更动态和上下文感知的 AI 系统指明了未来的研究方向。
排序理由 学术论文,介绍了一个新的 LVLM 基准和评估框架。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →