研究人员推出了InSight,这是一个新的基准测试,旨在评估视觉语言模型在交互式数据可视化中验证声明的能力。与关注静态图像的现有基准测试不同,InSight要求代理导航基于网络的动态环境,以确定声明是否得到支持、被驳斥或无法根据所提供的证据进行验证。该数据集包含源自分析叙述的21,349个声明,并以交互轨迹作为推理的代理。对最先进模型的初步评估表明,交互式声明验证仍然是一个重大挑战。 AI
影响 该基准测试有望推动开发更复杂的AI代理的进展,这些代理能够在动态环境中进行复杂推理和证据综合。
排序理由 该项目描述了一个用于评估AI模型的新学术基准测试。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- cs.CL
- DagsHub
- Gotit.pub
- Hugging Face
- Influence Flower
- InSight
- ScienceCast
- vision-language model
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →