研究人员推出CVT-Bench,这是一个旨在评估多模态大语言模型(MLLM)空间状态完整性的新诊断套件。该基准测试了MLLM在不同视角和竞争场景下保持预测一致性的能力,填补了当前评估中常常侧重于孤立任务的空白。对五种最先进MLLM的初步测试显示,模型存在显著的持久性损失,并生成了联合不可实现的(jointly unrealizable)状态,表明当前模型可能高估了它们在现实世界场景中的鲁棒性。 AI
影响 将空间状态完整性确立为MLLM鲁棒性中一个关键但被低估的方面,可能指导未来的模型开发和评估。
排序理由 该集群描述了一篇介绍用于评估多模态大语言模型的新基准的学术论文。
- CVT-Bench
- CVT-Competing
- CVT-Isolated
- CVT-Real
- CVT-Synthetic
- Image
- multimodal large language models
- Scene Graph
- Shanmukha Vellamcheti
- Text/BBox
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →