引入了一个名为 OVEarth-Bench 的新基准,用于评估开放词汇地球观测能力。该基准通过扩展类别广度和查询多样性,并在零样本协议下支持掩码和边界框定位,解决了现有评估的局限性。初步评估表明,当前方法的性能有限,多模态大语言模型 (MLLM) 表现最强,而地球观测特定方法往往不如通用模型。 AI
影响 该基准旨在指导开发更现实、更多样化的开放词汇地球观测评估方法,有望提高 MLLM 在该领域的性能。
排序理由 该集群描述了一个用于评估特定领域人工智能模型的新学术基准。
在 Hugging Face Daily Papers 阅读 →
AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →