研究人员推出了TomaMMU,这是一个用于番茄叶病害多模态理解的大规模数据集,以及TomaBench,一个旨在评估视觉语言模型(VLM)在这些任务上的表现的基准。该数据集包含超过28,000张图像和213,000个带注释的问答对,分为七个农业任务,涵盖三个复杂级别,从基本感知到专家诊断。对14个最先进VLM的评估显示,在细粒度识别和推理方面存在显著差距,尽管在TomaMMU上进行简单的微调可显著提高性能。 AI
影响 该基准有望推动专门的VLM在农业诊断和细粒度视觉理解方面的能力改进。
排序理由 该集群描述了一篇介绍用于评估多模态AI模型的数据集和基准的新学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
在 Hugging Face Daily Papers 阅读 →
- Hugging Face
- Munich Center for Quantum Science and Technology
- TomaBench
- TomaMMU
- Vision--Language Models
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →