研究人员推出了TomaMMU,一个用于理解番茄叶病害的大规模数据集,以及TomaBench,一个旨在评估视觉语言模型(VLM)在此任务上的基准。该数据集包含超过28,000张图像和超过200,000个带注释的问答对,分为七个农业任务。初步评估显示,当前最先进的VLM在该领域存在细粒度识别和事实性推理方面的困难,尽管在TomaMMU上进行简单的微调显著提高了性能。 AI
影响 该基准有望推动VLM在专业农业诊断方面的能力改进。
排序理由 该集群描述了一篇介绍用于评估AI模型的数据集和基准的新学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- computer science
- Computer vision and pattern recognition
- Hugging Face
- Khang Nguyen Quoc
- TomaBench
- TomaMMU
- Vision--Language Models
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →