一篇新的研究论文介绍了 Percept-V,这是一个旨在测试多模态大语言模型(MLLM)基本视觉感知能力的数据集。尽管任务很简单,只需要很少的推理,但目前最先进的专有和开源 MLLM 与人类相比表现较弱。研究发现,随着图像中物体数量的增加,模型的性能会显著下降,并确定了对这些模型特别具有挑战性的特定感知技能。虽然对开源 MLLM 进行微调显示出性能提升,但这些改进并未很好地泛化到相关数据集,表明所学表示形式存在局限性。 AI
影响 强调了 MLLM 视觉感知方面的当前局限性,表明基础模型在泛化和鲁棒性方面需要改进。
排序理由 介绍 LLM 新数据集和评估方法的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Hugging Face
- MLLMs
- Multimodal Large Language Models and Tunings: Vision, Language, Sensors, Audio, and Beyond
- Percept-V
- Samrajnee Ghosh
- TVPS-4
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →