研究人员推出SoM-1K,一个旨在评估基础模型在材料力学复杂工程问题上能力的多模态基准数据集。该数据集包含1065个问题,每个问题都有文本描述和示意图。采用了一种新颖的提示策略——图像描述(DoI),该策略使用专家生成的图表文本描述,来测试八个领先的大型语言和视觉语言模型。结果表明,当前模型在这些任务上表现出显著的困难,最佳模型的准确率仅为56.6%,凸显了AI在科学和工程应用中对改进多模态推理的需求。 AI
影响 强调了在科学和工程领域为基础模型开发更强大的多模态推理能力的关键需求。
排序理由 该集群描述了一篇介绍基准数据集和现有模型评估的新学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Descriptions of Images
- Hugging Face
- large language models
- Qixin Wang
- SoM-1K
- Vision--Language Models
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →