一个名为ChartAnno的新基准测试已被开发出来,用于评估多模态大语言模型(MLLMs)生成现有图表注解的能力。该基准测试包含1200个真实世界的图表,附带代码和注解说明,并在不同详细程度的级别上进行了测试。目前专有模型通常表现更好,尽管大型开源模型正在缩小差距。研究发现,更具体的说明可以提高注解质量,但推断抽象意图仍然是MLLMs面临的重大挑战,而图表图像仅提供边际效益。 AI
影响 该基准测试突显了MLLMs生成图表注解能力方面的挑战,指出了多模态AI能力未来研究和发展的方向。
排序理由 该条目描述了一个用于评估AI模型的新学术基准测试。
在 Hugging Face Daily Papers 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →