研究人员推出了 PUMA,这是一个旨在评估人工智能模型在波兰文化和语言背景下的多模态理解能力的新基准。该数据集包含 900 个手工创建的任务,用于评估文本、图像、音频和富文本文档的处理能力。对领先的商业和开源模型的评估显示出显著的性能差异,顶级模型在视觉问答方面表现出色,但在复杂的音频或文档理解方面却表现不佳。PUMA 框架和数据集已开源,以促进本地化多模态人工智能的进一步研究。 AI
影响 该基准旨在提高人工智能对非英语语言和文化的理解能力,弥补了当前多模态人工智能发展中的一个关键空白。
排序理由 该集群描述了一个用于评估人工智能模型的新学术基准和数据集。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →