研究人员推出CrossModalQA,一个旨在评估多模态大语言模型(MLLMs)在检索增强生成(RAG)任务中的新基准测试。该基准测试通过专注于开放域证据发现以及跨文本和图像的复杂多跳推理,解决了现有系统中的局限性。CrossModalQA包含超过1,800个问答对,源自Wikipedia和Wikimedia Commons,要求模型执行平均跳数达3.50的多跳、跨模态推理。初步实验表明,当前MLLMs在完整证据检索方面存在困难,并且性能受到不完整或干扰性上下文的显著影响。 AI
影响 该基准测试将推动更强大的多模态人工智能系统的发展,使其能够进行复杂的推理和证据检索。
排序理由 该集群描述了一个用于评估AI模型的新学术基准测试。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →