研究人员引入了一个名为查询驱动图像-文本联合抽取的新任务,旨在从领域特定的长文档中提取特定的属性值和相应的图像。为此,他们创建了ITJoint,一个包含超过2400页文档、查询和答案实例的基准数据集。他们还开发了Q2IT,一个多代理框架,与独立的视觉语言模型相比,该任务的性能得到了显著提升,但仍存在性能差距。 AI
影响 这项研究可以改进AI系统从复杂的、富含图像的文档中提取和综合信息的方式,可能对法律发现和医学研究等领域产生影响。
排序理由 该集群包含一篇学术论文,详细介绍了多模态信息抽取的新任务、基准和框架。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →