研究人员开发了CANVAS,一个受束理论启发的、用于学习关系感知多模态表示的新框架。该方法解决了当前视觉语言模型(VLMs)将各种艺术史推理维度压缩到单一嵌入空间中的局限性。CANVAS将艺术品投影到基于关系类型的多个嵌入中,使用新颖的对比损失在推理时无需外部数据即可编码上下文信息。在新基准上的评估表明,CANVAS在多模态检索和艺术理解方面具有优越性,突出了多关系对齐的实际重要性。 AI
影响 这项研究可能导致人工智能对复杂视觉数据有更细致的理解,特别是在艺术史等专业领域。
排序理由 该集群包含两篇相同的arXiv论文,详细介绍了用于多模态表示的新研究框架。
在 arXiv cs.IR (Information Retrieval) 阅读 →
- Bibliotheca Hertziana – Max Planck Institute for Art History
- CANVAS
- HertzianaDP
- Ludovica Schaerf
- SemArt+
- Wikipedia
- WikiArt
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →