研究人员推出 VMIR-CVI,一个旨在增强零样本组合图像检索的新颖框架。该方法通过将复杂查询转换为与视觉语言模型 (VLP) 空间对齐的统一文本描述来优化多模态意图表示。此外,它使用解耦的视觉实例线索来重建查询表示,以最小化噪声并保留目标相关信息。在 CIRR、CIRCO 和 FashionIQ 基准上的实验表明,VMIR-CVI 超越了现有方法,并建立了新的最先进性能。 AI
影响 该框架可以通过更好地理解复杂的用户查询来提高图像检索系统的准确性和效率。
排序理由 该集群描述了一篇关于图像检索新框架的新研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
在 arXiv cs.IR (Information Retrieval) 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →