研究人员开发了一种新颖的无视觉组合图像检索(CIR)框架,这是一项复杂的跨模态任务。该方法利用属性增强混合评分来补偿文本表示中丢失的视觉细节,并采用基于LLM的重排来确保顶级结果之间的语义一致性。在CIRR数据集上的实验表明,与现有的零样本CIR方法相比,性能有了显著提升,R@1得分达到44.04%,提高了8.79%。在FashionIQ上的进一步分析突出了语义推理和细粒度视觉匹配之间的平衡,消融研究证实了两种提出技术都有效。 AI
影响 这项研究推动了复杂图像检索任务的无视觉方法,有潜力提高跨模态AI的能力。
排序理由 该集群包含一篇详细介绍图像检索新方法的学术论文。
- arXiv
- Attribute-Augmented Hybrid Scoring
- Circinus
- Compositional Image Retrieval
- FashionIQ
- Hugging Face
- LLM-Based Reranking
- Vision-Free CIR
- alphaXiv
- CatalyzeX
- Composed Image Retrieval
- DagsHub
- Gotit.pub
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →