研究人员开发了SAGA,一个利用冻结的多模态大型语言模型(MLLM)来增强检索任务的视觉嵌入的新颖框架。与使用统一类别标签监督的传统方法不同,SAGA采用组相对策略优化(GRPO)从MLLM的预测中导出特定于属性的梯度。这种方法通过专注于区分图像对之间的属性,使视觉编码器能够学习更细致的表示。该框架在零样本图像检索的多个基准数据集上,将召回率@1比最先进的基线提高了3到6个百分点,显示出显著的改进。 AI
影响 这项研究提供了一种训练视觉编码器的新方法,有望带来更准确、更高效的图像检索系统。
排序理由 该集群描述了一篇详细介绍使用LLM改进视觉嵌入的新颖框架的新研究论文。
在 Hugging Face Daily Papers 阅读 →
- Cars-196
- CUB-200-2011
- FGVC-Aircraft
- Group Relative Policy Optimization
- GRPO
- iNaturalist Aves
- SAGA
- Shubhang Bhatnagar
- Hugging Face
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →