研究人员开发了GTR+,一个用于文本Personensuche搜索(TBPS)的无监督框架,该框架可以根据自然语言描述检索图像,而无需手动标注的图像-文本对。该框架采用分层描述生成过程,首先通过自动问答获取基本属性,然后通过样本间对比增强细节,并通过风格化扩展丰富多样性。为了解决生成文本可能带来的噪声问题,GTR+采用自适应置信度加权检索学习方法,将图像-文本对建模为干净或噪声,以便在训练期间分配适当的权重。此外,该项目还推出了LargeFine-Person,一个专为无监督TBPS预训练设计的大规模数据集,该数据集已在多个基准测试中证明了GTR+和该数据集的有效性和泛化能力。 AI
影响 推动了图像检索的无监督学习技术,可能减少计算机视觉任务中对大型标注数据集的需求。
排序理由 该集群包含一篇详细介绍计算机视觉新无监督框架和数据集的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →