PulseAugur
实时 12:17:32
实体 Cross-modal retrieval

Cross-modal retrieval

PulseAugur coverage of Cross-modal retrieval — every cluster mentioning Cross-modal retrieval across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
  1. TOOL · CL_118140 ·

    新基准 LaVPR 集成语言以改进视觉地点识别

    研究人员推出了 LaVPR,一个旨在通过整合自然语言描述来改进视觉地点识别的新基准。该基准旨在增强定位能力,尤其是在具有挑战性的环境条件下或仅有口头描述可用时。研究表明,整合语言描述可带来持续的性能提升,特别是对于较小的 AI 模型,并支持能够超越传统对比方法的跨模态检索系统。

  2. RESEARCH · CL_117712 ·

    新方法以有限数据增强无监督跨模态检索 · 跟踪4个来源

    研究人员正在开发新的无监督跨模态检索方法,旨在提高效率并减少对大型手动标注数据集的依赖。论文提出了属性提示核哈希(APKH)和全局邻域对齐哈希(GNAH)等技术,这些技术利用视觉语言基础模型和有限的配对数据来构建紧凑、对齐的汉明空间。另一种方法UniCA引入了双向交叉注意力和正相似性损失,以实现更鲁棒的多模态检索,并在WebQA+等基准测试中取得了改进。