PulseAugur
实时 11:37:56
English(EN) ELVA: Exploring Ranking-Driven Universal Multimodal Retrieval

ELVA框架解决多模态检索中的“粒度盲”问题 · 已追踪2个来源

研究人员推出了一种新颖的框架ELVA,旨在解决利用多模态大语言模型(MLLMs)的通用多模态检索(UMR)系统中的“粒度盲”问题。粒度盲是指模型在查询中忽略细粒度信息,将所有负样本同等对待。ELVA采用基于规则的、具有可验证奖励的强化学习(RLVR)方法来优化负样本的排名,并增加正负样本之间的相似度差距。为了评估其有效性,开发了一个名为MRBench的新基准,ELVA在该基准上取得了最先进的成果,包括MRBench上的显著13.1%的提升。 AI

影响 这项研究可以提高多模态检索系统的准确性和细微差别,从而带来更复杂的信息检索能力。

排序理由 该集群包含一篇关于多模态检索新框架和基准的论文。

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →

ELVA框架解决多模态检索中的“粒度盲”问题 · 已追踪2个来源

报道来源 [2]

  1. arXiv cs.AI TIER_1 English(EN) · Yuhan Liu, Pei Fu, Hang Li, Yukun Qi, Chao Jiang, Jingwen Fu, Zhen Liu, Bin Qin, Zhenbo Luo, Jian Luan, Jingmin Xin ·

    ELVA:探索驱动排序的通用多模态检索

    arXiv:2606.20280v1 Announce Type: cross Abstract: Leveraging Multimodal Large Language Models (MLLMs) via contrastive learning has become a mainstream paradigm for improving the performance of Universal Multimodal Retrieval (UMR). However, previous works have ignored the grain bl…

  2. arXiv cs.IR (Information Retrieval) TIER_1 English(EN) · Jingmin Xin ·

    ELVA:探索驱动排序的通用多模态检索

    Leveraging Multimodal Large Language Models (MLLMs) via contrastive learning has become a mainstream paradigm for improving the performance of Universal Multimodal Retrieval (UMR). However, previous works have ignored the grain blindness when adapting the contrastive paradigm int…