KB-VQA
PulseAugur coverage of KB-VQA — every cluster mentioning KB-VQA across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新方法增强多模态模型用于视觉问答 · 跟踪 6 个来源
研究人员开发了几种新方法来提高多模态大语言模型 (MLLMs) 在知识驱动视觉问答 (KB-VQA) 中的性能。一种名为“Look Twice”的方法是一个无需训练的框架,它利用模型的内部注意力来突出相关的视觉和文本证据,在各种基准测试和 MLLMs 上将准确率提高了多达 12.5 个百分点。另一种方法是贝叶斯数据重加权,通过在训练过程中自适应地降低潜在不相关负例的权重来增强多模态检索。此外,UniHEAR 提供了一个统一的框架,用于…
-
MMAgent-R^2 通过视觉重排和拒绝增强多模态检索 · 跟踪 2 个来源
研究人员推出 MMAgent-R$^2$,这是一个新颖的 Agentic 框架,旨在增强多模态检索增强生成 (mRAG) 系统。该框架解决了现有 mRAG 方法在知识库中处理视觉相似实体时存在的局限性,这些局限性会导致问答错误。MMAgent-R$^2$ 结合了视觉重排,通过比较查询和候选图像来精确识别目标实体,并结合主动拒绝机制,在必要时丢弃不可靠的结果或检索新候选。该系统通过具有复合奖励函数的 GRPO 训练进行优化,在 Info…
-
ProMSA代理推动知识库视觉问答发展
研究人员开发了ProMSA,一种用于知识库视觉问答(KB-VQA)的新型代理。与使用固定检索管道的先前方法不同,ProMSA根据工具调用预算和去重情况,自适应地选择图像搜索、文本搜索或停止。该代理使用拒绝采样SFT和一种称为TN-GSPO的序列级RL目标进行训练。在E-VQA和InfoSeek数据集上的实验表明,与现有的RAG和代理基线相比,ProMSA在检索和端到端准确性方面有所提高。