Knowledge-based visual question answering
PulseAugur coverage of Knowledge-based visual question answering — every cluster mentioning Knowledge-based visual question answering across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新方法增强多模态模型用于视觉问答 · 跟踪 6 个来源
研究人员开发了几种新方法来提高多模态大语言模型 (MLLMs) 在知识驱动视觉问答 (KB-VQA) 中的性能。一种名为“Look Twice”的方法是一个无需训练的框架,它利用模型的内部注意力来突出相关的视觉和文本证据,在各种基准测试和 MLLMs 上将准确率提高了多达 12.5 个百分点。另一种方法是贝叶斯数据重加权,通过在训练过程中自适应地降低潜在不相关负例的权重来增强多模态检索。此外,UniHEAR 提供了一个统一的框架,用于…
-
新框架增强MLLM在视觉问答中的知识推理能力
研究人员开发了一个名为Hindsight Distilled Reasoning (HinD) 的新框架,以提高多模态大语言模型 (MLLM) 在视觉问答任务中的知识推理能力。HinD框架采用一种自鼓励蒸馏过程,其中一个“Hindsight Teacher”模型生成带有正确答案的推理轨迹,然后用于训练一个“Foresight Student”模型。该学生模型在事先不知道答案的情况下,学习生成逐步推理和相关事实,从而增强其有效整合外部知…
-
新的Wiki-R1框架提升了基于知识的视觉问答的多模态推理能力
研究人员推出Wiki-R1,一个旨在增强基于知识的视觉问答(KB-VQA)领域中大型语言模型多模态推理能力的新框架。该方法采用可控数据生成和课程强化学习策略,以使训练分布与模型不断变化的能力相匹配。在Encyclopedic VQA和InfoSeek基准上的实验表明,Wiki-R1取得了新的最先进成果,显著提高了两个数据集的准确性。
-
新研究揭示了AI视觉问答基准中的关键缺陷
一篇新发表在arXiv上的论文详细介绍了当前基于知识的视觉问答(KB-VQA)基准存在的重大问题。研究强调,由于答案不正确或矛盾、问题表述不清以及视觉场景过于简单等问题,常见的评估指标(如答案准确率)并不可靠。作者提出了一种审计和修复协议来解决这些问题,以及一种增强协议来引入视觉复杂性,并证明这些改进导致了不同的模型性能趋势,并呼吁重新评估KB-VQA基准的设计。
-
ProMSA代理推动知识库视觉问答发展
研究人员开发了ProMSA,一种用于知识库视觉问答(KB-VQA)的新型代理。与使用固定检索管道的先前方法不同,ProMSA根据工具调用预算和去重情况,自适应地选择图像搜索、文本搜索或停止。该代理使用拒绝采样SFT和一种称为TN-GSPO的序列级RL目标进行训练。在E-VQA和InfoSeek数据集上的实验表明,与现有的RAG和代理基线相比,ProMSA在检索和端到端准确性方面有所提高。
-
新的“Ground Then Rank”方法提升了知识型视觉问答能力
研究人员开发了一个名为“Ground Then Rank”(GTR)的新框架,以提高知识型视觉问答(KB-VQA)的性能。该方法将实体识别与证据排序解耦,解决了现有跨模态检索增强生成(MM-RAG)方法的局限性。通过首先提示一个跨模态大语言模型(MLLM)从候选列表中识别高置信度实体,然后使用现成的重排序器进行证据选择,GTR在Encyclopedic-VQA和InfoSeek等基准测试中取得了优异的结果,同时降低了计算复杂度。
-
新研究揭示多模态AI问答系统中的“末尾丢失”偏见
一篇新研究论文介绍了“末尾丢失”效应,证明多模态检索增强问答系统表现出首位偏见,这与纯文本模型表现出的“中间丢失”效应不同。这意味着检索到的段落开头的信息比结尾的信息更有可能被系统利用。该研究在三个开源的7B/8B VLM阅读器上进行了测试,发现将正确答案放在上下文的开头,与放在结尾相比,性能提高了16到26个百分点。研究人员建议,需要针对阅读器模型的提示槽进行干预来解决这种偏见,因为检索侧的修复未能缓解该问题。