Knowledge-based visual question answering
PulseAugur coverage of Knowledge-based visual question answering — every cluster mentioning Knowledge-based visual question answering across labs, papers, and developer communities, ranked by signal.
-
新框架增强知识型视觉问答系统 · 跟踪 5 个来源
研究人员正在开发先进的框架来改进知识型视觉问答 (KB-VQA) 系统。这些新方法侧重于增强相关外部知识的检索,并确保模型的推理过程严格忠实于证据。技术包括结构感知图检索、问导式证据获取和实体对齐检索,以更好地处理复杂上下文和长尾实体。一些方法还纳入了偏见缓解策略,以提高在 Encyclopedic-VQA、InfoSeek 和 DocVQA2026 等基准测试上的鲁棒性和准确性。
-
新方法通过自适应检索和智能恢复增强视觉文档问答
研究人员开发了新的方法来改进视觉文档问答(DocVQA)和基于知识的视觉问答(KB-VQA)。ViSAR 引入了一种自适应检索技术,可以动态选择要检索的文档页数,将延迟最多降低 58.7%,同时保持准确性。DocIntent 专注于降级文档的智能恢复,评估问题的可回答性并选择性地应用恢复工具以提高 MLLM 的性能。另一种方法将 KB-VQA 重构为搜索-智能体问题,允许智能体决定何时搜索、优化查询或停止,从而在 InfoSeek 和…
-
新的 mR^2AG 框架在 GPT-4o 之上提升了多模态 VQA 性能
研究人员推出 mR$^2$AG,一个旨在提升多模态大语言模型 (MLLMs) 在知识型视觉问答 (VQA) 任务上性能的新框架。该新方法通过仅在必要时自适应地检索相关外部知识,并精确识别该知识中的支持证据,来解决现有方法的局限性。mR$^2$AG 框架利用两次反思操作来区分查询类型并定位有益信息,从而提高准确性并避免不必要的检索调用。它可以与现有的 MLLMs 集成,并在 INFOSEEK 和 Encyclopedic-VQA 等基准…
-
新方法增强多模态模型用于视觉问答 · 跟踪 6 个来源
研究人员开发了几种新方法来提高多模态大语言模型 (MLLMs) 在知识驱动视觉问答 (KB-VQA) 中的性能。一种名为“Look Twice”的方法是一个无需训练的框架,它利用模型的内部注意力来突出相关的视觉和文本证据,在各种基准测试和 MLLMs 上将准确率提高了多达 12.5 个百分点。另一种方法是贝叶斯数据重加权,通过在训练过程中自适应地降低潜在不相关负例的权重来增强多模态检索。此外,UniHEAR 提供了一个统一的框架,用于…
-
新框架增强MLLM在视觉问答中的知识推理能力
研究人员开发了一个名为Hindsight Distilled Reasoning (HinD) 的新框架,以提高多模态大语言模型 (MLLM) 在视觉问答任务中的知识推理能力。HinD框架采用一种自鼓励蒸馏过程,其中一个“Hindsight Teacher”模型生成带有正确答案的推理轨迹,然后用于训练一个“Foresight Student”模型。该学生模型在事先不知道答案的情况下,学习生成逐步推理和相关事实,从而增强其有效整合外部知…
-
新的Wiki-R1框架提升了基于知识的视觉问答的多模态推理能力
研究人员推出Wiki-R1,一个旨在增强基于知识的视觉问答(KB-VQA)领域中大型语言模型多模态推理能力的新框架。该方法采用可控数据生成和课程强化学习策略,以使训练分布与模型不断变化的能力相匹配。在Encyclopedic VQA和InfoSeek基准上的实验表明,Wiki-R1取得了新的最先进成果,显著提高了两个数据集的准确性。
-
新研究揭示了AI视觉问答基准中的关键缺陷
一篇新发表在arXiv上的论文详细介绍了当前基于知识的视觉问答(KB-VQA)基准存在的重大问题。研究强调,由于答案不正确或矛盾、问题表述不清以及视觉场景过于简单等问题,常见的评估指标(如答案准确率)并不可靠。作者提出了一种审计和修复协议来解决这些问题,以及一种增强协议来引入视觉复杂性,并证明这些改进导致了不同的模型性能趋势,并呼吁重新评估KB-VQA基准的设计。
-
ProMSA代理推动知识库视觉问答发展
研究人员开发了ProMSA,一种用于知识库视觉问答(KB-VQA)的新型代理。与使用固定检索管道的先前方法不同,ProMSA根据工具调用预算和去重情况,自适应地选择图像搜索、文本搜索或停止。该代理使用拒绝采样SFT和一种称为TN-GSPO的序列级RL目标进行训练。在E-VQA和InfoSeek数据集上的实验表明,与现有的RAG和代理基线相比,ProMSA在检索和端到端准确性方面有所提高。
-
新的“Ground Then Rank”方法提升了知识型视觉问答能力
研究人员开发了一个名为“Ground Then Rank”(GTR)的新框架,以提高知识型视觉问答(KB-VQA)的性能。该方法将实体识别与证据排序解耦,解决了现有跨模态检索增强生成(MM-RAG)方法的局限性。通过首先提示一个跨模态大语言模型(MLLM)从候选列表中识别高置信度实体,然后使用现成的重排序器进行证据选择,GTR在Encyclopedic-VQA和InfoSeek等基准测试中取得了优异的结果,同时降低了计算复杂度。
-
新研究揭示多模态AI问答系统中的“末尾丢失”偏见
一篇新研究论文介绍了“末尾丢失”效应,证明多模态检索增强问答系统表现出首位偏见,这与纯文本模型表现出的“中间丢失”效应不同。这意味着检索到的段落开头的信息比结尾的信息更有可能被系统利用。该研究在三个开源的7B/8B VLM阅读器上进行了测试,发现将正确答案放在上下文的开头,与放在结尾相比,性能提高了16到26个百分点。研究人员建议,需要针对阅读器模型的提示槽进行干预来解决这种偏见,因为检索侧的修复未能缓解该问题。