实体
Encyclopedic VQA
Encyclopedic VQA
PulseAugur coverage of Encyclopedic VQA — every cluster mentioning Encyclopedic VQA across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 3 条
-
新的SKIP架构通过稀疏路由大幅降低多模态问答成本
研究人员推出了一种新颖的知识密集型多模态问答架构SKIP,该架构显著降低了计算成本。SKIP通过沿稀疏路径路由计算来实现这一点,选择性地处理相关的视觉内容和检索到的知识,而不是对每个查询应用统一的成本。这种方法在FLOPs和延迟方面带来了可观的节省,同时在多个基准测试中保持或超过了密集基线方法的准确性。
-
新的Wiki-R1框架提升了基于知识的视觉问答的多模态推理能力
研究人员推出Wiki-R1,一个旨在增强基于知识的视觉问答(KB-VQA)领域中大型语言模型多模态推理能力的新框架。该方法采用可控数据生成和课程强化学习策略,以使训练分布与模型不断变化的能力相匹配。在Encyclopedic VQA和InfoSeek基准上的实验表明,Wiki-R1取得了新的最先进成果,显著提高了两个数据集的准确性。
-
新的“Ground Then Rank”方法提升了知识型视觉问答能力
研究人员开发了一个名为“Ground Then Rank”(GTR)的新框架,以提高知识型视觉问答(KB-VQA)的性能。该方法将实体识别与证据排序解耦,解决了现有跨模态检索增强生成(MM-RAG)方法的局限性。通过首先提示一个跨模态大语言模型(MLLM)从候选列表中识别高置信度实体,然后使用现成的重排序器进行证据选择,GTR在Encyclopedic-VQA和InfoSeek等基准测试中取得了优异的结果,同时降低了计算复杂度。