实体
A-OKVQA
A-OKVQA
PulseAugur coverage of A-OKVQA — every cluster mentioning A-OKVQA across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 3
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
-
新的SKIP架构通过稀疏路由大幅降低多模态问答成本
研究人员推出了一种新颖的知识密集型多模态问答架构SKIP,该架构显著降低了计算成本。SKIP通过沿稀疏路径路由计算来实现这一点,选择性地处理相关的视觉内容和检索到的知识,而不是对每个查询应用统一的成本。这种方法在FLOPs和延迟方面带来了可观的节省,同时在多个基准测试中保持或超过了密集基线方法的准确性。
-
新框架增强MLLM在视觉问答中的知识推理能力
研究人员开发了一个名为Hindsight Distilled Reasoning (HinD) 的新框架,以提高多模态大语言模型 (MLLM) 在视觉问答任务中的知识推理能力。HinD框架采用一种自鼓励蒸馏过程,其中一个“Hindsight Teacher”模型生成带有正确答案的推理轨迹,然后用于训练一个“Foresight Student”模型。该学生模型在事先不知道答案的情况下,学习生成逐步推理和相关事实,从而增强其有效整合外部知…
-
新理论通过选择最优控制器类别来指导LLM的行动决策
研究人员引入了“制度理论”(Regime Theory),以指导大型语言模型(LLM)如何为给定输入选择最佳行动。该理论根据数据可估计的瓶颈,将控制器分为四类:从简单的固定行动到复杂的先验门控控制器。该框架旨在通过考虑潜在的改进以及实例级信号的可靠性等因素来优化决策。在各种基准测试中的实验表明,预测的控制器类别与经验上的获胜者相匹配,其中先验门控控制器在TextVQA上表现最佳。