PulseAugur
中
实时 06:18:18
实体 OK-VQA

OK-VQA

PulseAugur coverage of OK-VQA — every cluster mentioning OK-VQA across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
6
90 天内 6
发布 · 30天
0
90 天内 0
论文 · 30天
6
90 天内 6
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 6 条
  1. TOOL · CL_259188 ·

    新基准揭示视觉语言模型中的忠实度差距

    研究人员推出了EDCT-Bench,一个旨在识别视觉语言模型(VLMs)忠实度问题的基准。该基准使用一种称为解释驱动的反事实测试(EDCT)的干预式协议,来测试VLMs的解释和答案在对视觉证据进行最小编辑后,与视觉证据的匹配程度。EDCT-Bench涵盖了视觉问答、驾驶场景和3D空间推理等领域,揭示了各种VLMs在模型忠实度方面存在的显著差距。研究还表明,EDCT生成的反事实可以作为改进模型一致性的有效训练信号。

  2. TOOL · CL_254425 ·

    新的隐私防御方法用于修剪视觉语言模型的视觉标记

    研究人员开发了 QPriv-VL,一个旨在增强用于联邦学习等敏感应用的视觉语言模型(VLM)隐私的新框架。该系统在传输前智能地修剪视觉标记,从而降低数据传输成本并减少暴露私人信息的风险。QPriv-VL 使用动态阈值预测器(DTP),该预测器考虑问题相关性和特征敏感性,以选择性地保留重要的视觉数据,同时抑制潜在的敏感区域,在传输的标记少得多的情况下实现了具有竞争力的准确性。

  3. TOOL · CL_205931 ·

    GraphLoom框架通过知识图谱改进多模态RAG

    研究人员推出GraphLoom,一个旨在增强多模态检索增强生成(RAG)系统的新型框架。该系统从包括场景描述和外部常识知识在内的各种数据源构建多模态知识图谱。然后,GraphLoom通过分层图记忆槽和联合图-序列注意力选择性地路由高实用性证据,而不是注入所有检索到的信息。这种方法旨在提高答案质量和证据忠实度,尤其是在具有嘈杂或广泛证据池的复杂推理场景中。

  4. TOOL · CL_169607 ·

    新的SKIP架构通过稀疏路由大幅降低多模态问答成本

    研究人员推出了一种新颖的知识密集型多模态问答架构SKIP,该架构显著降低了计算成本。SKIP通过沿稀疏路径路由计算来实现这一点,选择性地处理相关的视觉内容和检索到的知识,而不是对每个查询应用统一的成本。这种方法在FLOPs和延迟方面带来了可观的节省,同时在多个基准测试中保持或超过了密集基线方法的准确性。

  5. TOOL · CL_141804 ·

    新框架增强MLLM在视觉问答中的知识推理能力

    研究人员开发了一个名为Hindsight Distilled Reasoning (HinD) 的新框架,以提高多模态大语言模型 (MLLM) 在视觉问答任务中的知识推理能力。HinD框架采用一种自鼓励蒸馏过程,其中一个“Hindsight Teacher”模型生成带有正确答案的推理轨迹,然后用于训练一个“Foresight Student”模型。该学生模型在事先不知道答案的情况下,学习生成逐步推理和相关事实,从而增强其有效整合外部知…

  6. TOOL · CL_93476 ·

    新的MAD-RAG方法解决了LVLM中的注意力分散问题

    研究人员在检索增强型大型视觉语言模型(LVLM)中发现了一种新的故障模式,称为注意力分散(AD)。当高度相关的检索文本全局抑制视觉注意力时,就会发生这种情况,导致模型将注意力从回答它们以前可以处理的问题所必需的图像区域移开。为了解决这个问题,提出了一种名为MAD-RAG的新方法,该方法使用双问题表述和注意力混合来分离视觉基础与上下文集成。在OK-VQA、E-VQA和InfoSeek数据集上的实验表明,MAD-RAG在标准RAG的基础上…