visual question answering
PulseAugur coverage of visual question answering — every cluster mentioning visual question answering across labs, papers, and developer communities, ranked by signal.
7 天有情绪数据
-
新的HeiCo-FOCUS数据集挑战VLMs进行数小时手术视频的理解
研究人员推出了HeiCo-FOCUS,一个旨在评估视觉语言模型(VLMs)长上下文视频理解能力的新数据集。该数据集源自海德堡结直肠手术,专注于在可能持续数小时的手术过程中跟踪异物的挑战。HeiCo-FOCUS包含30,000个视觉问答对,并采用多轨道评估框架,逐步测试模型在物体识别、时间定位、聚合、事件理解和复杂推理方面的能力。对十个前沿VLMs进行的初步实验揭示了重大挑战,尤其是在时间定位方面,表明当前模型距离掌握这项复杂任务还有很长的路要走。
-
新的蒸馏方法提升循环 Transformer 性能
研究人员开发了一种新的蒸馏方法来提高循环 Transformer 的性能,循环 Transformer 的设计比标准 Transformer 更有效地处理长序列。该技术通过让教师模型直接监督学生循环模型的记忆压缩来训练学生模型,教师模型处理完整的观察历史。该方法在缩小 Mem-RPE 基准和视觉问答等任务的性能差距方面取得了成功,为机器人记忆应用实现了线性时间复杂度。
-
新的 R-GroundBench 基准揭示 AI 在复杂化学编辑方面存在困难
一个名为 R-GroundBench 的新基准已被开发出来,用于评估 AI 理解和编辑具有可变 R-基团占位符的化学结构的能力,这些结构常见于药物专利中。目前的 AI 模型在较简单的任务上表现良好,但在更复杂的场景中却面临显著困难,这表明它们在 Markush 编辑方面的可靠结合和执行能力存在差距。该基准突显了 AI 驱动的化学科学发现所面临的挑战。
-
脑电图信号引导视觉语言模型以实现高效的视觉问答
研究人员开发了BrainFocus,一个新颖的框架,它使用脑电图(EEG)信号来引导视觉语言模型(VLMs)以实现更高效的视觉问答(VQA)。该系统从EEG数据中预测目标类别,并使用YOLO检测器来定位感兴趣的区域(ROI)。如果置信度阈值得到满足,VLM将仅处理此裁剪的ROI,否则将默认处理整个图像。这种方法在Qwen3.5-VL模型的各种VQA准确性和计算成本降低方面显示出显著的改进,即使在EEG语义解码不完美的情况下也是如此。
-
新方法识别视觉问答模型关键图像区域
研究人员开发了一种名为“反事实搜索地面区域”(CSGR)的新方法,用于识别对视觉问答(VQA)模型至关重要的图像区域。该方法通过干预图像区域来观察模型答案如何变化,从而 pinpoint 关键视觉证据。当应用于注意力引导和视觉CoT微调等现有训练技术时,CSGR标注在标准交叉熵微调上的性能持续提升,证明了其在面向地面训练中的实用性。
-
SparseTalk 降低 VQA 的 3D 高斯语言场成本
研究人员开发了 SparseTalk,一种显著降低 3D 视觉问答 (VQA) 中使用的 3D 高斯语言场存储和计算成本的方法。通过系统地稀疏化密集语义特征,SparseTalk 证明了在仅使用几百个语义嵌入的情况下,仍能以原始表示的一小部分维持强大的 VQA 性能。基于对象的选择策略被证明是有效的,在保持性能的同时大幅提高了推理吞吐量并减少了内存使用。
-
新的TTIQ框架增强了视觉语言模型的适应性
研究人员开发了TTIQ,一个新颖的测试时强化学习框架,旨在改进视觉语言模型(VLMs)对未标记数据的适应性。TTIQ通过分析图像-问题对对VLM响应的依赖性来解决当前方法的局限性。它构建了一个有利于联合接地和自信答案的奖励信号,从而在各种VQA数据集和模型尺寸上获得更好的性能。
-
新的 TestHallVQA 基准测试探究 LVLM 在冗余上下文中的推理能力
研究人员推出了 TestHallVQA,这是一个新的基准测试,旨在评估大型视觉语言模型 (LVLM) 在文档级推理方面的能力,特别是在存在冗余或不相关信息的情况下。该基准测试旨在通过结合文档规模和人类考试的复杂性来解决现有 VQA 数据集的局限性。TestHallVQA 还引入了一种新颖的指标 F1-R extsuperscript{2},用于评估推理能力和对抗上下文冗余的鲁棒性。
-
新的VQA研究探索答案可预测性、反事实学习、视觉基准和隐私
研究人员正通过几种新方法推进视觉问答(VQA)。一篇论文介绍了VT-Transformer,它使用Transformer架构通过分析视觉和文本特征来预测答案的可预测性,在VizWiz 2020数据集上显示出有效性。另一项研究提出了一个框架,增强反事实对比学习以提高VQA模型对语言偏差的鲁棒性,在VQA-CP v2和VQA v2数据集上取得了强劲的性能。第三篇论文通过引入面向视觉的大型视频模型的基准来挑战当前的评估方法,突出了它们在视觉…
-
新框架使多模态大语言模型超越模仿,对齐推理路径
研究人员开发了一个新的多模态上下文学习(ICL)框架,旨在提高大语言模型(LLMs)如何将其响应与复杂多模态输入所需的推理过程对齐。该方法通过重新构建示例,明确对比次优响应和更优响应,突出推理路径以进行改进,从而超越了简单的模仿。响应条件检索机制通过选择推理与当前响应最相关的示例来进一步增强这一点,从而在视觉问答任务中带来显著的性能提升。
-
新的强化学习框架增强多模态代理自我验证能力
研究人员开发了一个名为“通过强化学习进行自我验证”(SVRL)的新型强化学习框架,以提高多模态推理代理的可靠性。该框架训练代理在其自身的推理过程中验证和过滤检索到的证据,从而减少对外部验证器的需求。SVRL还包含一个面向搜索的惩罚项,以最大限度地减少不必要的工具调用,并对生成多样化、格式良好的搜索查询给予奖励。当仅使用5000个视觉问答示例应用于Qwen-2.5-VL-7B模型时,SVRL在多跳VQA泛化和工具效率方面表现出持续的改进…
-
新的FOLTMed模型利用临床医生来源的数据推进医学影像识别
研究人员开发了一种名为FOLTMed的新型视觉大语言模型,用于医学影像识别。该模型在ThoughtMed-1M数据集上进行了训练,该数据集包含超过一百万个问答对,这些问答对源自经过去标识化的医学影像以及在临床医生使用的社交媒体平台上分享的专家评论。FOLTMed在42个医学视觉问答基准测试中表现出最先进的性能,宏观准确率达到85.4%,在事实性和相似性指标上优于现有模型。
-
新的VQA方法提高了医学图像分析的准确性
研究人员开发了一种新颖的混合格式医学视觉问答(VQA)方法,该方法同时改进了多项选择和自由文本输出。该系统包含一个答案文本记忆、一个置换稳定的视觉语言专家和一个稀疏候选扩展路由器。对1403个病例的内部分析表明,该方法将二元路由器的准确性从88.95%提高到91.73%,挽救了56个错误,并实现了96.15%的预言覆盖率。
-
Qwen-Drive-1.0 集成了 3D 感知、VQA 和运动规划,用于自动驾驶
Qwen 推出了 Qwen-Drive-1.0,一个专为自动驾驶设计的视觉语言基础模型。该模型通过利用预训练的 VLM 架构和外部模块,统一了 3D 感知、视觉问答和运动规划。它包含一个鸟瞰视角感知头,用于 3D 对象检测和语义占用预测等任务,以及一个用于生成未来轨迹的规划专家。该模型采用分阶段的配方进行训练,结合了驾驶监督和通用视觉语言数据,以保持广泛的能力。
-
新的 MedReaMM 基准揭示大型多模态模型在临床诊断方面存在困难
研究人员推出了 MedReaMM,这是一个旨在评估大型多模态模型(LMM)在临床环境中诊断综合能力的新基准。与之前侧重于孤立文本或视觉任务的基准不同,MedReaMM 整合了患者病史和多张医学影像,以评估鉴别诊断的准确性。该基准包含 625 个专家验证的病例,结果显示,在接受评估的 23 个 LMM 中,大多数的诊断准确率低于 50%,这凸显了它们在执行专家级临床推理能力方面存在的显著差距。
-
新的基准测试和训练方法提升了多语言 LVLM 的性能
研究人员推出了 PM4Bench,这是一个旨在评估大型视觉语言模型 (LVLM) 多语言能力的新基准测试。该基准测试使用了跨越 10 种语言的平行语料库,并包含一个将文本直接嵌入图像中的视觉设置,模拟现实世界的代理交互。实验表明,光学字符识别 (OCR) 显著影响了跨语言性能差距。为解决此问题,开发了一种使用合成的、无标签数据的以 OCR 为中心的强化学习策略,该策略提高了多语言视觉问答能力并减小了跨语言差异。
-
ENCORE框架通过熵引导裁剪和注意力提升VLM准确性
研究人员开发了ENCORE,一个旨在提升视觉-语言模型(VLM)性能的新框架。ENCORE通过保持物体完整性来解决当前基于Transformer的视觉编码器的局限性,尤其是在轻量级VLM中。该框架在推理过程中采用基于熵的裁剪策略(ECS),以选择熵最小的图像裁剪,从而保留与提示相关的区域。此外,它在训练过程中使用熵正则化训练(ERT)来将注意力集中在关键视觉token上。在十个VQA基准上的实验表明,ENCORE实现了1.43%的平均…
-
更强的教师模型不总能在VLM蒸馏中产生更好的学生模型
一篇新的arXiv论文挑战了这样一种传统观念:在视觉-语言任务的知识蒸馏中,更大、能力更强的“教师”模型能否持续产生更好的“学生”模型。研究人员发现,现有的蒸馏框架在面对更大的教师模型时,往往无法有效扩展,导致在视觉问答等下游应用中的性能下降。这表明需要新的方法来设计参数高效的多模态模型。
-
新研究探索用于大型语言模型推测性解码的并行草稿
两篇新研究论文探讨了大型语言模型推测性解码的进展,重点关注提高并行草稿的效率和连贯性。第一篇论文调查了块并行推测性解码在多模态模型中的适用性,分析了各种架构和基准。第二篇论文介绍了 LiLiCorr,这是一种轻量级方法,通过关联并行草稿的似然性来增强连贯性和接受率,展示了比现有方法显著的吞吐量改进。
-
ArmorOCR框架通过新的AdvSpot基准增强了对抗性OCR感知能力
研究人员推出ArmorOCR,一个新颖的两阶段训练框架,旨在增强光学字符识别(OCR)在对抗性攻击下的鲁棒性。该框架通过提出AdvSpot来解决现有OCR基准的局限性,AdvSpot是第一个专门用于基于基础的对抗性OCR评估的基准,包含390张具有区域级标注的图像,涵盖各种对抗性OCR类型。ArmorOCR利用On-Policy Self-Distillation (OPSD) 从转换后的观测中获取对抗性OCR感知能力,并通过Grou…