Large Vision-Language Model
PulseAugur coverage of Large Vision-Language Model — every cluster mentioning Large Vision-Language Model across labs, papers, and developer communities, ranked by signal.
-
新方法通过自适应检索和智能恢复增强视觉文档问答
研究人员开发了新的方法来改进视觉文档问答(DocVQA)和基于知识的视觉问答(KB-VQA)。ViSAR 引入了一种自适应检索技术,可以动态选择要检索的文档页数,将延迟最多降低 58.7%,同时保持准确性。DocIntent 专注于降级文档的智能恢复,评估问题的可回答性并选择性地应用恢复工具以提高 MLLM 的性能。另一种方法将 KB-VQA 重构为搜索-智能体问题,允许智能体决定何时搜索、优化查询或停止,从而在 InfoSeek 和…
-
新的UniME-R1框架通过反馈驱动的推理改进多模态检索 · 跟踪2个来源
研究人员开发了UniME-R1,这是一个新颖的框架,旨在通过将检索反馈纳入推理过程来增强统一多模态检索。与以往仅依赖基于查询的思维链(CoT)的方法不同,UniME-R1的顾问分析初步检索到的候选对象,以识别混淆点并生成检索中心化思维链(RC-CoT)。这种方法可以优化检索方向,并在MMEB-V2等基准测试中提高性能。
-
TextGaze 使用 LVLM 进行注视点估计 · arXiv cs.CV
研究人员推出了一种新颖的注视点估计架构 TextGaze,该架构利用大型视觉语言模型 (LVLM) 进行语义引导。该方法旨在克服现有方法的局限性,这些方法要么需要大量的标注,要么仅关注低级视觉显著性。TextGaze 提取视觉特征,并采用 LVLM 生成与注视对齐的文本线索,通过具有分层文本监督的基于 Transformer 的融合模块进行处理。该模型能够高效地预测注视热图以及帧内/帧外状态,在四个主流数据集上展示了具有竞争力的性能和…