PulseAugur
中
实时 21:44:30
实体 Large Vision-Language Model

Large Vision-Language Model

PulseAugur coverage of Large Vision-Language Model — every cluster mentioning Large Vision-Language Model across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 3
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
  1. RESEARCH · CL_228802 ·

    新方法通过自适应检索和智能恢复增强视觉文档问答

    研究人员开发了新的方法来改进视觉文档问答(DocVQA)和基于知识的视觉问答(KB-VQA)。ViSAR 引入了一种自适应检索技术,可以动态选择要检索的文档页数,将延迟最多降低 58.7%,同时保持准确性。DocIntent 专注于降级文档的智能恢复,评估问题的可回答性并选择性地应用恢复工具以提高 MLLM 的性能。另一种方法将 KB-VQA 重构为搜索-智能体问题,允许智能体决定何时搜索、优化查询或停止,从而在 InfoSeek 和…

  2. RESEARCH · CL_186966 ·

    新的UniME-R1框架通过反馈驱动的推理改进多模态检索 · 跟踪2个来源

    研究人员开发了UniME-R1,这是一个新颖的框架,旨在通过将检索反馈纳入推理过程来增强统一多模态检索。与以往仅依赖基于查询的思维链(CoT)的方法不同,UniME-R1的顾问分析初步检索到的候选对象,以识别混淆点并生成检索中心化思维链(RC-CoT)。这种方法可以优化检索方向,并在MMEB-V2等基准测试中提高性能。

  3. TOOL · CL_141737 ·

    TextGaze 使用 LVLM 进行注视点估计 · arXiv cs.CV

    研究人员推出了一种新颖的注视点估计架构 TextGaze,该架构利用大型视觉语言模型 (LVLM) 进行语义引导。该方法旨在克服现有方法的局限性,这些方法要么需要大量的标注,要么仅关注低级视觉显著性。TextGaze 提取视觉特征,并采用 LVLM 生成与注视对齐的文本线索,通过具有分层文本监督的基于 Transformer 的融合模块进行处理。该模型能够高效地预测注视热图以及帧内/帧外状态,在四个主流数据集上展示了具有竞争力的性能和…