Visual Grounding with Multi-modal Conditional Adaptation
PulseAugur coverage of Visual Grounding with Multi-modal Conditional Adaptation — every cluster mentioning Visual Grounding with Multi-modal Conditional Adaptation across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
新的CURV框架通过视觉推理增强AI图表理解能力
研究人员开发了CURV,一个新颖的课程学习框架,旨在提高多模态大语言模型(MLLMs)在图表问答(CQA)方面的视觉基础推理能力。CURV将CQA重新构建为多步视觉推理过程,通过空间注意力集中整合逻辑推理和动态视觉基础。为了支持该框架,创建了一个名为CCQA的新数据集,该数据集具有三级课程,并可进行可扩展的合成生成,以适应各种图表类型和推理复杂性。实验表明,CURV的性能显著优于现有方法,在CQA任务上取得了高达20.50%的提升,并…
-
新基准RRS-10K测试视觉-语言模型在稀有遥感图像上的表现
研究人员推出了RRS-10K,这是一个新的基准,旨在评估视觉-语言模型(VLMs)在稀有和专业遥感图像解释任务上的性能。该基准包含超过10,000张与军事相关的图像,配有问答对,并按感知、推理和鲁棒性维度进行组织。对52个模型的初步评估显示,当前的VLMs在零样本性能方面表现一般,并且在视觉基础、指代分割和复杂语义推理方面存在困难,这突显了未来模型开发的领域。
-
新的ST-Veto方法将dMLLM的推理准确率提高了9%
研究人员推出了一种新颖的免训练方法ST-Veto,旨在增强扩散多模态大语言模型(dMLLMs)的推理能力。该方法利用了模型在每个扩散步骤中同时处理所有令牌位置的能力。ST-Veto通过使用置信度动态的二阶泰勒预测来识别和否决时间上不稳定的令牌,并通过过滤基于图像注意力质量的弱基础令牌来工作。在各种dMLLMs和多模态推理基准测试中,ST-Veto均表现出持续的改进,在不产生额外训练或生成成本的情况下,将准确率提高了高达9%。
-
PhaseWin算法增强了AI模型解释的视觉归因能力
研究人员推出了一种名为PhaseWin的新型算法,旨在提高解释视觉和视觉-语言模型的可视归因方法的效率和忠实度。与需要大量模型评估的现有贪婪方法不同,PhaseWin采用分阶段窗口搜索策略。该方法在全局筛选、剪枝和局部精炼之间交替进行,以实现线性评估复杂性,同时保持接近贪婪的忠实度。在图像分类和字幕生成等各种任务上的实验表明,与其它归因技术相比,PhaseWin能够以显著减少的前向传播次数达到高忠实度。