visual question answering
PulseAugur coverage of visual question answering — every cluster mentioning visual question answering across labs, papers, and developer communities, ranked by signal.
11 天有情绪数据
-
新研究探索用于大型语言模型推测性解码的并行草稿
两篇新研究论文探讨了大型语言模型推测性解码的进展,重点关注提高并行草稿的效率和连贯性。第一篇论文调查了块并行推测性解码在多模态模型中的适用性,分析了各种架构和基准。第二篇论文介绍了 LiLiCorr,这是一种轻量级方法,通过关联并行草稿的似然性来增强连贯性和接受率,展示了比现有方法显著的吞吐量改进。
-
更强的教师模型不总能在VLM蒸馏中产生更好的学生模型
一篇新的arXiv论文挑战了这样一种传统观念:在视觉-语言任务的知识蒸馏中,更大、能力更强的“教师”模型能否持续产生更好的“学生”模型。研究人员发现,现有的蒸馏框架在面对更大的教师模型时,往往无法有效扩展,导致在视觉问答等下游应用中的性能下降。这表明需要新的方法来设计参数高效的多模态模型。
-
ArmorOCR框架通过新的AdvSpot基准增强了对抗性OCR感知能力
研究人员推出ArmorOCR,一个新颖的两阶段训练框架,旨在增强光学字符识别(OCR)在对抗性攻击下的鲁棒性。该框架通过提出AdvSpot来解决现有OCR基准的局限性,AdvSpot是第一个专门用于基于基础的对抗性OCR评估的基准,包含390张具有区域级标注的图像,涵盖各种对抗性OCR类型。ArmorOCR利用On-Policy Self-Distillation (OPSD) 从转换后的观测中获取对抗性OCR感知能力,并通过Grou…
-
新的智能体框架解决了多页文档视觉问答问题
研究人员推出 Doc-V*,一个无 OCR 的智能体框架,专为多页文档视觉问答而设计。该系统采用粗粒度到细粒度的交互式方法,解决了处理长而视觉密集型文档的挑战。Doc-V* 首先进行广泛概述,然后使用语义检索和定向页面获取来收集证据,这些证据随后在结构化工作内存中进行聚合以进行推理。与检索增强生成基线相比,该框架在各种基准测试中的域外性能提高了高达 47.9%。
-
PerFact方法通过事实提示改进3D脑部MRI报告生成
研究人员开发了一种名为PerFact的新方法,用于从3D脑部MRI扫描生成报告。与以往侧重于改进视觉语言模型本身的方法不同,PerFact强调了提示信息的重要性。通过使用上游3D分割和分类提取结构化事实,PerFact调整视觉语言模型以生成更准确有效的报告。这种方法表明,信息基础(而非模型架构或大小)是提高复杂医学影像报告质量的主要因素。
-
新假说解释隐式多模态上下文内学习
研究人员提出了选择-实现假说(Selection--Realization Hypothesis)来解释隐式多模态上下文内学习(M-ICL)。该假说认为,演示会压缩成内部变化,模型从中进行选择,而模型的计算会约束实现。研究发现,静态任务向量的有效性取决于诱导的变化在查询之间共享的程度。当显式M-ICL表现出简单的加法移位无法恢复的特定于查询或分布式结构时,更复杂的干预是有益的。
-
新型SCOPE-Router优化执行任务的视觉语言模型选择
研究人员开发了SCOPE-Router,一个旨在优化执行导向任务中视觉语言模型(VLM)选择的新系统。该系统通过引入VLM-ExecRouterBench解决了现有VLM路由的局限性,这是首个专门针对代码、代理和搜索领域的路由基准。SCOPE-Router采用双塔架构和成本感知目标函数CRM+RCCR,以根据行为特征和相关成本高效地将查询与模型匹配,即使是对于新的、未见过的模型。
-
新的LHSDet方法使用VQA检测高分辨率AI生成图像
研究人员开发了LHSDet,一种检测高分辨率AI生成图像的新方法。该方法将检测任务重新构建为视觉问答问题,利用了视觉-语言框架。LHSDet采用独特的三分支架构,结合了图像块的低级视觉特征、高级全局感知特征以及文本标题的语义特征,以有效识别来自各种模型(包括扩散和自回归类型)的AI生成图像中的伪影。
-
推出新的波兰视觉语言基准 PoVisLE
研究人员推出 PoVisLE,一个旨在评估波兰视觉语言模型 (VLM) 的新基准。与现有主要以英语为中心并侧重于表面识别的基准不同,PoVisLE 旨在评估波兰语境下更深层次、文化基础的多模态理解。该数据集包含 1,117 张图像和 2,366 个手动标注的视觉问答对,为评估 VLM 超越基本图像字幕或文本生成提供了受控资源。
-
MetaSpace框架测试具身AI智能体的空间认知能力
研究人员推出MetaSpace,一个用于评估具身智能体空间认知能力的新颖框架。该系统应用了软件工程中常用的变形测试(metamorphic testing)原理,通过逻辑规则和物理定律自动生成测试用例。通过将这些原理编码到Prolog中,MetaSpace通过检测预定义的变形关系(metamorphic relations)的违本来识别空间认知中的失败。在三个场景的评估中,MetaSpace在最先进的多模态大型语言模型(MLLM)驱动…
-
新框架应对长文档和演进式文档理解挑战
研究人员开发了新的框架来应对理解长文档和演进式文档的挑战。InSight-doc 是一个代理式视觉感知框架,能自适应地分配视觉分辨率,以提高文档视觉问答的准确性并降低延迟。另外,TIDE 对大型语言模型在时间演进式文档上的表现进行基准测试,突显了其在版本解析和时间准确性方面的显著弱点。DocAtlas 提出了一种可变状态交互方法,将文档理解视为一个信息检索过程,并提供了搜索、阅读和笔记记录等工具,在基准测试中表现出改进的性能。
-
板载视觉语言模型通过对话实现带宽高效的地球观测
研究人员开发了一种新颖的“先总结,后下载”范式,用于地球观测卫星,利用板载视觉语言模型(VLMs)来解决带宽限制。该方法包括卫星生成其传感器数据的自然语言摘要,然后地面操作员发出有针对性的视觉问答(VQA)查询以确认相关性。之后,仅下载关键信息,将数据传输转变为语义感知的对话,从而显著减少带宽消耗,并加速对时间敏感任务的洞察时间。该系统已成功在NVIDIA Jetson平台上实现并进行了测试。
-
新基准评估多模态模型在实时灾害情报方面的能力
研究人员推出了 Obshazard-bench,这是一个旨在评估多模态基础模型如何处理原始地球观测数据以实现实时灾害情报的新基准。与使用已处理数据的现有基准不同,Obshazard-bench 集成了直接的卫星和地面站观测、历史灾害记录和社会经济指标。该基准涵盖了 60 多个国家/地区的 8 类灾害,并包含一个与操作性灾害工作流程(从预期到影响评估)相一致的三阶段评估分类法。初步实验表明,当前的基础模型在将原始多通道物理观测转化为与决…
-
新基准揭示多模态大语言模型在多步空间推理方面存在困难
一个名为 LEGO-Puzzles 的新基准已被开发出来,用于评估多模态大语言模型(MLLMs)的多步空间推理能力。研究人员发现,即使是最先进的 MLLMs 在基本空间理解和规划任务上也表现不佳,其表现远逊于人类。随着空间推理所需复杂性和步骤的增加,这些模型的性能会迅速下降,凸显了它们当前能力的重大局限性。
-
新的LoMeVQA基准揭示多模态大语言模型在纵向医学推理方面存在困难
研究人员推出LoMeVQA,一个旨在评估多模态大语言模型(MLLMs)在纵向医学视觉问答能力的新基准。该基准包含超过206,000个VQA对,涵盖了与评估疾病进展和随时间推移的治疗反应相关的五个不同任务。初步评估表明,当前MLLMs在医学背景下的时间推理方面存在困难,凸显了显著的局限性。为解决此问题,该团队还开发了MedLong-8B模型,该模型在LoMeVQA基准上展现了最先进的性能。
-
新的DMCoStain框架提高了组织病理学染色转移的准确性
研究人员开发了DMCoStain,一个用于组织病理学染色转移的新框架,该框架迭代地优化训练数据和模型本身。这种方法旨在提高从苏木精和伊红(H&E)图像生成免疫组织化学(IHC)图像的准确性和可解释性,这对于分子信息至关重要,但直接获取成本高昂。该框架采用多模态专家指导的精细选择(MEGFS)策略,该策略由在ImmunoInstruction数据集上训练的视觉语言模型提供支持,该模型模仿病理学家对IHC阳性表达的推理。实验表明,DMCo…
-
AI毒性检测未能惠及边缘群体,需要社区特定方法
一篇新的研究论文认为,当前用于AI生成图像的毒性检测器不足,尤其对边缘化社区而言。研究强调,一种通用的方法未能识别出针对侏儒症或视力障碍等群体的有害内容,在某些情况下,检测器的表现甚至不如随机猜测。该论文提出了社区特定毒性检测(CTD),并证明像上下文学习(ICL)和参数高效微调(PEFT)这样的方法可以显著提高检测准确性,尽管仍需要持续的研究。
-
新型DDVT网络提升视觉问答准确性
研究人员开发了一种名为动态双层视觉Transformer融合网络(DDVT)的新型网络架构,用于视觉问答中的答案定位。该方法旨在通过结合图像上下文和文本内容,精确地定位与给定问题相关的图像区域。DDVT利用一个问题引导的动态区域级模块和一个跨模态多尺度聚合模块来融合像素级和区域级特征,最终提高答案定位的准确性。
-
新的Best-of-Evidence框架通过部分验证改进AI模型选择
研究人员开发了一个名为Best-of-Evidence (BoE)的新框架,以改进模型输出的选择,特别是在视觉-语言任务中,这些任务的候选者并非总是可以完全验证。BoE解决了部分验证的场景,在这种场景下,只有响应的特定方面可以被检查,并且声明可能出现在具有冲突立场的多个候选者中。该框架利用候选因子图和有限的证据行动预算来优化最终选择,理论上展示了剩余证据能力如何影响改进以及共享查询如何提供效率提升。
-
新方法利用 OCR 和 VQA 进行精确的产品列表验证
本文详细介绍了一种新的产品列表验证方法,该方法侧重于特定特征而非通用相似度得分。作者提出了一个“特征词典”,将品牌、尺寸和型号等产品属性分解。利用光学字符识别 (OCR) 和视觉问答 (VQA) 直接从产品图像中提取这些信息,从而能够更精确地与列表描述进行匹配。该方法旨在克服 CLIP 和 BLIP 等模型在细粒度属性不匹配方面存在的局限性。