Vision--Language Models
PulseAugur coverage of Vision--Language Models — every cluster mentioning Vision--Language Models across labs, papers, and developer communities, ranked by signal.
22 天有情绪数据
-
Llama-Mobile 框架实现了面向移动设备的高效 VLM 量化
研究人员开发了 Llama-Mobile,一个用于量化视觉语言模型 (VLM) 的框架,使其适合在移动设备上部署。该方法使用模型本身生成训练数据,并采用一种新颖的每参数 2.7 位格式,该格式针对 Arm CPU 进行了优化。该方法成功应用于压缩 Llama 3.2 11B Vision Instruct 模型至 3.7 GB,同时在视觉问答任务上保持了强大的性能。
-
新型视觉语言模型V-REX在兽医放射学领域以高效训练表现出色
研究人员开发了V-REX,这是一种专门为兽医放射学训练的新型视觉语言模型(VLM)。与依赖微调大型通用模型不同,V-REX证明了通过高效工程可以创建一个专业模型,其性能优于更大、更通用的模型。这种专业化的VLM使用显著更少的数据、参数和计算资源,在生成兽医放射照片的诊断报告方面取得了卓越的性能。
-
新的代理系统简化文档处理和图表生成
研究人员开发了DocClaw,这是一个统一的代理系统,旨在在单一框架内处理各种智能文档处理任务,如光学字符识别和文档问答。该系统允许代理与文档交互,通过调用相关工具并整合观察结果来逐步完善信息。此外,AutoFigure被介绍为一个用于根据文本描述生成科学图表的工具包,能够为代理文档智能系统等复杂流程创建图表。
-
MAVEN框架评估AI与社会价值观的对齐程度
研究人员推出MAVEN,一个旨在评估多模态内容与和平、正义等宏观社会价值观对齐程度的新框架。该分层框架将价值观组织成6个主要维度和72个次级指标,支持多层次量化评分。MAVEN包含一个经过人类验证的多模态基准和一个用于评估视觉-语言模型(VLM)的软匹配指标。在基准上对现有VLM进行的实验揭示了它们在价值观判断上的显著差异,并且一个紧凑的2B评估器展示了与更大模型和前沿闭源VLM相当的性能。
-
VLMs 无法遵守自身的推理规则,而人类可以
一项新的研究论文介绍了一个分级颜色归因(GCA)数据集,用于研究视觉语言模型(VLMs)的可靠性。研究发现,虽然 VLMs 可以准确评估颜色覆盖率等视觉信息,但它们经常与其自身陈述的推理规则相矛盾。相比之下,人类参与者在遵循内省规则方面表现出更大的忠实度,其偏差是由认知偏见解释的,而不是推理失败。这种差异凸显了 VLM 自我知识的校准不当,对其在高风险应用中的可靠部署构成了挑战。
-
新的MemJack框架利用自然图像进行视觉语言模型越狱
研究人员开发了MemJack,一个旨在利用自然图像测试视觉语言模型(VLMs)安全性的新颖框架。这个记忆增强的多智能体系统在良性图像中发现可重复使用的视觉锚点,以制造越狱攻击。MemJack还催生了MemJack-Bench,一个包含超过113,000个多模态越狱轨迹的数据集,用于评估和改进VLMs的安全对齐。在测试中,MemJack表现出显著的有效性,在Qwen3-VL-Plus上实现了71.48%的攻击成功率,并突显了当前安全对齐…
-
开放模型在高风险公共部门数据提取方面面临挑战
一项新的研究论文评估了包括OCR、LLM和VLM在内的开源模型在处理高风险公共部门应用中的结构化信息提取性能。研究发现,尽管视觉语言模型(VLMs)的整体表现优于传统的OCR+LLM流程,但即使是顶尖的开放模型在零样本(zero-shot)设置下也难以保证可靠性。研究强调,模型规模与性能并非线性相关,并着重指出了输入质量,特别是OCR输出的结构完整性,在实现准确结果方面起着至关重要的作用。
-
RoboMirror框架使用视频理解来实现人形运动
研究人员开发了RoboMirror,一个新颖的人形运动框架,它优先考虑视觉理解然后进行模仿。与依赖精选动作捕捉或稀疏文本命令的先前方法不同,RoboMirror使用视觉语言模型(VLMs)来解释视频并生成运动意图。这种方法绕过了显式姿态重建或重定向的需要,从而产生了更具物理合理性和语义一致性的运动。实验表明,与现有方法相比,RoboMirror显著降低了控制延迟并提高了任务成功率。
-
新的AeroGround基准揭示了视觉语言模型(VLM)在空地推理方面存在显著差距
研究人员推出了AeroGround,这是一个旨在评估视觉语言模型(VLM)在空地协同推理任务中的新基准。该基准包含一个模拟数据集,约有29,000个多模态观测组和2,250个问答实例,侧重于跨视图对应、空间理解和推理。目前的VLM与人类相比表现出显著的性能差距,最佳模型的准确率仅为54.4%,凸显了对更强大的空地协同具身智能系统的需求。
-
AI框架集成LLM和VLM,实现CT扫描的自动化分析
研究人员开发了INFORM-CT,一个集成了大型语言模型(LLMs)和视觉语言模型(VLMs)的新型框架,用于自动化腹部CT扫描中意外发现的检测、分类和报告。该方法使用基于LLM的规划器生成用于分析的Python脚本,然后由采用VLM和分割模型的系统执行。在腹部CT基准数据集上的实验表明,INFORM-CT在管理这些意外发现的准确性和效率方面优于现有的仅VLM方法。
-
新的CBM方法减少了可解释癌症影像的标注负担
研究人员开发了一种新的方法,使用概念瓶颈模型(CBM)进行可解释的癌症影像诊断。该方法整合了有限的概念标注、类别条件分布匹配和先验初始化,以提高透明度。混合CBM在概念AUC方面显示出显著的提升,尤其是在低标注场景(0-20%)下,同时保持了与黑盒模型相当的诊断性能。
-
新型防御 QuISE 旨在对抗视觉语言模型上的字体攻击
研究人员开发了 QuISE,一种针对视觉语言模型(VLM)上的字体攻击的新型防御机制。这种模型无关且无需训练的方法,通过语义编辑图像中可能影响 VLM 对给定查询响应的文本区域来工作。通过将这些关键文本区域替换为与查询无关的内容并检查答案的一致性,QuISE 旨在减轻对抗性文本线索的影响。实验表明,QuISE 在各种攻击场景和 VLM 中提高了准确性。
-
新的ARMDIL系统使用MLLM来提升跨数据集图像分类能力
研究人员推出ARMDIL,一个旨在提高跨不同数据集图像分类能力的新型系统。ARMDIL利用多模态大语言模型(MLLM)智能地将图像路由到异构集合中最合适的视觉骨干网络。该集合包括各种架构,如ResNets、自监督学习模型和视觉语言模型,所有这些模型都在源自具有不同特征的多个数据集的统一标签空间上进行训练。该系统展示了增强的适应性和可解释性,为AI助手和自主机器人等应用的更可靠的通用视觉系统提供了途径。
-
新的 40 亿参数视觉语言模型面向 3D MRI 分析
研究人员开发了 Mr3D-VL,这是一种新的 40 亿参数视觉语言基础模型,专门用于多参数 3D 磁共振成像 (mpMRI)。该模型通过实现对复杂 3D 空间数据的自然语言交互和可解释性,解决了当前 AI 的局限性,这对于脑肿瘤诊断至关重要。Mr3D-VL 通过共享的 3D 编码器和跨模态投影层整合了多种成像模态和特征,在文本生成任务中表现优于现有模型,BERTScore 达到 0.856。
-
新的VLM后门允许任意、可编程的控制
研究人员开发了一种在视觉语言模型(VLMs)中植入可编程后门的新颖方法。与以往的静态后门攻击不同,这项新技术允许攻击者在推理时动态控制目标字幕并生成相应的触发器,即使对于未见的语义也是如此。该攻击涉及一种启发式投毒策略,用于教会模型一个通用的触发器即指令规则,然后采用一种特征空间隐写术方法将任何目标字幕映射到一个隐蔽的视觉触发器。这种方法保持了模型的干净效用,并证明了其对常见后门防御的有效性。
-
揭示了用于高效视觉令牌压缩的 VLM 新方法
两篇新研究论文提出了用于压缩视觉语言模型 (VLM) 中视觉令牌以提高效率的方法。第一篇论文《并非所有视觉令牌都可以安全移除》(Not All Visual Tokens Are Equally Safe to Remove)引入了一种考虑后果的方法,优先为潜在错误成本较高的请求进行视觉计算。第二篇论文《VisionSelector》提出了一个端到端可学习的框架,该框架能够自适应地识别关键令牌,其性能优于启发式方法,并显著加快了推理速度。
-
新的基准和数据集评估VLM在诊断番茄叶病害方面的能力
研究人员推出了TomaMMU,一个用于理解番茄叶病害的大规模数据集,以及TomaBench,一个旨在评估视觉语言模型(VLM)在此任务上的基准。该数据集包含超过28,000张图像和超过200,000个带注释的问答对,分为七个农业任务。初步评估显示,当前最先进的VLM在该领域存在细粒度识别和事实性推理方面的困难,尽管在TomaMMU上进行简单的微调显著提高了性能。
-
板载视觉语言模型通过对话实现带宽高效的地球观测
研究人员开发了一种新颖的“先总结,后下载”范式,用于地球观测卫星,利用板载视觉语言模型(VLMs)来解决带宽限制。该方法包括卫星生成其传感器数据的自然语言摘要,然后地面操作员发出有针对性的视觉问答(VQA)查询以确认相关性。之后,仅下载关键信息,将数据传输转变为语义感知的对话,从而显著减少带宽消耗,并加速对时间敏感任务的洞察时间。该系统已成功在NVIDIA Jetson平台上实现并进行了测试。
-
新的基准测试DATAREEL揭示VLM在自动视频故事生成方面存在困难
研究人员推出了DATAREEL,这是一个旨在评估视觉语言模型(VLM)自动生成数据驱动视频故事能力的新基准测试。该基准测试包含328个真实世界的数据卷轴,并评估模型根据给定的数据表、沟通意图和风格参考创建可执行动画及同步字幕的能力。初步评估显示,专有模型和开放权重模型之间存在显著的性能差距,后者经历了很高的执行失败率。即使是最好的模型在生成静态图表、不同步字幕和不一致布局方面也存在困难,这表明自动数据视频生成任务远未解决。
-
新的SABRE框架自动化视觉语言模型的压力测试
研究人员开发了SABRE,一个新设计的自动化流程,用于为视觉语言模型(VLMs)创建压力测试。该框架将任务设计转换为结构化规范、图像和问答对,并进行自动化过滤以移除可解的候选。一项应用SABRE-Prior被用来测试六个VLMs对世界知识而非视觉证据的依赖性,显示平均准确率在17.8%到31.3%之间。SABRE旨在成为一个可重用的工具,用于构建和更新VLM压力测试。