Vision--Language Models
PulseAugur coverage of Vision--Language Models — every cluster mentioning Vision--Language Models across labs, papers, and developer communities, ranked by signal.
15 天有情绪数据
-
AI 模型 CADReasoner 通过迭代式程序编辑改进 CAD 逆向工程
研究人员开发了 CADReasoner,这是一种新颖的、专为计算机辅助设计 (CAD) 逆向工程设计的 AI 模型。与之前的单次遍历系统不同,CADReasoner 通过分析输入形状与其重建之间的几何差异来迭代地改进其预测。该模型生成可运行的 CadQuery Python 代码,然后使用该代码渲染下一迭代的网格。通过融合多视图渲染和点云,并采用扫描-模拟协议,CADReasoner 在多个基准测试中取得了最先进的结果。
-
新理论解释了为什么视觉语言模型(VLM)会漏掉小物体
一篇新发表在arXiv上的理论和实证研究,探讨了视觉语言模型(VLM)为何在大型图像中难以检测小物体。该研究指出了与每个物体对应的视觉标记数量以及AI必须处理的内容相关的关键限制。研究提出,虽然更好的模型可以提高物体识别的标记效率,但处理图像内容的根本成本仍然存在。研究表明,图像分解(一种经典方法)在特定条件下仍然有效,并且其性能接近于大型图像的理论极限。
-
多模态大语言模型通过BraVista框架学会解码脑信号
研究人员开发了BraVista,一个利用多模态大语言模型(LLMs)从脑电图(EEG)解码脑信号的新型框架。该方法将EEG数据编码成结构化图像,使通用领域的视觉-语言模型能够在没有大量EEG特定预训练的情况下执行多任务学习。BraVista在睡眠分期、情绪识别、认知负荷分类和异常EEG检测等任务中表现出色,显示了其在统一EEG解码方面的潜力。
-
ElasticFit 框架通过 VLM 推理增强 3D 对象插入
研究人员开发了 ElasticFit,一个旨在改进将对象插入 3D 场景过程的新框架。该系统利用视觉语言模型 (VLM) 来理解语义意图和物理合理性,同时提供精确的几何控制。ElasticFit 生成结构化的拟合线索,将高级推理转化为明确的 3D 约束,从而能够将对象刚性放置、均匀缩放或弹性拟合以匹配场景的几何形状。与现有方法相比,该框架在空间关系和支撑成功率方面均有显著提高。
-
新的 ScribbleEdit 基准凸显了 VLM/LLM 在基于涂鸦的图像编辑方面的挣扎
研究人员推出了 ScribbleEdit,这是一个旨在评估视觉语言模型 (VLM) 和大型语言模型 (LLM) 在仅基于用户涂鸦执行图像编辑任务方面的能力的新基准。当前模型在此类输入方面存在困难,通常无法准确解释用户意图和仅凭涂鸦获得的空间信息。ScribbleEdit 基准包含一个自动数据构建管道和一个特定的评估协议,用于衡量意图对齐,揭示了现有基于 VLM/LLM 的编辑模型存在的显著缺陷。为了解决这些局限性,研究人员提出了一种软…
-
新AI套件通过分层指导增强主动式辅助
研究人员推出了ProactiveCoach套件,旨在增强AI助手提供及时且符合上下文的指导的能力。该套件包括用于训练的ProactiveCoach-Instruct、用于评估的ProactiveCoachBench,以及具有自适应指导系统的微调视觉语言模型(VLMs)。该系统旨在通过在阶段、步骤和操作级别提供分层结构化指导来解决现有数据集的局限性,从而更好地理解任务进度和程序上下文。
-
2D VLMs 通过新的基础和反馈框架得到增强,以适应 3D 任务
研究人员开发了一个名为 3D-Prog 的新框架,该框架增强了现有 2D 视觉语言模型 (VLMs) 的 3D 理解和操作能力。该框架引入了两个关键概念:用于统一 3D 表示的规范坐标框架 (CCF) 和用于迭代精化的任务自适应反馈 (TAF)。通过集成这些组件,2D VLMs 可以在无需重新训练的情况下执行各种 3D 任务,包括理解、操作和生成。
-
视觉语言模型在图像选择裁判方面表现不佳
一篇新的研究论文探讨了视觉语言模型(VLM)在充当裁判根据提示选择图像时的可靠性。研究发现,一个4B参数的VLM的表现仅略好于随机猜测,并且表现出明显的偏向于选择第一个呈现的图像。即使是8B参数的模型,虽然偏见较小,但也需要仔细过滤其决策以确保质量。研究强调,当VLM裁判更新时,需要重新审计它们,因为它们的决策过程可能会发生变化。
-
新的RelationVGGT框架实现了3D空间关系分割
研究人员推出了一种新颖的用于3D空间关系分割的框架RelationVGGT。该系统在一个前馈、无姿态的多视图设置中运行,能够根据指定的主体和关系文本查询来分割目标,而无需目标类别名称。RelationVGGT集成了来自视觉基础模型的语义特征和来自3D几何基础模型的几何感知表示,并利用关系Transformer进行跨视图预测。该框架还包括一个基于ScanNet++和视觉语言模型(VLMs)以及大型语言模型(LLMs)构建的自动化标注管道…
-
新的GRDisaster框架使用VLMs结合众包图像进行灾难测绘
研究人员开发了GRDisaster,一个新颖的框架,旨在利用视觉语言模型(VLMs)分析众包图像以进行灾难测绘。该框架通过整合确定性和概率性的跨视图地理定位以及多视图融合,解决了众包数据非结构化和地理位置模糊的挑战。GRDisaster还引入了空间推理指标来验证地理定位并评估灾难损坏程度,旨在增强VLM输出在地理空间人工智能应用中的可解释性。
-
新的PRISM框架使用范畴论来改进AI生成的类比
研究人员推出PRISM,一个基于范畴论的新框架,旨在测量和改进多模态类比。该系统在视觉隐喻生成方面进行了评估,使用“拉回分数”来量化关系对齐,仅凭此分数在AnaloBench基准测试中达到82.5%的准确率。PRISM还包含一个迭代改进循环,使用拉回分数作为反馈来增强图像的一致性和恰当性,人类评估显示在超过57%的情况下更偏好改进后的输出,尽管定性分析指出存在视觉上拥挤的构图倾向。
-
新的 R-GroundBench 基准揭示 AI 在复杂化学编辑方面存在困难
一个名为 R-GroundBench 的新基准已被开发出来,用于评估 AI 理解和编辑具有可变 R-基团占位符的化学结构的能力,这些结构常见于药物专利中。目前的 AI 模型在较简单的任务上表现良好,但在更复杂的场景中却面临显著困难,这表明它们在 Markush 编辑方面的可靠结合和执行能力存在差距。该基准突显了 AI 驱动的化学科学发现所面临的挑战。
-
Foresight架构赋能流式视觉语言模型中的主动感知
研究人员开发了FORESIGHT,一种用于流式视觉语言模型(VLMs)的新型双流架构,可在无需重新训练的情况下实现主动感知。通过使用两个具有共享权重的Siamese LLM,一个LLM处理传入的视觉数据,另一个则预测未来事件并相应地规划计算资源。这种方法允许模型根据不断变化的场景动态调整其感知策略,从而在OmniPro Online、StreamingBench和OVO-Bench等基准测试中取得显著的性能提升。
-
论文回顾语言在视频动作预测中的整合
一篇新发表在arXiv上的论文回顾了语言增强视频动作预测领域,该任务专注于从部分视频数据中预测未来人类动作。作者提出了一个证据感知的设计图谱来组织现有研究,并阐明了整合语言模型(LLMs)和视觉语言模型(VLMs)的好处。他们还引入了一个比较和消融不同模型组件的协议,强调了由于实验设置差异导致的解释报告收益中的挑战。
-
XEmbodied基础模型通过3D几何增强VLA系统
研究人员推出XEmbodied,一个旨在通过整合几何和物理线索来增强视觉-语言-动作(VLA)模型的新型基础模型。与目前在2D图像-文本数据上训练的现有模型不同,XEmbodied通过结构化的3D适配器和高效图像-具身适配器整合了3D几何感知和物理信号。这种方法旨在弥合通用VLM能力与复杂具身环境的特定需求之间的差距,从而提高在空间推理、交通语义和具身问答相关基准上的性能。
-
字体攻击利用视觉语言模型进行AI生成图像检测
研究人员发现,用于检测AI生成图像的视觉语言模型(VLM)存在漏洞。研究表明,字体攻击(通过微妙地改变图像中的文本)会误导这些模型将图像分类错误。这种漏洞在各种类型的VLM中都观察到,包括开源模型和商业模型,其中较大的模型在干净数据上显示出更高的准确性,并且更容易受到这些攻击的影响。
-
新研究发现,视觉语言模型在处理碎片化场景时遇到困难
一篇题为“组合,而非对话:视觉语言模型丢失场景,而非线索”的新研究论文探讨了视觉语言模型(VLMs)在面对碎片化视觉信息时的局限性。该研究引入了Layered-VQA,一个包含93个场景和300个问题的数据集,其中图像被分解为RGBA层。对十一个开源模型和两个专有模型的实验显示,在组合、定位和证据利用方面存在持续的失败。研究结果表明,虽然分解问题影响较小,但分解场景会显著降低VLM的准确性,这表明视觉证据的呈现方式对模型性能至关重要。
-
合成数据管道 VisionFoundry 提升 VLM 感知技能 · 已追踪 2 个来源
研究人员开发了 VisionFoundry,这是一个自动化管道,利用大型语言模型(LLM)和文本到图像模型来生成用于训练视觉语言模型(VLM)的合成视觉感知数据。这个名为 VisionFoundry-10k 的合成数据集在空间理解和视角识别等感知基准测试中,持续提高了 VLM 的性能,甚至优于在自然图像上训练的模型。该方法具有可扩展性和有效性,证明了合成监督可以显著增强 VLM 的能力。
-
新的PhysVista基准测试视觉语言模型的物理智能
研究人员推出了PhysVista,一个旨在评估视觉语言模型(VLMs)物理智能的新基准。该基准通过一个整体的认知循环来评估VLMs,整合了感知、推理和物理判断,这与以往碎片化的方法不同。使用PhysVista对各种VLMs进行的实验揭示了它们在理解物理动力学和合理性方面存在显著局限性,表明视觉识别与真正的物理理解之间存在差距。
-
新的VLALight模型改进了紧急车辆的交通信号响应
研究人员开发了VLALight,一个新颖的轻量级框架,专为紧急情况感知交通信号控制而设计。该端到端系统直接将来自多个摄像机视图的视觉输入和文本指令映射到离散的信号动作,绕过了像图像到文本转换这样的中间步骤。VLALight使用了一个紧凑的5亿参数模型,能够在本地硬件上实现实时运行,并在紧急车辆服务方面展示了卓越的性能,与之前的级联模型相比,等待时间减少了21.1%。