Video-Language Models
PulseAugur coverage of Video-Language Models — every cluster mentioning Video-Language Models across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
新基准 DrivelHub+ 测试 AI 对社交媒体视频细微差别的理解能力
一个名为 DrivelHub+ 的新基准已被引入,用于评估视频语言模型理解社交媒体视频中隐含和非字面意义的能力。该基准包含 1,000 个标注视频,旨在测试上下文多模态推理能力,超越简单的识别或描述。DrivelHub+ 评估模型在解释视频的语用理解以及通过检索任务将视频内容与隐含叙事对齐方面的能力。
-
新基准评估视频语言模型在长篇描述方面的能力
研究人员推出了CLIP-CC-Bench,这是一个新的评估套件,旨在评估视频语言模型生成视频内容的详细、段落长度描述的能力。该基准源自电影场景,将大约90秒的剪辑与专家撰写的叙述性描述配对。评估利用了五个基于LLM的嵌入模型组成的集成,通过粗粒度和细粒度的语义匹配来比较生成的描述与参考文本,结果表明当前模型在细致、长篇的视频叙述方面存在困难。
-
TOPReward 使用 VLM 令牌概率进行机器人学习奖励
研究人员开发了 TOPReward,这是一种新颖的方法,可以在无需手动注释或特定任务奖励模型的情况下,为机器人学习生成密集的、指令驱动的反馈。该方法利用预训练视频语言模型 (VLM) 的内部令牌概率来衡量任务进度,有效地将潜在理解转化为可用的奖励信号。TOPReward 在真实世界操作基准和 Open X-Embodiment 数据集上表现强劲,优于其他无需训练的 VLM 奖励方法,并显示出与训练奖励模型的竞争力。
-
PhysMRV框架在无需训练的情况下增强了VLM的物理推理能力
研究人员开发了PhysMRV,一个旨在增强视频-语言模型(VLM)物理合理性推理能力的新型框架。这种无需训练的方法将视频转换为一个结构化的内存库,包含场景描述、物理事件图和物理规则摘要。在推理过程中,PhysMRV利用这些结构化内存来指导冻结的VLM验证物理合理性,在无需任何模型微调的情况下,在各种VLM和基准测试中均表现出一致的改进。
-
新基准和方法改进了生态数据的文本到视频检索
研究人员推出了 Prompting-MammAlps,这是一个专为相机陷阱数据设计的、用于细粒度文本到视频检索的新基准。该基准旨在解决当前视频语言模型 (VLM) 在生态学背景下的局限性。所提出的方法利用视觉 Transformer 进行时空动作定位,并将其输出转换为结构化文本,然后由大型语言模型 (LLM) 编码代理进行处理以进行检索。据报道,该方法在测试集上达到了 34% 的基于集合的 F1 分数,显著优于得分为 18% 且缺乏可…
-
新的CycliST基准测试视频语言模型在循环推理方面的能力
研究人员推出了一款名为CycliST的新基准数据集,旨在测试视频语言模型(VLMs)在理解和推理循环状态转换方面的能力。该数据集包含合成视频序列,其中物体运动和视觉属性呈现周期性模式,并通过物体数量、场景混乱度和光照的变化来增加复杂性。对当前VLMs进行的实验揭示了它们在检测周期性模式、时间理解和提取量化见解方面存在显著局限性,表明这些模型在时空认知方面存在差距。
-
新框架通过灵活的文本输入增强视频-语言模型
研究人员提出了一个新框架,通过解决文本输入的局限性来改进视频-语言模型(VLM)。当前的VLM通常依赖预定义的文本模板,这些模板具有限制性且创建起来耗时。这种新方法从现有文本生成正面和负面文本以针对特定组件,采用基于属性的推理策略进行细粒度语义分析,并使用视频引导进行跨模态桥接,并带有自加权损失。实验表明,该框架可以作为即插即用模块集成,以提高现有最先进VLM的性能。