实体
Sa2VA
Sa2VA
PulseAugur coverage of Sa2VA — every cluster mentioning Sa2VA across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
Sa2VA模型通过SAM-2和MLLM统一图像和视频理解
研究人员推出Sa2VA,这是一种旨在全面理解图像和视频的新型模型。Sa2VA集成了基础视频分割模型SAM-2与先进的多模态大语言模型(MLLM),在统一的token空间内处理文本、图像和视频。这种集成使得Sa2VA能够执行多种任务,包括指代分割和对话,只需极少的指令调整。该模型还引入了Ref-SAV,一个包含72,000多个复杂视频场景中物体表达的新数据集,以提高性能,特别是在指代视频物体分割方面。
-
AgentRVOS 管道通过显式代理角色精炼视频对象分割
研究人员开发了 AgentRVOS,一种用于指代表达式视频对象分割 (Ref-VOS) 的新颖管道,该管道利用了一个名为 Sa2VA 的语义假设生成器。该系统采用基于代理的架构来精炼初始粗略掩码,提高准确性并处理复杂查询。该管道包括目标存在判断、时间分割和置信度感知修订阶段,最终通过 SAM3 的传播进行最终掩码精炼。