LSVOS Challenge
PulseAugur coverage of LSVOS Challenge — every cluster mentioning LSVOS Challenge across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
CapMap-MS-TTA系统在LSVOS挑战赛多模态赛道中排名第三
一篇研究论文详细介绍了CapMap-MS-TTA系统,该系统在ECCV 2026第8届LSVOS挑战赛的MUMU赛道中获得第三名。该赛道要求单个多模态模型在严格的资源限制下执行图像标注、开放词汇目标检测和英文标题生成。CapMap-MS-TTA解决方案基于Microsoft Florence-2-base构建,采用无训练方法,结合标题关键词映射和多尺度翻转测试时增强来提高性能。
-
Speech2MaskTrack 在LSVOS挑战赛中获得亚军
研究人员开发了Speech2MaskTrack,一种用于语音引导的视频对象分割的新颖方法。该方法将语音识别与时间定位和掩码跟踪相结合,以根据口头运动描述识别对象。Speech2MaskTrack通过将口头查询转录为结构化约束,并使用运动和关系证据对实例轨迹进行排名,在2026年第8届LSVOS挑战赛的MeViS-Audio赛道上获得第二名。
-
多模态大语言模型 (MLLM) 增强了 LSVOS 挑战赛中音频引导的视频分割
研究人员开发了一种新颖的音频引导视频目标分割框架,该框架将多模态大语言模型 (MLLM) 与基于 SAM 的分割模型相结合。该方法在技术报告中提出,将任务分解为多个阶段,并利用基础模型,无需额外的训练或微调。通过利用 MLLM 进行文本-视觉对应以及基于 SAM 的模型进行掩码生成,该框架在第 8 届 LSVOS 挑战赛的 MeViS-Audio 赛道上取得了有竞争力的结果。
-
SAM3Dual增强SAM 3,无需微调即可进行视频对象分割
研究人员开发了SAM3Dual,一种增强Segment Anything Model 3 (SAM 3) 用于视频对象分割的新方法。该方法在第八届大规模视频对象分割(LSVOS)挑战赛的MOSEv2赛道上获得第三名,它将时间记忆分离为短期和长期分支。通过将这些记忆响应与确定性时间表融合,并用前一帧的置信度进行调制,SAM3Dual在无需特定任务训练或微调的情况下展现了具有竞争力的性能。
-
新方法提升视频目标分割的准确性和效率 · 已追踪2个来源
研究人员开发了用于改进视频目标分割的新方法,这项任务涉及跨视频帧跟踪目标。一种方法,竞争性记忆读出(Competitive Memory Readout),在SAM~3模型的基础上,通过增强其记忆检索过程来更好地区分目标对象和相似的背景元素。该方法在第8届LSVOS挑战赛MOSEv2赛道中获得第二名。另一种技术,RS$^3$-Prune,提供了一种无需训练的方法来降低现有视频目标分割模型的计算和内存需求。通过在推理过程中修剪token…
-
SAM3 和 Gemini-3.1 Pro 在 LSVOS 挑战赛中获得第三名
研究人员开发了一种新颖的两阶段视频对象分割方法,在第八届 LSVOS 挑战赛的 MeViS-Text 赛道中获得第三名。该方法首先利用 Gemini-3.1 Pro 将视频事件分解为特定目标,选择关键帧并生成描述性文本。随后,使用 SAM3 在这些关键帧上创建像素级掩码,然后对这些掩码进行双向跟踪。这种无需训练的解决方案在单个 RTX 4090 上运行,在挑战赛的指标上表现强劲。
-
VOS-Agent框架在LSVOS挑战赛中荣获第一名
研究人员开发了VOS-Agent,一种用于复杂视频对象分割的新型框架,该框架改进了现有的SAM3等方法。VOS-Agent利用目标感知和路由代理来对目标进行分类并将其路由到专用代理。对于微小目标,视觉跟踪代理提供增强支持,而以语义为主导的目标则由基于多模态大语言模型(MLLM)的语义代理进行管理。该方法在ECCV 2026的第8届LSVOS挑战赛MOSEv2赛道上取得了第一名,在MOSEv2测试集上表现出色。
-
新的视听分割系统赢得LSVOS挑战赛
研究人员开发了一种新颖的视听分割系统,该系统涉及识别和分割视频中语音描述的对象。该系统首先使用Qwen3-ASR将语音转录为文本,然后使用互补的接地和分割模型生成多个视频掩码轨道。为了提高准确性,该系统会选择候选者中平均一致性最高的轨道,并对特定查询类型应用基于规则的校正。这种方法在第八届LSVOS挑战赛的MeViS-Audio赛道上取得了第一名。