研究人员推出了RDVSv2,这是一个专为RGB-D视频显著目标检测设计的大规模基准。该新数据集包含249个视频序列的密集帧级标注,总计29,077帧,并整合了源自立体视频的深度图以及眼动追踪引导的显著目标掩码。RDVSv2旨在通过提供更大的规模、更高的标注质量以及更多样化、更具挑战性的场景来克服现有数据集的局限性。研究人员还通过采用参数高效的微调策略,为Segment Anything Model 2 (SAM2)编码器适配多模态输入,建立了一个强大的基线模型,并在RDVSv2及其他基准上取得了最先进的成果。 AI
影响 该基准预计将推动多模态视频理解和显著目标检测领域的进一步研究和开发。
排序理由 该集群描述了一篇介绍特定计算机视觉任务大规模基准数据集和基线模型的新学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →