SAM 2
PulseAugur coverage of SAM 2 — every cluster mentioning SAM 2 across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新方法审计视频模型内存特异性
研究人员开发了一种新方法来审计视频模型内存的特异性,区分内存的普遍益处和检索到的具体内容。该技术通过读时内存替换,应用于Ego-Exo4D和7-Scenes等各种视频世界模型和数据集。研究结果表明,内存的收益可能源于通用的表示支持、更广泛的上下文或精确的片段内容,这表明检索到的精确信息并非总是性能提升的唯一驱动因素。
-
新的SSS方法使用SAM-2增强医学影像分割
研究人员开发了SSS(半监督SAM-2),一种利用SAM-2特征提取能力的半监督医学影像分割新方法。该方法旨在通过利用未标记的医学图像来增强全监督模型的特征支持,从而提高分割性能。该方法包含一个判别性特征增强机制和一个集成物理约束与滑动窗口(PCSW)的提示生成器,以满足SAM-2的提示要求。在ACDC和BHSD数据集上的实验表明,SSS在BHSD上达到了53.15的优越Dice分数,优于现有的最先进方法。
-
FoundYou统一模型融合分割与检索任务
研究人员推出FoundYou,一个结合了个性化分割与检索任务的统一框架。FoundYou基于Segment Anything 2 (SAM 2) 模型构建,利用其在视频帧之间保持物体身份的能力,以匹配独立图像中的物体。这种方法使得分割和检索都成为同一实例对齐过程的结果,提供了少样本个性化检索和可提示个性化分割等功能。该模型在类别级检索基准测试中取得了最先进的成果,并且在速度和大小方面显著优于之前的统一解决方案,同时保持了核心SAM 2…
-
FoundYou统一模型集成了分割和检索任务
研究人员推出FoundYou,一个统一的框架,通过利用Segment Anything 2 (SAM 2) 模型捕获的实例级线索,集成了个性化分割和检索任务。该方法将这两个任务视为同一实例对齐过程的结果,从而实现了少样本个性化检索和可提示个性化分割等新功能。FoundYou在PerMIS和ILIAS等基准测试中展示了显著的性能提升,同时利用了冻结的SAM 2-small模型,仅需少量额外的可训练参数,与之前的统一解决方案相比,模型更小…
-
新的SAM-H方法在平面物体跟踪方面达到最先进水平
研究人员开发了SAM-H,一种利用分割掩码轮廓估计平面物体跟踪单应性姿态的新方法。该方法与SAM 2的掩码结合后,在PlanarTrack基准测试中取得了最先进的性能,显著提高了p@5指标。该研究还引入了WOFTSAM,一种结合了基于分割和基于对应技术来超越PlanarTrack和POT-210数据集上现有方法的补充方法。此外,研究人员还提供了PlanarTrack初始姿态的精确重新标注,以实现更准确的基准测试。
-
新的EditCLEVR基准测试AI对象中心表示的忠实度
研究人员推出EditCLEVR,一个旨在评估AI模型中对象中心表示的组合忠实度的新基准。该基准使用具有受控语义编辑的配对场景来评估模型识别和修改特定对象属性的准确性。EditCLEVR旨在提供对干预下每个对象表示行为的更直接测试,超越传统的分割或预测准确性指标。初步评估表明,即使有真实掩码,也可能发生降级,并且现有方法可能夸大语义忠实度。
-
新流程支持交互式三维资产分割以用于内容创作
研究人员开发了一种面向交互式内容工作流的、基于人类在环的图集式三维资产分割流程。该方法利用SAM 2和Label Studio对渲染视图进行交互式分割,然后将其反投影到模型的UV参数化上。生成的图集有助于后续任务,如材质分配和语义标注,评估表明其在各种几何形状上都很有用。
-
SAMOSA框架适配SAM 2以实现高级视觉对象跟踪
研究人员开发了SAMOSA,一个新颖的跟踪框架,增强了SAM 2视觉基础模型在复杂视觉对象跟踪方面的能力。SAMOSA明确地整合了运动动力学、几何一致性和语义线索以提高跟踪性能,解决了直接将SAM 2应用于动态场景的局限性。该框架与监督方法相比展示了更优越的泛化能力,并在具有挑战性的数据集上取得了显著的提升,特别是在涉及非线性运动的场景(如反无人机场景)中。
-
TinySAM 2 提供高效视频分割,具有极度内存压缩
研究人员开发了 TinySAM 2,这是 Segment Anything Model 2 (SAM 2) 的一个更高效版本,用于视频分割和对象跟踪。TinySAM 2 采用内存质量管理机制和联合时空令牌压缩,显著降低了内存存储和计算成本。通过这些优化,该模型仅使用 7% 的内存令牌和 3% 的训练数据即可达到 SAM 2.1 性能的 90%,使其更适合在资源受限的设备上部署。
-
新基准评估视频生成中的几何和物理一致性
两篇新研究论文介绍了用于评估生成视频的几何和物理一致性的基准。PDI-Bench 专注于评估三维结构和运动的合理性,而 MechVerse 则专门针对铰接组件中的机械约束。这两个框架都旨在通过提供视频生成模型中几何连贯性和物理正确性的定量指标,来超越主观的人工评估。
-
SAM 3:AI之眼 — Nikhila & Pengchuan (Meta Superintelligence),特邀 Joseph Nelson (Roboflow)
Meta AI 发布了 SAM 3,这是其 Segment Anything 项目的一项重大进展,能够使用自然语言提示在图像和视频中进行概念分割、检测和跟踪。该新模型通过实时识别诸如“黄色校车”等概念的每一个实例,并以惊人的速度,实现了人类水平的详尽性。SAM 3 与 Gemini 等多模态大语言模型集成,可执行复杂的视觉推理任务,并通过在 Roboflow 平台上的应用,已节省了超过 130 年的标注时间。