SAM2
PulseAugur coverage of SAM2 — every cluster mentioning SAM2 across labs, papers, and developer communities, ranked by signal.
11 天有情绪数据
SAM2's object-centric latent world models to be applied in robotics
Given SAM2's role in object-centric latent world models developed by Visionary Future, it's plausible that this capability will be integrated into robotic control systems. This could lead to more sophisticated robot perception and interaction, building upon existing VLA research like GuidedVLA.
SAM2 integrated into CamoSAM2 for improved video object detection
The CamoSAM2 framework leverages the SAM2 foundation model to enhance video camouflaged object detection (VCOD). This integration allows for automatic prompt generation and refinement, addressing challenges with camouflaged objects and improving performance metrics like mIoU and inference speed.
SAM2 utilized in Venus-DeFakerOne for fake image detection and localization
The Venus-DeFakerOne model integrates SAM2 with InternVL2 to create a unified approach for detecting and localizing fake images. This demonstrates SAM2's capability in handling complex visual analysis tasks beyond simple object segmentation, including identifying sophisticated image manipulations.
New defenses against prompt-injection style attacks on SAM2 are likely to emerge.
The development of BadVSFM, an effective attack targeting prompt-driven video segmentation models like SAM2, highlights a significant vulnerability. Given the minimal degradation of clean performance and ineffectiveness of current defenses, it's probable that research will shift towards developing robust countermeasures.
SAM2 is being adapted for specialized remote sensing segmentation tasks.
Recent evidence shows the development of an open-source pipeline, Remote SAMsing, specifically designed to enhance SAM2's segmentation capabilities for remote sensing imagery. This indicates a growing trend of adapting foundation models like SAM2 for niche applications beyond general image segmentation.
-
FermatSyn利用SAM2和Mamba推进医学图像合成
研究人员开发了FermatSyn,一种新颖的多模态医学图像合成方法,旨在提高全局解剖一致性和局部细节。该系统包含一个使用LoRA+的基于SAM2的先验编码器,用于解剖知识;一个分层残差下采样模块和跨尺度集成网络,用于保留精细细节;以及一个具有约束螺旋扫描策略的双向Fermat扫描Mamba,以最小化方向偏差。在多个医学成像数据集上的实验表明,FermatSyn在图像质量指标和结构一致性方面表现优越,下游分割任务与使用真实图像训练相比没…
-
新SAM2Dual方法提升长时视频分割鲁棒性
研究人员推出SAM2Dual,一种无需模型再训练即可增强长时视频对象分割鲁棒性的新方法。该方法采用双记忆系统,区分用于局部适应的短期记忆和通过间隔采样保留全局身份线索的长期记忆。此外,SAM2Dual还整合了文本感知记忆(TAM),根据语义兼容性重新加权记忆贡献,即使在视觉信息稀缺或模糊的情况下也能帮助保持身份。该方法在MOSEv2和LVOSv2等长时基准测试中均表现出持续改进。
-
AI 管道助力识别古代埃兰楔形文字符号
研究人员开发了 EpigraphNet,一个用于从退化碑文图像中识别埃兰楔形文字符号的新型管道。该系统利用零样本 SAM2 分割来创建干净的符号掩码,然后由经过微调的 Vision Transformer (ViT-B/16) 进行分类处理。EpigraphNet 的性能显著优于现有的 CNN 和 Transformer 基线模型,在 132 类基准测试中取得了 86.41% 的 top-1 准确率,并展示了对常见和罕见符号更均衡的识别能力。
-
新研究探索不确定性量化和轻量级模型在语义分割中的应用
研究人员正在探索提高语义分割模型可靠性和鲁棒性的方法,尤其是在安全关键型应用中。一篇论文研究了不确定性量化(UQ)技术与SAM2和DPT等基础模型的集成,评估了准确性、校准和计算成本之间的权衡。另一项研究考察了CutMix数据增强策略对分割模型的影响,发现它在不显著影响准确性的情况下提高了可靠性和校准。第三篇论文介绍了一种名为SiConMo的轻量级框架,通过在瓶颈阶段进行上下文建模来平衡准确性和效率,展示了强大的准确性-效率权衡。
-
新框架使视觉AI能够实时从用户更正中学习
研究人员开发了一个名为Live Interactive Training (LIT) 的新框架,该框架允许视觉系统在推理过程中实时从用户更正中学习。主要实现LIT-LoRA使用一个轻量级的LoRA模块,该模块会根据用户反馈即时更新,从而使模型能够提高在视频后续帧上的性能。这种方法在视频分割任务中显示出18-34%的必要更正减少,且训练开销极小,并且也已改编用于图像分类。
-
新方法使用SAM2通过稀疏标注改进底栖图像分割
研究人员开发了一种新方法,通过利用稀疏点标注来改进底栖图像的密集分割模型。该方法利用Segment Anything Model (SAM)系列,特别是SAM2,来处理来自历史底栖调查的现有遗留点标签。关键创新在于一种识别和过滤不可靠点的机制,从而提取高质量的伪地面真实掩码。这些掩码随后可以训练更准确的语义分割模型,为可扩展的生态分析铺平道路。
-
新的TCSR-Monitor框架可检测手术AI分割中的静默故障
研究人员开发了TCSR-Monitor,一个新颖的框架,旨在检测手术分割网络中的失败,即使模型报告高置信度。这个事后监测系统整合了形状、时间一致性和图像质量等线索,独立于分割模型的内部工作原理运行,并且在部署期间不需要真实标签数据。在EndoVis 2017数据集上的评估表明,TCSR-Monitor能有效地泛化到未见过的采集退化,并且显著优于传统的基于置信度的监测方法。虽然Mondrian保形校准有助于平衡不同腐蚀水平下的漏报率,但…
-
新基准EgoAfford和模型EgoLens解决了面向任务的负担能力接地问题
研究人员推出了EgoAfford,这是一个新的基准,旨在将面向任务的负担能力接地与以自我为中心的视觉观察和多步规划联系起来。该基准包括来自2000个生成场景的大约15.5k张经过人类验证的图像,以及来自26个任务的102张图像的真实世界数据集。为了应对这些挑战,他们还开发了EgoLens,一个具有特定角色掩码解码器的3B多模态大型语言模型。
-
新的SAMSEM方法将SAM2应用于集成电路金属线分割
研究人员开发了SAMSEM,一种用于分割集成电路(IC)图像中金属线的新方法,该方法改编自Meta的Segment Anything Model 2(SAM2)。该方法采用多尺度分割策略,并结合了基于拓扑的损失和基于像素的损失,以关注电气连接性。SAMSEM在各种集成电路、技术节点和制造过程中表现出强大的泛化能力,即使在未见过的数据上也能实现低错误率。
-
开发者创建了带有自主数据管道的卫星图像编辑 LoRA
一位开发者创建了 SatEdit,一个用于 Qwen-Image-Edit-2511 的 LoRA(低秩适应)模型,专门用于掩码条件下的卫星图像编辑。该项目还包含一个半自主数据生成管道,该管道利用 SAM2 进行分割,利用 VLM 进行标注,并利用图像修复创建编辑对。该管道探索了使用基础模型为其他基础模型生成训练数据。
-
新框架将 2D 模型适配于 3D 和 4D 分割
研究人员开发了 SAM+D,一个旨在将 SAM 和 SAM2 等 2D 基础模型适配于 3D 体积分割和 4D 时空分割任务的新颖框架。这种参数高效的方法引入了两个轻量级模块:深度路由 LoRA (Depth-Routed LoRA) 和深度移位模块 (Depth Shift Modules),它们能够实现跨切片特征交换和空间自适应更新,同时保持大部分预训练参数冻结。SAM+D 在 3D 分割的医学成像基准测试和 4D 分割的细胞追踪…
-
AI框架结合视觉与形态测量数据进行禽类骨骼分类
研究人员开发了一种新颖的多模态AI框架,用于对禽类骨骼进行分类,整合了视觉数据和骨测量数据。该系统使用一个两阶段流程,结合BiRefNet和SAM2进行图像分割,然后将EfficientNet_V2_S提取的视觉特征与形态测量数据融合。该模型在识别骨骼类型方面达到了86%的准确率,并在科级分类中显示出潜力,前三准确率为75%,为AI辅助动物考古学建立了一个新的方法学基准。
-
SurgSLOT系统支持实时手术视频分割
研究人员推出 SurgSLOT,一个用于分割和跟踪手术视频中对象的新颖系统。该系统旨在跨不同手术程序和中心进行泛化,而无需大量重新训练。SurgSLOT 利用时间语义学习和语义驱动的长期记忆模块来保持稳定的对象身份,即使在长时间缺席后也能重新识别目标。当在 SAM2 和 SAM3 主干上实现时,SurgSLOT 在跨数据集评估中实现了高性能,优于微调模型并展示了实时能力。
-
新的RDVSv2基准推动RGB-D视频显著目标检测发展
研究人员推出了RDVSv2,这是一个专为RGB-D视频显著目标检测设计的大规模基准。该新数据集包含249个视频序列的密集帧级标注,总计29,077帧,并整合了源自立体视频的深度图以及眼动追踪引导的显著目标掩码。RDVSv2旨在通过提供更大的规模、更高的标注质量以及更多样化、更具挑战性的场景来克服现有数据集的局限性。研究人员还通过采用参数高效的微调策略,为Segment Anything Model 2 (SAM2)编码器适配多模态输入…
-
AI框架增强机器人手术中的气管解剖结构理解
研究人员开发了一种新颖的学习式框架,用于分层气管解剖结构理解,专门为超声引导的机器人手术设计。该系统集成了YOLOv8n定位骨干网络和SAM2解码器,以从稀疏的手术标注中实现高保真分割。该框架展示了0.777的平均Dice相似系数,显著优于U-Net基线,并实现了6.92 FPS的吞吐量,这对于实时机器人操作至关重要。
-
新数据集和模型增强了对视障行人的人工智能导航
研究人员开发了一个新的语义分割框架,旨在改善视障行人的辅助导航。该框架利用了一个名为 SENSATION-DS 的新数据集,该数据集包含胸高视角的行人图像,并具有九个与导航相关的类别分类。研究评估了五种分割架构,发现 UPerNet-MobileNetV3 实现了最高平均交并比,而 DeepLabV3Plus-MobileNetV3 在混淆道路与人行道方面表现出最低的错误率,并在智能手机上提供了实用的运行时性能。
-
新的 GUI 工具使用 SAM2 简化了 3D 医学图像标注
一个名为 Interactive Medical-SAM2 GUI 的新的开源桌面应用程序已被开发出来,用于 2D 和 3D 医学图像的半自动标注。它构建在 Napari 查看器之上,集成了 SAM2 风格的传播与框和点提示,以实现高效的 3D 标注工作流程。该工具允许用户按顺序处理多个研究,优化预测,并导出带有每个对象体积和 3D 渲染的标签,同时保留图像几何。
-
Lean-SAM2框架提升SAM2分割效率和准确性
研究人员开发了Lean-SAM2,一个旨在提高Segment Anything Model 2 (SAM2) 在时间可提示分割方面效率的新框架。Lean-SAM2通过引入三个关键机制来解决SAM2繁重的记忆交叉注意力(memory cross-attention)和冗余特征提取问题:目标锚定记忆剪枝(Target-Anchored Memory Pruning, TAMP)、带保险记忆的时间凝结(Temporal Condensati…
-
SAMRI-3D 适配 SAM2 用于 3D MRI 分割,性能优于先前模型
研究人员推出了 SAMRI-3D,这是一个用于 3D MRI 分割的新基准和方法,它适配了 Segment Anything Model 2 (SAM2)。该方法通过仅微调解码器和内存模块,将分割精度与之前的基于 SAM 的医学模型相比显著提高,达到了 0.76 的平均 Dice 分数。该方法还引入了具有截断符号距离场 (TSDF) 目标的全局体积令牌 (GVT),以更好地处理 MRI 扫描中的不可见边界,从而在不同数据集上以最小的方…
-
新研究解决目标检测模型的标注效率问题
两篇新研究论文探讨了提高目标检测标注效率的先进方法。第一篇论文介绍了一个基础模型协作主动学习框架,该框架使用双源不确定性估计和以对象为中心的多元化采样来增强样本选择,并减少遥感图像的手动标注负担。第二篇论文提出了一种用于机器人的具身主动学习方法,该方法优化导航轨迹并根据空间一致性选择信息图像,以便在有限的标注和导航预算下重新训练目标检测器。