Segment Anything Model
PulseAugur coverage of Segment Anything Model — every cluster mentioning Segment Anything Model across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
新流水线自动化脑成像中的 3D 树突分割
研究人员开发了一种用于 SBF-SEM 图像中 3D 树突分割的自动化流水线,这是理解大脑可塑性的关键步骤。该系统集成了 YOLOv6 和 Segment Anything Model (SAM) 进行初始分割,然后使用随机森林进行掩码精炼和 3D 实例链接。该流水线通过 nnU-Net 完成高分辨率精炼,实现了高语义准确性和有效的实例分离,尽管在癫痫组织等密集区域仍存在挑战。
-
无监督MoSA框架从运动数据中学习物体分割
研究人员开发了基于运动的万物分割(MoSA)框架,这是一个无监督框架,旨在克服像Segment Anything Model(SAM)这样的模型对海量手动标注的依赖。MoSA利用未标记的视频从运动中学习物体概念,通过生成运动伪标签、使用对比学习训练感知分组模型(PGM)以及将这些知识转移到用于图像分割的提示引导架构等阶段进行。在COCO和ADE20K等基准测试上的评估表明,MoSA的性能显著优于其他无监督方法,并达到了与监督式SAM相…
-
新的攻击方法针对先进的AI分割模型
研究人员开发了AdvPCS,一种新颖的对抗性攻击方法,旨在破坏可提示概念分割模型,包括最新的SAM3。这种攻击技术侧重于通用的跨提示可迁移性,意味着单一的对抗性扰动可以影响多个提示甚至不同的视频。AdvPCS采用最小-最大提示优化和全局-局部感知欺骗等策略,显著降低模型性能,在某些数据集上将平均mIoU降低到5%以下。
-
SAMReg 使用 Segment Anything Model 实现高级图像配准
研究人员开发了SAMReg,一种利用Segment Anything Model (SAM) 提高准确性和效率的新型图像配准算法。该方法采用基于感兴趣区域 (ROI) 的对应关系表示,无需训练数据、基于梯度的微调或提示工程。SAMReg 在心脏 MRI、肺部 CT、前列腺 MRI 和视网膜成像等各种医学成像应用中,均表现出优于传统迭代算法和基于学习的网络。
-
新流程增强了用于社会科学研究的图像分析能力
研究人员开发了一个名为感知、精炼、推理(PRR)的新流程,旨在改进用于社会科学研究的图像中特定对象及其位置的测量方法。该系统集成了灵活的视觉-语言检测器、Segment Anything Model (SAM) 和多模态大语言模型仲裁层,以提高准确性并允许人工干预验证。PRR 在应用于社会学类别时,相比现有方法显示出显著的精度提升,并被用于分析 2024 年选举周期中美国立法者的图像,揭示了与政治意识形态相关的微妙视觉传达模式。
-
PEFT技术增强SAM用于肝脏肿瘤分割
研究人员探索了使用Segment Anything Model (SAM)进行CT肝脏肿瘤分割的参数高效微调(PEFT)技术。该研究比较了几种PEFT方法,包括LoRA、QLoRA、Conv-Adapter以及一种新颖的方向谱Top-K适配器(DiSCo)。虽然Conv-Adapter和LoRA实现了最高的分割精度,但DiSCo在每准确度可训练参数方面表现出更高的效率。
-
MedSAM-3 通过文本提示和 LLM 代理增强医学图像分割
研究人员推出了 MedSAM-3,这是一款专为医学图像分割设计的新模型,它利用文本提示来精确靶向解剖结构。通过使用医学图像和概念标签对 Segment Anything Model (SAM) 架构进行微调,MedSAM-3 实现了开放词汇分割。该模型还包含一个代理框架,集成了多模态大型语言模型 (MLLM),用于复杂推理和迭代优化,在各种医学成像模式上的表现优于现有模型。
-
新基准和调查推动遥感图像分割发展
研究人员推出了VPRef,这是一个用于指代遥感图像分割的新基准测试,旨在解决由视觉和文本领域漂移引起的性能下降问题。该基准测试包含超过46,000个语言-图像-标注三元组,并配备了一个基于Segment Anything Model (SAM3) 和低秩适配 (LoRA) 的参数高效适配框架。该框架采用伪标签驱动的自训练和随机多粒度文本提示混合技术,在仅修改模型一小部分参数的情况下提高了分割精度。另一项调查回顾了遥感图像语义分割中的深…
-
新型光谱适配器增强SAM用于医学图像分割
研究人员开发了两种新型光谱适配器,DiSECT和SiGA,旨在增强Segment Anything Model (SAM)在计算机断层扫描 (CT) 中分割结直肠肝转移瘤 (CRLM) 的能力。这些适配器追求参数效率,DiSECT仅使用0.14百万个可训练参数。在对446个CT容积的评估中,SiGA在单点提示模式下取得了0.77的Dice分数,并在无提示场景下取得了与3D nnU-Net基线相当的0.76分数。
-
新的SARTM框架将SAM适配于RGB-热力学分割
研究人员开发了SARTM,一个旨在将分割任何模型(SAM)适配于RGB-热力学(RGB-T)语义分割的新框架。SARTM使用LoRA层对SAM进行微调,并通过跨模态知识蒸馏(CMKD)引入语言指导,以解决跨模态不一致和语义模糊问题。该框架还通过调整SAM的头部和集成多尺度特征来增强分割效果。在MFNET、PST900和FMB等基准测试上的实验表明,SARTM的性能优于现有的最先进方法。
-
AI模型已适应孟加拉国精确河岸侵蚀分析
研究人员已将Segment Anything Model (SAM) 应用于分析孟加拉国河岸侵蚀,使用了历史谷歌地球影像。该微调模型专注于调整掩码解码器,同时保持图像编码器冻结,在侵蚀检测方面达到了0.867的高IoU。研究表明,该模型能够泛化到新区域,并提供可靠的侵蚀面积测量,与地面实况的差异仅为0.17%。这种方法为监测环境变化提供了一种更快、更一致的方法。
-
BalSAM模型利用SAM和高程数据增强树冠分割
研究人员开发了BalSAM,一种将Segment Anything Model (SAM)与数字表面模型 (DSM) 高程数据相结合的新型模型,用于改进无人机影像的树冠分割。虽然开箱即用的SAM性能不及Mask R-CNN,但对SAM进行端到端微调并结合DSM信息显示出巨大潜力,尤其是在种植园树冠的分割方面。这种方法为监测森林生态系统和规划管理策略提供了一种经济高效的方法。
-
新的RegCL框架将SAM适应于多传感器AI
研究人员开发了RegCL,一个用于持续适应Segment Anything Model (SAM)以实现AR/VR和具身AI等多传感器媒体中视觉基础的新型框架。与需要大量重放数据或特定领域模块的传统方法不同,RegCL采用非重放方法,将轻量级适应模块(如LoRA风格的AugModules)合并到一个紧凑的适配器中。该方法优化了预测一致性并保留了历史特征统计信息,在各种分割数据集上的表现优于现有的持续学习和合并基线。RegCL的紧凑性使…
-
Text-to-Seed框架使用扩散模型进行开放词汇量分割
研究人员开发了一种新颖的、无需训练的开放词汇量语义分割框架,名为Text-to-Seed (T2S)。该方法重新利用扩散模型(特别是Stable Diffusion)来生成文本引导的种子点。然后,这些种子点被用作Segment Anything Model (SAM)的提示,以生成精确的对象掩码。T2S在标准基准测试中表现出色,无需进行特定任务的训练或额外的标注,突显了语义基础与种子驱动的空间分割之间的协同作用。
-
新的FAN-LoRA方法改进了基础模型的医学图像分割
研究人员开发了FAN-LoRA,一种将视觉基础模型(如分割一切模型(SAM))适配到医学成像领域的新方法。现有方法在处理域偏移时存在困难,导致性能下降。FAN-LoRA通过解耦频率分量来解决这个问题,使用B样条驱动的低通分支处理全局结构,并使用傅里叶高通分支处理局部纹理。实验表明,FAN-LoRA在提高Dice分数和减少医学成像基准测试中的边界误差方面优于现有方法。
-
新的HPMA框架增强了SAM在手术器械分割方面的能力 · 跟踪2个来源
研究人员开发了一个名为层级原型-记忆适配(HPMA)的新框架,以提高SAM等基础模型在手术器械分割方面的性能。现有方法在术中变化和多尺度视觉线索方面存在困难。HPMA通过创建一个冻结的多尺度原型记忆库来解决这个问题,该记忆库保留了稳定的类别证据,并使用尺度匹配的耦合机制来有效整合多尺度信息。在EndoVis2017和EndoVis2018数据集上的实验表明,HPMA取得了最先进的结果,优于以前的适配技术。
-
新框架从图像生成伪LiDAR用于3D目标检测
研究人员开发了VFMM3D,一个利用视觉基础模型从单目图像生成伪LiDAR数据以进行3D目标检测的新颖框架。该方法集成了Depth Anything Model (DAM)的深度估计能力和Segment Anything Model (SAM)的前景分割能力。VFMM3D框架通过前景感知伪LiDAR绘制操作和稀疏化策略,增强了物体结构并减少了背景噪声,在KITTI和Waymo数据集上取得了最先进的性能。
-
新框架应对半监督医学图像分割挑战 · 已追踪2个来源
两篇新研究论文提出了用于半监督医学图像分割的新颖框架,解决了标注数据有限和类别不平衡的挑战。第一篇论文介绍了语义类别分布学习(SCDL),这是一个旨在通过学习结构化的类别条件特征分布来减轻监督和表示偏差的模块。第二篇论文提出了一个视觉-语言增强基础模型(VESSA),该模型将VLM集成到半监督学习框架中,使用模板引导的伪标签来提高分割精度。
-
新方法使用SAM2通过稀疏标注改进底栖图像分割
研究人员开发了一种新方法,通过利用稀疏点标注来改进底栖图像的密集分割模型。该方法利用Segment Anything Model (SAM)系列,特别是SAM2,来处理来自历史底栖调查的现有遗留点标签。关键创新在于一种识别和过滤不可靠点的机制,从而提取高质量的伪地面真实掩码。这些掩码随后可以训练更准确的语义分割模型,为可扩展的生态分析铺平道路。
-
新模型通过先进的特征适应和边界细化增强遥感图像分割
两篇新的研究论文提出了用于遥感图像语义分割的先进方法。第一篇FE-SAM在Segment Anything Model (SAM)的基础上,引入了频率调制适配器(Frequency-Modulated Adapter)以更好地适应不同地物类型的特征,并引入了EGRefiner来增强边界细节。第二篇BASeg利用马氏距离-角度边界损失(Mahalanobis-Angle Boundary Loss, MABL)来提高边界和形状的一致性,…