Sam3
PulseAugur coverage of Sam3 — every cluster mentioning Sam3 across labs, papers, and developer communities, ranked by signal.
- 2026-06-25 research_milestone Researchers introduced the Mask to Concept (M2C) framework to adapt SAM3 for few-shot medical image annotation. 来源
7 天有情绪数据
-
ViTok 模型增强计算机视觉蒸馏中的密集语义
研究人员开发了 ViTok,一种新的模型,可改进计算机视觉任务中多教师蒸馏的密集语义。通过结合 SigLIP2 和 DINOv3-L 的见解,ViTok 解决了全局识别和密集语义准确性之间的权衡问题。该模型包含多项修改,包括拆分适配器头、不对称损失和掩码图像建模,在 ImageNet-1K 和 ADE20K 基准测试中取得了强劲的性能。
-
新的ASH系统通过零样本跟踪实现自动视频标注
研究人员开发了一个名为ASH(Annotation and Segmentation Handler)的新系统,旨在实现视频标注的自动化。ASH通过使用重叠的时间块和基于IoU的身份匹配,将现有的视频实例分割跟踪器扩展到处理任意长度的视频,无需进行特定数据集的训练。当与SAM3结合时,由此产生的SAM3-ASH管道在零样本条件下在MOTS20基准测试上取得了最先进的性能,并在其他基准测试上保持竞争力,同时GPU内存使用量保持在25 GB以下。
-
新的攻击方法针对先进的AI分割模型
研究人员开发了AdvPCS,一种新颖的对抗性攻击方法,旨在破坏可提示概念分割模型,包括最新的SAM3。这种攻击技术侧重于通用的跨提示可迁移性,意味着单一的对抗性扰动可以影响多个提示甚至不同的视频。AdvPCS采用最小-最大提示优化和全局-局部感知欺骗等策略,显著降低模型性能,在某些数据集上将平均mIoU降低到5%以下。
-
HyperSAM:高光谱遥感的新基础模型
研究人员开发了HyperSAM,一个用于高光谱遥感的新型基础模型。该模型通过从多光谱图像合成高分辨率高光谱立方体并使用伪掩码进行监督,解决了现有数据集的局限性。HyperSAM利用了冻结的Segment Anything Model 3 (SAM3)架构,并针对高光谱数据进行了调整,包括一个可训练的编码器和一个专家混合掩码精炼器。实验证明了其在各种遥感任务中的有效性,表明高质量的合成数据可以优于嘈杂的真实世界监督。
-
ViCo-SAM3 框架增强了伪装目标分割能力
研究人员推出 ViCo-SAM3,一个旨在改进开放词汇伪装目标分割 (OVCOS) 的新框架。该新方法解决了现有模型(如 SAM3)中文本描述与视觉线索之间的语义鸿沟。ViCo-SAM3 利用视觉条件模块,根据图像上下文动态调整文本嵌入,增强跨模态对齐。该框架还包含一个 ViCoBind 模块,以进一步加强视觉和文本表示之间的交互,在 OVCamo 基准测试上取得了最先进的成果。
-
新基准和调查推动遥感图像分割发展
研究人员推出了VPRef,这是一个用于指代遥感图像分割的新基准测试,旨在解决由视觉和文本领域漂移引起的性能下降问题。该基准测试包含超过46,000个语言-图像-标注三元组,并配备了一个基于Segment Anything Model (SAM3) 和低秩适配 (LoRA) 的参数高效适配框架。该框架采用伪标签驱动的自训练和随机多粒度文本提示混合技术,在仅修改模型一小部分参数的情况下提高了分割精度。另一项调查回顾了遥感图像语义分割中的深…
-
新研究探讨3D分割模型组合中的语义保留
研究人员调查了在组合冻结的基础模型进行少样本3D分割时,语义信息是如何保留的。他们的研究题为“Beyond Argmax: A Mechanistic Study of Semantic Retention in Frozen Foundation-Model Composition for Generalized Few-Shot 3D Segmentation”,发现与折叠到单个类别相比,在交互前保留语义替代物的完整分布,性能显著…
-
新型多智能体系统可自动分析类器官形态
研究人员开发了MorphoOrgaAgent,一个旨在自动化类器官形态分析的新型多智能体系统。该系统通过接受自然语言输入,解决了手动分割和定量分析耗时的问题。它包含一个用于解释请求的TaskUnderstandingAgent,一个使用Cellpose和SAM3进行零样本实例分割的混合分割模块,以及一个生成定量指标和可视化报告的ReportAgent。还引入了一个新的基准测试MorphoOrgaVQA,用于评估此类智能体系统在类器官分析中的表现。
-
新的合成数据集WireSeg-32K改进了导线实例分割
研究人员推出了WireSeg-32K,这是一个旨在改进导线实例分割的合成数据集。该数据集包含32,000张图像,带有实例掩码和深度图,使用名为DeformX的协同仿真管道生成。DeformX将Cosserat-rod动力学与NVIDIA Isaac Sim相结合,以实现物理上合理的导线变形和逼真的渲染。初步实验表明,使用LoRA在WireSeg-32K上微调SAM3模型,可以显著提高其在真实世界导线感知任务上的性能。
-
SAM3-LoRA采用参数高效技术对基础模型进行缺陷分割的适应
研究人员开发了SAM3-LoRA,一种用于SAM3基础模型进行多类别结构缺陷分割的参数高效适应技术。该方法利用低秩适应(LoRA)对SAM3进行微调,所需参数远少于完全微调。该研究引入了一种新颖的监督程序,直接使用类别名称作为提示从COCO风格的实例分割数据中训练模型,无需提示模板或学习到的嵌入。此外,它通过采用详尽的硬负面提示(包括使用不存在的类别进行查询)来解决模型预测与文本条件脱钩的特定失败模式。这种方法在分割精度方面取得了显著…
-
OPUS框架以强大性能简化开放词汇检测
研究人员推出了一种新颖的统一开放词汇检测框架OPUS,该框架旨在实现简单性和有效性。与以往复杂的系统不同,OPUS利用了语义丰富的视觉表示和可扩展的接地监督。该框架使用DINOv3-ConvNeXt-B骨干网络和感知提示的解码器,通过单阶段实例级对比对齐(ICA)策略和基于SAM3的数据引擎进行训练。在COCO、LVIS-minival和ODinW35数据集上的实验表明,OPUS在视觉-图像准确性方面取得了最先进的性能,同时保持了文本…
-
新的 ComfyUI 节点支持 SAM3 模型 INT8 量化,节省存储空间
一位开发者创建了支持 SAM3 和 SAM3.1 模型 ConvRot INT8 量化的 ComfyUI 节点。通过将模型权重保持在 8 位精度,此优化显著减少了存储空间和 VRAM 使用量。该解决方案包括一个加载器节点和一个检测器节点,它们利用具有在线激活旋转的高速 INT8 内核,同时还为未对齐的层提供自动回退保护。
-
新框架 AffectOmni 通过可验证的人类线索增强 LLM 的情感推理能力
研究人员开发了 AffectOmni,一个旨在提高多模态大语言模型 (MLLM) 情感推理能力的框架。该新系统专注于人们常常忽略的以人为中心的线索,如微表情和肢体语言。AffectOmni 使用强化学习,对证据选择和时间推理进行特定奖励,并采用比较评分方法来增强奖励信号的可辨别性。为了进行外部验证,它使用 SAM3 将推理过程转换为基于像素级证据的、可执行的指令,从而创建了一个可审计的接口。
-
新方法GAP-SAM改进了AI生成图像篡改定位
研究人员开发了GAP-SAM,一种用于在AI生成的图像中定位篡改的新颖方法。该方法解决了现有技术中的局限性,例如在分布外性能差以及模型倾向于遵循语义对象边界而非真实篡改边界。GAP-SAM将源自VAE重建的全局伪影令牌集成到SAM3特征金字塔中,从而能够更准确地在各种数据集和压缩级别下进行定位。
-
SAM3 和 Gemini-3.1 Pro 在 LSVOS 挑战赛中获得第三名
研究人员开发了一种新颖的两阶段视频对象分割方法,在第八届 LSVOS 挑战赛的 MeViS-Text 赛道中获得第三名。该方法首先利用 Gemini-3.1 Pro 将视频事件分解为特定目标,选择关键帧并生成描述性文本。随后,使用 SAM3 在这些关键帧上创建像素级掩码,然后对这些掩码进行双向跟踪。这种无需训练的解决方案在单个 RTX 4090 上运行,在挑战赛的指标上表现强劲。
-
新的RISE框架整合3D追踪和视觉-语言推理用于道路分析
研究人员推出RISE(Roadside Infrastructure Sequence Understanding and Evaluation),一个用于分析道路交通序列的新型框架。该框架整合了使用纯图像方法的度量3D追踪与结构化视觉-语言推理。追踪组件在不依赖LiDAR的情况下,在多视图身份关联上达到了66.9 MOTA,而视觉-语言推理管道生成了一个包含33,910个问答对的数据集,用于评估模型在语义选择、空间定位和未来定位等任务上的表现。
-
VOS-Agent框架在LSVOS挑战赛中荣获第一名
研究人员开发了VOS-Agent,一种用于复杂视频对象分割的新型框架,该框架改进了现有的SAM3等方法。VOS-Agent利用目标感知和路由代理来对目标进行分类并将其路由到专用代理。对于微小目标,视觉跟踪代理提供增强支持,而以语义为主导的目标则由基于多模态大语言模型(MLLM)的语义代理进行管理。该方法在ECCV 2026的第8届LSVOS挑战赛MOSEv2赛道上取得了第一名,在MOSEv2测试集上表现出色。
-
新的基准 H2R-Bench 揭示了人类到机器人视频生成能力的局限性
研究人员推出了 H2R-Bench,这是一个旨在评估视频生成模型将人类操作视频转换为以机器人为中心的演示的能力的新基准。该基准通过利用丰富的以自我为中心的视频,解决了机器人学习数据扩展的挑战,而这些视频由于手部和机器人末端执行器的差异而难以跨不同载体进行转换。使用 H2R-Bench 对十一个最先进的视频世界模型进行的初步评估显示,它们在人类到机器人操作迁移方面的能力存在显著局限性,许多模型在载体一致性、功能交互和任务执行方面都遇到了困难。
-
SAM3模型使用空间引导提升遥感影像光伏分割效果
一项新的研究论文评估了使用SAM3视觉语言基础模型对遥感影像中小规模光伏(PV)系统进行分割的不同提示策略的有效性。研究发现,与纯文本提示相比,空间引导显著提高了分割的准确性和鲁棒性。结合语义和空间线索的混合提示产生了最高的准确性和稳定性,证明了这些引导类型的互补性。该研究强调了可提示基础模型的数据效率,仅用几百个标注样本就能取得显著的性能提升,使其适用于数据受限地区的太阳能电池板测绘。
-
基于SAM3的新方法实现了无标注手术器械分割
研究人员开发了一种新颖的两阶段框架,用于在内窥镜图像中分割手术器械,而无需手动标注。该方法利用分割一切模型3 (SAM3) 和通用文本提示“工具”来生成初始二值掩模。然后,使用视觉语言模型Qwen将这些掩模分类为特定的器械实例。虽然尚未达到完全监督方法的水平,但该技术在无标注手术器械分割方面显示出潜力,突显了SAM3的能力和局限性。