PulseAugur
实时 04:59:12
实体 Segment Anything Model 3

Segment Anything Model 3

PulseAugur coverage of Segment Anything Model 3 — every cluster mentioning Segment Anything Model 3 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
6
90 天内 31
发布 · 30天
0
90 天内 0
论文 · 30天
6
90 天内 27
层级分布 · 90 天
主题
关系
时间线
  1. 2026-05-22 product_launch Meta AI launched Segment Anything Model 3 (SAM 3), an advanced model for object detection, segmentation, and tracking. 来源
情绪 · 30 天

6 天有情绪数据

最近 · 第 1/2 页 · 共 31 条
  1. TOOL · CL_194044 ·

    基于SAM3的新方法实现了无标注手术器械分割

    研究人员开发了一种新颖的两阶段框架,用于在内窥镜图像中分割手术器械,而无需手动标注。该方法利用分割一切模型3 (SAM3) 和通用文本提示“工具”来生成初始二值掩模。然后,使用视觉语言模型Qwen将这些掩模分类为特定的器械实例。虽然尚未达到完全监督方法的水平,但该技术在无标注手术器械分割方面显示出潜力,突显了SAM3的能力和局限性。

  2. TOOL · CL_191240 ·

    新框架利用基础模型改进航天器分割

    研究人员开发了GeoDistill-Refine,一个新颖的两阶段框架,旨在利用基础模型提高航天器分割的准确性。该方法通过首先学习前景轮廓,然后用符号距离场、骨架和面积目标进行细化,来解决Segment Anything Model 3等模型生成的伪掩码中的几何误差。该框架在SpaceSense-Bench HJM数据集上展示了图像IoU和边界F1分数的显著提高,优于纯伪标签学生模型,并在其他领域取得了有竞争力的结果。

  3. TOOL · CL_183485 ·

    Tarot-SAM3框架增强SAM3以实现任意指代表达式分割

    研究人员开发了Tarot-SAM3,一个旨在通过使Segment Anything Model 3 (SAM3)能够处理任意自然语言表达式来改进指代表达式分割 (RES) 的新框架。该框架分两个阶段运行:表达式推理解释器 (ERI) 用于解析表达式并将其重写为SAM3的鲁棒提示,以及掩码自精炼 (MSR) 阶段,使用DINOv3的特征关系来选择最佳掩码并对其进行精炼。该方法旨在克服SAM3在处理复杂表达式方面的局限性,并减少对多模态大…

  4. RESEARCH · CL_181064 ·

    新框架提升遥感领域开放词汇分割能力

    研究人员开发了两种用于遥感领域开放词汇语义分割的新框架。第一个是DinoSplat-OV,它在不进行微调的情况下,将DINOv3模型适配到该领域,并使用文本感知噪声抑制和高斯溅射上采样模块来处理遥感影像的独有特征。第二个是EOVSAM,它增强了Segment Anything Model 3 (SAM 3) 的单通道预测能力,提高了准确性并显著加快了推理速度。这两种方法都旨在克服遥感领域像素级标注成本高昂的限制。

  5. TOOL · CL_167810 ·

    SAM3 通过参数高效 LoRA 适应于手术分割

    研究人员开发了一种参数高效的分割一切模型 3 (SAM3) 的适应方法,专门用于手术概念分割。这种新方法利用低秩适应 (LoRA),将可训练参数的数量显著减少到仅 0.98%,从而可以在单个消费级 GPU 上进行训练。实验表明,这种方法优于标准的 SAM3 和其他基线,产生的分割结果可以直接部署到手术重建和模拟流程中。

  6. TOOL · CL_165131 ·

    新的AI工作流程使用卫星影像和SAM 3绘制农田范围

    研究人员开发了一种新的工作流程,使用1米NAIP影像来绘制农田范围和边界。该方法结合了使用Dice主导损失训练的残差U-Net模型和文本提示的Segment Anything Model (SAM 3)。该方法取得了高精度,组合模型在果园行和碎片化地块等具有挑战性的数据集上显示出显著的改进。由此产生的语义农田范围层可以在现有地块地图不足的情况下支持农业监测。

  7. TOOL · CL_158832 ·

    新方法增强遥感开放词汇分割

    研究人员开发了 Prompt-Calibrated SAM 3 (ProC-SAM3),一种用于遥感开放词汇语义分割的新方法。该方法通过创建离线提示池来解决现有基于 SAM 3 的技术的局限性,该提示池使用多模态大语言模型和先验知识对特定类别的提示进行分组和优化。ProC-SAM3 还缓存文本嵌入以避免冗余编码,并采用 Presence-Guided Residual Fusion 机制来提高预测的准确性,特别是对于小型或稀疏物体。在…

  8. TOOL · CL_158246 ·

    用户寻求关于 SCAIL-2/SAM 3 图像处理追踪的帮助

    一位用户在使用 Maestro 上的 SCAIL-2/SAM 3 进行图像处理时,寻求关于追踪问题的帮助。具体来说,他们正尝试替换电影《小姐好白》场景中的人物,但在追踪功能上遇到了困难,即使是在更简单的特写镜头中也是如此。用户还在寻找本地模型或 LoRA 的推荐,该模型或 LoRA 专门根据参考图像进行重新照明。

  9. TOOL · CL_156577 ·

    新框架利用合成数据改进番茄植株分割

    研究人员开发了一个新的框架,用于温室番茄植株的分割,解决了标注训练数据有限的挑战。该方法结合了程序化合成数据生成和 Segment Anything Model 3 (SAM 3) 的微调。通过对商业樱桃番茄温室进行建模,他们创建了一个大型合成数据集,用于专门化 SAM 3 的文本条件分割能力以用于作物器官。在真实温室数据集上进行评估时,微调后的模型表现出显著提高的分割性能和置信度。

  10. RESEARCH · CL_145783 ·

    AI物体检测器指示物体存在而非可见性,用于杂乱场景 · 跟踪2个来源

    一项新的研究论文揭示,广泛用于语言接地和主动感知等任务的开放词汇物体检测器,通常指示物体存在而非其可见性。即使物体被严重遮挡,这些检测器也会保持高置信度,有时甚至随着杂乱程度的增加而提高置信度。这种校准不当会导致评估不准确和门控机制存在缺陷,因为置信度分数与实际可见性不相关。该研究测试了多种检测器、物体类别和遮挡类型下的这种现象,并发布了一个受控基准来解决检测器校准不当和物体幻觉问题。

  11. RESEARCH · CL_139290 ·

    SAM 3 评估揭示其在遥感领域分割能力的局限性

    一篇新论文评估了 Segment Anything Model 3 (SAM 3) 在遥感任务中的能力,发现它虽然避免了过拟合并在分割方面表现良好,但在亚像素分辨率和语义盲点方面存在困难。该研究引入了一种方法来使 SAM 3 适应零样本分类,并通过分离文本和视觉提示来分析其多模态解码器。研究表明,视觉提示使模型与复杂的地缘空间几何对齐,但文本提示引入了不匹配的地面语义偏差,阻碍了性能。

  12. TOOL · CL_129473 ·

    新AI方法通过视频分析和步态动力学识别野生动物

    研究人员开发了一种新颖的、自动化的基于视频的系统,通过分析步态动力学来识别个体野生动物。该方法利用Segment Anything Model 3 (SAM3)创建精确的动物轮廓蒙版,然后由ResNet18网络处理空间特征,并由VideoPrism transformer处理时间运动分析。该系统生成独特的步态表示,并使用余弦相似度进行比较,从而无需物理标记或侵入性标记即可对个体进行聚类。对各种物种进行的实验表明,根据运动模式区分个体方…

  13. RESEARCH · CL_129436 ·

    新方法增强多模态工业异常检测 · 已追踪2个来源

    研究人员开发了两种不同的方法来改进多模态工业异常检测。第一种方法,调谐反向蒸馏(TRD),利用多分支设计和跨模态调谐器来增强正常特征的学习,同时有效检测不同模态的异常。第二种方法,全球逻辑与局部搜索(GLLS),是一个无训练框架,利用大型多模态模型和蒙特卡洛树搜索进行可验证的异常检测,在推理上下文中组织参考和规范。这两种方法都旨在推进工业环境中识别缺陷的最新技术水平。

  14. RESEARCH · CL_115315 ·

    新方法可视化MLLM对艺术品描述的推理过程

    研究人员开发了一种名为Token激活图(TAM)的新方法,用于理解多模态大型语言模型(MLLM)描述艺术品时背后的视觉推理过程。TAM生成热力图,突出显示模型为每个生成的token所使用的具体视觉证据,有助于区分视觉基础和对文本先验的依赖。研究发现,视觉基础的程度因token的语义类别而异,MLLM在艺术家归属方面的准确性高于预测艺术品标题。

  15. TOOL · CL_107156 ·

    Together AI 发布用于 LLM 推理的开源并行内核构建器

    Together AI 发布了并行内核构建器 (PKB),这是一个旨在优化大型语言模型推理性能的开源工具。PKB 可以识别并生成新颖的内核,例如用于 NeMo 词汇并行 log-probs 和 Hyena 上下文并行的内核,这些内核并未公开文档化。该工具已展示出显著的加速效果,其中一个内核的性能从标准的 320.6µs 提升至 87.9µs,并且该项目鼓励社区贡献。

  16. RESEARCH · CL_99778 ·

    S-Agent框架增强VLMs进行3D空间推理 · 跟踪4个来源

    研究人员推出S-Agent,一个旨在增强视觉语言模型(VLMs)在3D环境中进行空间推理的新框架。S-Agent整合了时间记忆和一系列空间工具,能够从多视图图像中持续理解3D世界,超越了静态、帧级别的分析。该框架允许VLMs充当语义规划器,决定需要什么证据,而空间工具则将物体定位在2D,将其提升到3D,并将这些信息聚合为空间知识。实验表明,S-Agent在无需重新训练的情况下就能改进开源和闭源VLMs,并且经过微调的版本S-Agent…

  17. RESEARCH · CL_93947 ·

    AI模型在ICRA 2026 GOOSE 2D分割挑战赛中取得顶尖排名 · 追踪4个来源

    研究人员为ICRA 2026 GOOSE 2D细粒度语义分割挑战赛开发了先进的方法,并取得了顶尖排名。一个团队利用Segment Anything Model 3 (SAM3) 结合自蒸馏技术和多尺度测试时增强,以69.73%的mIoU获得第四名。另一组利用DINOv3结合Mask2Former解码器和集成方法,以76.57%的综合得分获得第一名。第三个参赛项目GOOSE-M2F,通过调整Mask2Former并结合特定模块和训练策略…

  18. TOOL · CL_93927 ·

    SAM 3通过参数高效微调适应医学成像

    研究人员开发了一种新方法,用于将分割一切模型3(SAM 3)适应于从4DCT图像生成内部靶体积(ITV)。这种参数高效微调方法利用低秩适应(LoRA)和硬负例挖掘策略,显著提高了医学成像中的分割精度并减少了伪影。该框架在最少标注数据的情况下展现出高性能,并可在单个消费级GPU上进行训练,为自适应放疗提供了一个可扩展且数据高效的解决方案。

  19. RESEARCH · CL_93206 ·

    AI通过新的分割技术加速图像标注 · 跟踪到2个来源

    研究人员开发了新的方法来加速工业应用的图像标注。一项研究表明,使用无监督计算机视觉算法可以将材料科学中语义分割任务的时间从170小时减少到37小时,减少约78%。另一篇论文介绍了一种名为子语义图像分割的新方法,该方法将语言与可提示分割骨干相结合,根据外观模式而不是仅仅根据对象名称来划分图像。这种新方法以及一个名为TextureADE的自定义数据集(源自ADE20K)旨在通过解决语言泄露和提示竞争等问题来提高分割精度。

  20. RESEARCH · CL_93054 ·

    ActiveSAM框架提升分割速度和准确性

    研究人员开发了ActiveSAM,一个新颖的框架,旨在利用Segment Anything Model 3 (SAM 3) 提高开放词汇语义分割的效率和准确性。这种无需训练、零样本的方法通过识别与每张图像相关的活动类别子集来优化分割过程,从而降低计算负载。ActiveSAM在速度和准确性方面均有显著提升,优于SegEarth-OV3等现有最先进方法,并对图像损坏表现出强大的鲁棒性,使其适用于现实世界应用。