PulseAugur
实时 04:02:52
实体 Sam3

Sam3

PulseAugur coverage of Sam3 — every cluster mentioning Sam3 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
23
90 天内 64
发布 · 30天
0
90 天内 0
论文 · 30天
20
90 天内 55
层级分布 · 90 天
主题
关系
时间线
  1. 2026-06-25 research_milestone Researchers introduced the Mask to Concept (M2C) framework to adapt SAM3 for few-shot medical image annotation. 来源
情绪 · 30 天

14 天有情绪数据

最近 · 第 1/4 页 · 共 64 条
  1. TOOL · CL_208635 ·

    SAM3 和 Gemini-3.1 Pro 在 LSVOS 挑战赛中获得第三名

    研究人员开发了一种新颖的两阶段视频对象分割方法,在第八届 LSVOS 挑战赛的 MeViS-Text 赛道中获得第三名。该方法首先利用 Gemini-3.1 Pro 将视频事件分解为特定目标,选择关键帧并生成描述性文本。随后,使用 SAM3 在这些关键帧上创建像素级掩码,然后对这些掩码进行双向跟踪。这种无需训练的解决方案在单个 RTX 4090 上运行,在挑战赛的指标上表现强劲。

  2. TOOL · CL_206178 ·

    新的RISE框架整合3D追踪和视觉-语言推理用于道路分析

    研究人员推出RISE(Roadside Infrastructure Sequence Understanding and Evaluation),一个用于分析道路交通序列的新型框架。该框架整合了使用纯图像方法的度量3D追踪与结构化视觉-语言推理。追踪组件在不依赖LiDAR的情况下,在多视图身份关联上达到了66.9 MOTA,而视觉-语言推理管道生成了一个包含33,910个问答对的数据集,用于评估模型在语义选择、空间定位和未来定位等任务上的表现。

  3. TOOL · CL_200234 ·

    VOS-Agent框架在LSVOS挑战赛中荣获第一名

    研究人员开发了VOS-Agent,一种用于复杂视频对象分割的新型框架,该框架改进了现有的SAM3等方法。VOS-Agent利用目标感知和路由代理来对目标进行分类并将其路由到专用代理。对于微小目标,视觉跟踪代理提供增强支持,而以语义为主导的目标则由基于多模态大语言模型(MLLM)的语义代理进行管理。该方法在ECCV 2026的第8届LSVOS挑战赛MOSEv2赛道上取得了第一名,在MOSEv2测试集上表现出色。

  4. RESEARCH · CL_199767 ·

    新的基准 H2R-Bench 揭示了人类到机器人视频生成能力的局限性

    研究人员推出了 H2R-Bench,这是一个旨在评估视频生成模型将人类操作视频转换为以机器人为中心的演示的能力的新基准。该基准通过利用丰富的以自我为中心的视频,解决了机器人学习数据扩展的挑战,而这些视频由于手部和机器人末端执行器的差异而难以跨不同载体进行转换。使用 H2R-Bench 对十一个最先进的视频世界模型进行的初步评估显示,它们在人类到机器人操作迁移方面的能力存在显著局限性,许多模型在载体一致性、功能交互和任务执行方面都遇到了困难。

  5. RESEARCH · CL_195830 ·

    SAM3模型使用空间引导提升遥感影像光伏分割效果

    一项新的研究论文评估了使用SAM3视觉语言基础模型对遥感影像中小规模光伏(PV)系统进行分割的不同提示策略的有效性。研究发现,与纯文本提示相比,空间引导显著提高了分割的准确性和鲁棒性。结合语义和空间线索的混合提示产生了最高的准确性和稳定性,证明了这些引导类型的互补性。该研究强调了可提示基础模型的数据效率,仅用几百个标注样本就能取得显著的性能提升,使其适用于数据受限地区的太阳能电池板测绘。

  6. TOOL · CL_194044 ·

    基于SAM3的新方法实现了无标注手术器械分割

    研究人员开发了一种新颖的两阶段框架,用于在内窥镜图像中分割手术器械,而无需手动标注。该方法利用分割一切模型3 (SAM3) 和通用文本提示“工具”来生成初始二值掩模。然后,使用视觉语言模型Qwen将这些掩模分类为特定的器械实例。虽然尚未达到完全监督方法的水平,但该技术在无标注手术器械分割方面显示出潜力,突显了SAM3的能力和局限性。

  7. TOOL · CL_194042 ·

    新的视觉令牌编码器提高了 ViT 特征压缩效率

    研究人员开发了一种名为视觉令牌编码器(VTC)的新方法,用于压缩 Vision Transformer(ViT)模型中的中间特征。VTC 有效地利用了 ViT 补丁令牌中固有的空间相关性,而这些相关性常常被现有编码器所忽略。该双路径编码器将全局令牌和补丁令牌分开,并对每个令牌应用专门的压缩技术。实验表明,VTC 在各种任务(如分类、分割和检测)上的性能显著优于当前的 ViT 特征编码基线,在极低比特率下实现了高性能。

  8. TOOL · CL_194024 ·

    SC-Diff 模型通过语义校准增强可见光到红外图像的翻译

    研究人员开发了 SC-Diff,这是一种新颖的扩散模型,用于将可见光图像转换为红外表示。该框架通过使用从 SAM3 模型派生的语义图来校准去噪网络中的自注意力机制,从而增强语义一致性。SC-Diff 方法根据类别和注意力分散情况自适应地调整注意力偏差,旨在减少跨类别干扰同时保留全局上下文。实验表明,SC-Diff 提高了生成红外图像的质量,并为红外目标检测等下游任务产生了更有效的合成数据。

  9. TOOL · CL_187491 ·

    新型对抗性攻击针对SAM3图像分割模型

    研究人员开发了通用概念扰动(UCD),这是一种专门针对SAM3图像分割模型的新型对抗性攻击。UCD学习一种单一的图像扰动,可以破坏模型在各种数据集中准确识别和分割概念的能力。这种攻击方法持续优于现有基线,显著降低了分割准确性和概念基础性能。学习到的扰动还表现出向SAM3新版本甚至视频推理的迁移能力,而无需重新优化。

  10. TOOL · CL_183485 ·

    Tarot-SAM3框架增强SAM3以实现任意指代表达式分割

    研究人员开发了Tarot-SAM3,一个旨在通过使Segment Anything Model 3 (SAM3)能够处理任意自然语言表达式来改进指代表达式分割 (RES) 的新框架。该框架分两个阶段运行:表达式推理解释器 (ERI) 用于解析表达式并将其重写为SAM3的鲁棒提示,以及掩码自精炼 (MSR) 阶段,使用DINOv3的特征关系来选择最佳掩码并对其进行精炼。该方法旨在克服SAM3在处理复杂表达式方面的局限性,并减少对多模态大…

  11. TOOL · CL_181008 ·

    新的提示学习方法提高了医学图像分割精度

    研究人员开发了少样本概念提示学习(FS-CPL)方法,以提高SAM3和Medical SAM3等分割基础模型在医学影像中的性能。该新方法直接从少量图像-掩码对中学习连续的概念提示嵌入,无需额外的图像-文本数据或骨干网络重新训练。FS-CPL在各种超声和内窥镜基准测试中取得了显著的改进,Dice分数绝对值最高可提高0.62,并且兼容不同的模型骨干。

  12. RESEARCH · CL_180953 ·

    新框架提升多模态视觉跟踪的准确性和效率

    两篇新研究论文提出了一种用于统一多模态视觉跟踪的新颖框架,旨在提高准确性和效率。第一篇论文介绍了ACTrack,这是一个代理协调框架,它将各种模型视为工具,以利用它们在目标识别和运动预测方面的互补优势。第二篇论文侧重于通过知识蒸馏与结构剪枝相结合来创建紧凑、高效的多模态跟踪器,特别是针对预测头,以实现边缘设备的实时推理。

  13. TOOL · CL_178541 ·

    SAM3 无需训练即可增强遥感图像分割

    研究人员开发了一种新颖的无训练遥感图像少样本分割框架,利用了SAM3的能力。该方法利用SAM3的几何先验创建类别无关的实体基元,并将推理从像素级预测重新构建为实体级推理。采用基于平流方程的精炼机制来增强语义连续性并减少噪声,在无需额外训练的情况下显著改进了SAM3在遥感任务上的适应性。

  14. TOOL · CL_178536 ·

    UltraSAM3:通用超声图像分割新基础模型

    研究人员开发了UltraSAM3,这是一种新颖的概念驱动基础模型,专为通用超声图像分割而设计。该模型将SAM3调整为适用于超声图像-掩码-概念三元组,从而能够进行基于文本的目标指定。UltraSAM3在大量超声数据语料库上进行训练,旨在克服现有特定任务模型和视觉提示方法的局限性,提供更灵活的临床应用。配套的指令引导代理通过将复杂的自然语言查询转换为有效的分割模型提示来进一步增强可用性。

  15. TOOL · CL_176606 ·

    Flux.2 Klein AIO Pro v4.1 Hotfix 增强了 Stable Diffusion 的高级图像编辑功能

    Flux.2 Klein / Ultimate AIO Pro v4.1 Hotfix 是 Stable Diffusion 的一个新工作流,提供了广泛的图像处理功能。它支持文本到图像 (T2I) 和图像到图像 (I2I) 编辑,并具有高级功能,如按片段修复、替换、交换、移除和编辑。用户可以使用手动蒙版或 SAM3 模型进行分割,并可以选择批量处理蒙版以及控制不同片段的提示词特异性。该工作流还允许集成参考图像并详细控制图像生成参数。

  16. TOOL · CL_169883 ·

    SurgSLOT系统支持实时手术视频分割

    研究人员推出 SurgSLOT,一个用于分割和跟踪手术视频中对象的新颖系统。该系统旨在跨不同手术程序和中心进行泛化,而无需大量重新训练。SurgSLOT 利用时间语义学习和语义驱动的长期记忆模块来保持稳定的对象身份,即使在长时间缺席后也能重新识别目标。当在 SAM2 和 SAM3 主干上实现时,SurgSLOT 在跨数据集评估中实现了高性能,优于微调模型并展示了实时能力。

  17. TOOL · CL_169860 ·

    新的CT扫描分割方法使用来自文本报告的弱监督

    研究人员开发了一种新颖的CT扫描分割方法,该方法使用从文本报告中提取的弱监督。该方法将体素级监督与从扫描-报告对中提取的切片级分类损失相结合。通过对SAM3分割模型进行微调,该技术显著提高了分割精度,在使用较少完全标记的卷时,相对提高了22%。

  18. TOOL · CL_167863 ·

    SADe 通过清理弱注释改进少样本分割

    研究人员开发了 SADe,一种旨在通过清理弱支持注释来改进少样本分割的新型层。该方法使用稀疏自动编码器原子证据来估计支持块的可靠性,从而有效地去除干扰项和背景噪声。SADe 可以与现有的少样本分割模型集成,而无需更改其查询端推理,在各种弱支持场景中展示了显著的性能提升,并在特定的提示-样本组合上优于其他方法。

  19. TOOL · CL_167810 ·

    SAM3 通过参数高效 LoRA 适应于手术分割

    研究人员开发了一种参数高效的分割一切模型 3 (SAM3) 的适应方法,专门用于手术概念分割。这种新方法利用低秩适应 (LoRA),将可训练参数的数量显著减少到仅 0.98%,从而可以在单个消费级 GPU 上进行训练。实验表明,这种方法优于标准的 SAM3 和其他基线,产生的分割结果可以直接部署到手术重建和模拟流程中。

  20. TOOL · CL_166093 ·

    Fooocus 图像生成工具更新,新增功能和模型集成

    一位开发者更新了图像生成工具 Fooocus,增加了一些新功能和改进。更新包括提高速度、改进 RAM 和 VRAM 管理、集成 SAM3 用于遮罩和增强,以及添加 APG、CFG++ 和 PAG 等高级引导技术以生成更逼真的图像。开发者还在探索将 Flux 和 Krea 2 等更新的模型集成进来,同时不影响 Fooocus 的简洁性和紧凑性,并通过 Replicate 和 fal.ai 提供对其他模型的临时支持。