PulseAugur
实时 10:14:19
English(EN) Diffuse the object, keep its label: curating detector training data from a few unlabeled photographs via VLM-built 3D vegetation scenes

新方法利用 VLM 和扩散模型从无标签照片创建带标签的训练数据

研究人员开发了一种新颖的方法,利用少量无标签照片为物体检测器生成带标签的训练数据。该方法利用视觉语言模型 (VLM) 从单个图像创建 3D 植被场景,从而自动生成边界框和分割掩码。然后使用扩散模型对这些场景进行重新纹理化,其中“掩码锁定”参数控制扩散过程对目标物体的影响程度。这种合成数据在用于训练标准检测器时,其性能与在不同地点的更大、真实的 数据集上训练的检测器相当,证明了在人道主义扫雷等任务中有效的无监督地点适应性。 AI

影响 能够以最少的人工标注创建物体检测的带标签训练数据,有可能加速专业领域的发展。

排序理由 该集群包含一篇详细介绍计算机视觉中数据生成新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新方法利用 VLM 和扩散模型从无标签照片创建带标签的训练数据

报道来源 [1]

  1. arXiv cs.CV TIER_1 English(EN) · Mario Malizia, Marnix Enting, Rob Haelterman, Ken Hasselmann ·

    扩散物体,保留其标签:通过 VLM 构建的 3D 植被场景,从少量无标签照片中精选检测器训练数据

    arXiv:2608.09691v1 Announce Type: new Abstract: Labeled images of small objects hidden in vegetation are scarce, and detectors trained on them generalize poorly across sites. Rather than reusing labels collected at another site, we synthesize labeled training images from a handfu…