研究人员开发了用于开放词汇实例和全景分割的新方法,旨在识别预定义类别之外的对象,而无需大量手动标注。一种方法,在 arXiv 论文中有所详述,使用 Grounded SAM 和 LLaVA 等模型生成的多模态伪标签,并通过 CLIP 引导过滤和 GPT 驱动的字幕重建进行增强。另一种方法,测试时原型自适应 (TPA),是一种无训练的即插即用模块,在输出层面运行,使用未标注的部署域图像从 DINO 特征构建类别原型,以提高分割准确性。 AI
影响 这些进展可能带来更通用、更准确的图像识别系统,能够理解更广泛的对象而无需大量手动标注。
排序理由 两篇 arXiv 论文详细介绍了开放词汇分割的新颖方法。
在 Hugging Face Daily Papers 阅读 →
- DINO
- Open-Vocabulary Semantic Segmentation
- Test-Time Prototype Adaptation
- arXiv
- Byeongkeun Kang
- COCO
- GPT
- Llava
AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →