研究人员开发了TSAL,一个新颖的、用于小样本场景文本分割的属性感知框架。该方法利用预训练的CLIP模型提取可迁移的文本属性,解决了监督方法中数据集稀少和标注成本高昂的限制。TSAL包含一个用于语义和纹理特征的视觉引导分支(Visual-Guided Branch)和一个用于多样化文本属性的自适应提示引导分支(Adaptive Prompt-Guided Branch),并通过一个自适应特征对齐模块(Adaptive Feature Alignment module)进一步增强,以连接视觉和文本表示。实验表明,TSAL在小样本设置下取得了最先进的性能,并展现了强大的泛化能力。 AI
影响 这项研究为图像中的文本分割提供了一种更有效的方法,有望减少计算机视觉任务中对大量标记数据的需求。
排序理由 该集群包含一篇详细介绍场景文本分割新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →