FGVC-Aircraft
PulseAugur coverage of FGVC-Aircraft — every cluster mentioning FGVC-Aircraft across labs, papers, and developer communities, ranked by signal.
-
CloSeR框架增强AI模型中的类别发现能力
研究人员推出CloSeR,一个旨在改进广义类别发现(GCD)的新型框架。GCD旨在识别已知类别,同时也能从无标签数据中发现新的、连贯的类别。CloSeR采用两步流程:首先,它使用轻量级适配器训练一个闭集教师模型,以保留预训练知识;然后,它使用统一关系蒸馏(URD)将这些知识迁移到GCD任务中。该方法在与DINO和DINOv2骨干网络集成时,在各种基准测试中均展现了最先进的性能。
-
新的DeCO方法增强了细粒度视觉分类的数据集蒸馏能力
研究人员推出了一种新的数据集蒸馏方法DeCO,旨在改进细粒度视觉分类。与以往关注全局图像统计信息的方法不同,DeCO优先保留局部证据,如物体部件和纹理。该技术将蒸馏构建为有预算的判别性证据保留,利用预训练的教师模型识别信息性图像块,实现多样化覆盖,并将这些区域组织成类别证据库。然后,将这些证据库组合成紧凑的网格图像,用于训练下游模型。在CUB-200-2011、FGVC-Aircraft和Stanford Cars等数据集上的实验表明…
-
CloSeR框架通过蒸馏闭集教师模型的知识来增强类别发现能力
研究人员推出了一种名为CloSeR的新型框架,旨在通过利用闭集教师模型的知识来改进广义类别发现(GCD)。该方法解决了当前GCD方法中联合训练可能导致目标冲突和预测偏差的问题。CloSeR采用两阶段过程:首先,训练一个轻量级的、经过领域适应的闭集教师模型;然后,使用统一关系蒸馏(URD)将该教师模型的知识蒸馏到下游GCD任务中。这种方法在多个基准测试中展示了持续的性能提升,并取得了最先进的成果。
-
新的H$^2$EDL模型通过新颖的不确定性表示增强了分层分类
研究人员推出了一种新颖的深度学习模型H$^2$EDL,专为分层分类任务设计。该模型通过开发不确定性表示来解决细粒度识别中的结构化歧义挑战,这些表示同时捕捉叶级类别和中间概念。H$^2$EDL通过两种方式解释其参数来实现这一点:一种是保持标签树级别之间一致性的分层分类器,另一种是量化信念而不过度专业化的树结构超意见。该模型在FGVC-Aircraft和DERM12345等基准数据集上显示出校准误差的显著降低,在更深层次的层次结构和更大的…
-
FlexiGrad 方法通过调制梯度改进分层分类
研究人员推出了一种名为 FlexiGrad 的新型无参数方法,旨在改进分层细粒度分类任务。该技术解决了由于应用于共享模型骨干的粗粒度和细粒度分类器产生的冲突梯度而导致的训练不稳定问题。通过选择性地去除有害的梯度分量并加强共享方向,FlexiGrad 实现了更稳定的优化,并能更好地保留全局结构和细粒度细节。该方法在 CUB-200-2011、FGVC-Aircraft 和 Stanford Cars 等基准数据集上展示了更高的准确性,并…
-
子词视觉Transformer增强细粒度图像识别
研究人员推出了一种新颖的细粒度视觉识别方法——子词视觉Transformer(SubViT),它改进了标准的视觉Transformer。SubViT选择性地对图像块进行分词,通过用多个子词表示区分性区域来分配更多容量,同时保留全局上下文。该方法分两个阶段进行训练,以识别和提炼信息性注意力图,从而无需额外的正向传播即可直接预测词的重要性。SubViT在广义类别发现等挑战性任务上显著提高了准确性,在CUB、FGVC-Aircraft和St…
-
SAGA框架使用MLLM改进用于图像检索的视觉嵌入
研究人员开发了SAGA,一个利用冻结的多模态大型语言模型(MLLM)来增强检索任务的视觉嵌入的新颖框架。与使用统一类别标签监督的传统方法不同,SAGA采用组相对策略优化(GRPO)从MLLM的预测中导出特定于属性的梯度。这种方法通过专注于区分图像对之间的属性,使视觉编码器能够学习更细致的表示。该框架在零样本图像检索的多个基准数据集上,将召回率@1比最先进的基线提高了3到6个百分点,显示出显著的改进。