FGVC-Aircraft
PulseAugur coverage of FGVC-Aircraft — every cluster mentioning FGVC-Aircraft across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
FlexiGrad 方法通过调制梯度改进分层分类
研究人员推出了一种名为 FlexiGrad 的新型无参数方法,旨在改进分层细粒度分类任务。该技术解决了由于应用于共享模型骨干的粗粒度和细粒度分类器产生的冲突梯度而导致的训练不稳定问题。通过选择性地去除有害的梯度分量并加强共享方向,FlexiGrad 实现了更稳定的优化,并能更好地保留全局结构和细粒度细节。该方法在 CUB-200-2011、FGVC-Aircraft 和 Stanford Cars 等基准数据集上展示了更高的准确性,并…
-
子词视觉Transformer增强细粒度图像识别
研究人员推出了一种新颖的细粒度视觉识别方法——子词视觉Transformer(SubViT),它改进了标准的视觉Transformer。SubViT选择性地对图像块进行分词,通过用多个子词表示区分性区域来分配更多容量,同时保留全局上下文。该方法分两个阶段进行训练,以识别和提炼信息性注意力图,从而无需额外的正向传播即可直接预测词的重要性。SubViT在广义类别发现等挑战性任务上显著提高了准确性,在CUB、FGVC-Aircraft和St…
-
SAGA框架使用MLLM改进用于图像检索的视觉嵌入
研究人员开发了SAGA,一个利用冻结的多模态大型语言模型(MLLM)来增强检索任务的视觉嵌入的新颖框架。与使用统一类别标签监督的传统方法不同,SAGA采用组相对策略优化(GRPO)从MLLM的预测中导出特定于属性的梯度。这种方法通过专注于区分图像对之间的属性,使视觉编码器能够学习更细致的表示。该框架在零样本图像检索的多个基准数据集上,将召回率@1比最先进的基线提高了3到6个百分点,显示出显著的改进。