PulseAugur
实时 09:52:00
English(EN) Doomed to Re-Annotate, Forever: The ImageNet Story

ImageNet-1k数据集重新标注,发现12%的标签错误

一篇新论文详细介绍了重新标注ImageNet-1k数据集的广泛过程,揭示了原始标签存在严重问题。研究人员发现,大约12%的标签不正确,33.3%的图像是多标签的,3.8%的图像不包含相关对象。这项名为ReImageNet的全面重新标注工作包括多标签校正、对象定位和修订的类别定义,使监督模型准确性提高了高达1.2%,多模态大模型(MLLMs)提高了5-6%。该研究表明,大规模标注需要迭代改进,并强调了人与大模型协作在实现高质量结果方面的有效性。 AI

影响 强调了高质量数据集在AI开发中的关键需求以及准确数据对模型性能提升的潜力。

排序理由 该集群包含一篇详细介绍新数据集和方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

ImageNet-1k数据集重新标注,发现12%的标签错误

报道来源 [1]

  1. arXiv cs.CV TIER_1 English(EN) · Illia Volkov, Nikita Kisel, Tetiana Mishkina, Klara Janouskova, Jiri Matas ·

    注定要永远重新标注:ImageNet的故事

    arXiv:2608.13783v1 Announce Type: new Abstract: Top-1 accuracy on ImageNet-1k remains the most commonly reported metric in visual recognition. Quality issues with the dataset have been repeatedly reported, yet the original 2012 noisy labels are still predominantly used. The paper…