一项新的基准研究重新审视了在目标测试评估之前预测深度学习模型泛化能力的挑战,重点关注受控协变量偏移而非独立同分布(IID)数据的设置。研究人员发现,泛化度量的有效性高度依赖于特定区域,例如在CIFAR-10-C/P等各种损坏和扰动下评估的图像分类器。研究表明,模型选择不应仅依赖于IID评估所偏好的度量,而应将泛化度量视为区域依赖的排名信号,其效用必须针对预期的损坏或扰动设置进行评估。 AI
影响 研究结果表明,模型选择策略需要适应特定的数据损坏或扰动设置,而不是依赖于基于IID的度量。
排序理由 学术论文,介绍了一个新的基准和关于深度学习泛化度量的新发现。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- CatalyzeX Code Finder for Papers
- CIFAR-10-C/P
- CORE Recommender
- DagsHub
- Dziugaite et al.
- Gotit.pub
- Hugging Face
- Influence Flower
- Jiang et al.
- ScienceCast
- Sora Nakai
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →