研究人员提出了一个新的动态结构模型来解释预训练模型中训练-验证分离的出现。这种现象是指模型在训练数据上的表现与在验证数据上的表现出现分歧,其原因在于模型的适应性将其关注点从广泛可复用的特征转移到更具体的、对未见数据迁移性较差的特征上。该研究通过使用ResMLP、自然语言处理模型如RoBERTa、DeBERTa和Qwen,以及视觉模型如ResNet-18进行受控模拟,证明了可观察到的结构演变可以在无需直接访问验证示例的情况下预测这种分离。 AI
影响 为理解和潜在缓解跨领域预训练模型中的过拟合提供了一个理论框架。
排序理由 该集群包含一篇研究论文,详细介绍了对机器学习中一种现象的新理论解释。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- DeBERTa
- Gotit.pub
- Hugging Face
- Qwen
- ResMLP
- ResNet-18
- Roberta
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →