研究人员分析了Sharpness-Aware Minimization (SAM)在改善模型泛化能力方面的隐式偏差。他们的线性稳定性分析揭示了SAM的扰动半径($\rho$)、批量大小($b$)和学习率($\eta$)之间的定量关系,表明这些参数会影响SAM所寻求的最小值的平坦度。在ResNet-18和VGG-19模型上对CIFAR-100进行的实验验证了这些发现,表明增加$\rho$与更小的Hessian特征值相关。该研究还引入了Taylor-Locality Controlled SAM (TLC-SAM),一种动态调整$\rho$以进一步减小Hessian特征值的变体。 AI
影响 为SAM中的超参数调优提供了定量界限,有可能改善深度学习模型的泛化能力。
排序理由 分析现有优化技术的学术论文。
在 Hugging Face Daily Papers 阅读 →
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →