一篇新发表在 arXiv 上的论文探讨了神经网络适应中种群梯度流与有限批次随机梯度下降 (SGD) 之间的差异。研究发现了一种特定机制,梯度流会误判 SGD 的行为,尤其是在涉及 ReLU 激活单元的场景中。这种分歧在广泛预训练后变得显著,由于小步长和长训练时间的联合限制,小步长 SGD 可能无法恢复,而梯度流可以。研究表明,不稳定性集中在 ReLU 门不一致的特定输入上,恢复的可能性与不一致预算、批次大小和学习率有关。 AI
影响 强调了通过梯度流近似来理解神经网络适应的潜在局限性,影响理论研究。
排序理由 发表在 arXiv 上的学术论文,详细介绍了神经网络训练动力学中的一个理论发现。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →