一篇新研究论文“相同的损失,不同的梯度”(Same Loss, Different Gradients)发表在arXiv上,探讨了可微学习中的一个基本问题:目标函数的正向传播和反向传播提供给优化器的梯度可能不一致。这种不一致可能发生在利用有限特殊函数递归、自定义反向传播规则或数值裁剪的概率目标函数中。研究人员在高维von Mises-Fisher学习中展示了这种不匹配,表明相同的正向分数可能由于梯度不同而导致不同的优化轨迹。为解决此问题,他们引入了AR/FR,一种固定深度的解析实现,通过联合构建势函数及其导数来确保前向-后向一致性,提供经过认证的保真度和固定深度计算。 AI
影响 这项研究通过确保数值计算中的前向-后向一致性,可能带来更稳定和可预测的AI模型训练。
排序理由 学术论文,详细介绍了一种可微学习的新方法。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- AR/FR
- arXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- ScienceCast
- von Mises-Fisher distribution
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →