PulseAugur
实时 20:36:51
English(EN) Backpropagation-Free Trunk Training via the Split Forward Gradients

新的Split-FG方法以35%的内存节省训练深度网络

研究人员开发了一种名为分裂前向梯度(Split-FG)的新颖方法,通过减少内存使用来更有效地训练深度神经网络。该技术将网络分为一个干式部分和一个输出头,精确计算头的梯度,同时使用雅可比向量积估计干式部分的梯度。这种方法减轻了前向梯度中的噪声,并避免了通过干式部分的后向传播,与传统的后向传播相比,内存节省高达35%。实验表明,Split-FG与干式部分较小的学习率相结合,在WikiText-103和CIFAR-10/100等基准测试中取得了有竞争力的结果,尽管性能差异随着干式部分的大小而增加。 AI

影响 降低了训练大型模型的内存需求,可能支持更大的架构或在功能较弱的硬件上进行训练。

排序理由 介绍深度神经网络新训练方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv stat.ML 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的Split-FG方法以35%的内存节省训练深度网络

报道来源 [1]

  1. arXiv stat.ML TIER_1 English(EN) · Tian Qin, Wei-Min Huang ·

    通过分裂前向梯度实现无反向传播的树干训练

    arXiv:2607.16612v1 Announce Type: new Abstract: Backpropagation makes training deep networks memory intensive because it must store intermediate activations. Forward-mode methods avoid this cost, but their gradient estimates become increasingly noisy as the number of trained para…