PulseAugur
实时 10:51:44
实体 backpropagation

backpropagation

PulseAugur coverage of backpropagation — every cluster mentioning backpropagation across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
8
90 天内 35
发布 · 30天
0
90 天内 0
论文 · 30天
8
90 天内 33
层级分布 · 90 天
主题
关系
情绪 · 30 天

8 天有情绪数据

最近 · 第 1/2 页 · 共 35 条
  1. TOOL · CL_206512 ·

    公开了一种物理神经网络的新训练方法

    研究人员开发了一种名为近平衡传播(NEP)的新训练方法,该方法将平衡传播(EP)扩展用于复值波系统。这种新颖的方法即使在弱耗散状态下也有效,并且允许通过调整局部参数进行原地训练,而无需直接控制节点间的连接。该方法已成功在逻辑任务和手写数字识别的基准测试中得到验证,显示出稳定的收敛性,并为训练控制受限的物理系统提供了一条实用的途径。

  2. RESEARCH · CL_212318 ·

    新的 arXiv 论文探讨神经网络计算与学习之间的断开

    两篇新的 arXiv 论文探讨了神经计算的动力学,重点关注复杂的前向计算与更简单的学习机制之间的分歧。第一篇论文引入了一个“生成-事实图”来统一训练、学习和推理,并展示了一个使用 nanoGPT 和 ResNet 在保留运行中具有高准确率的预测模型。第二篇论文识别出一种“前向-后向断开”,指出虽然神经网络中的前向计算已高度多样化,但学习方法在很大程度上仍围绕反向传播及其变体。两篇论文都表明需要更好地协调这些方面,以实现更具生物学基础和…

  3. TOOL · CL_200186 ·

    研究发现AI模型-大脑比较对图像分辨率敏感

    一篇新发表在arXiv上的研究调查了卷积神经网络的评估分辨率如何显著影响不同学习规则之间的比较,特别是在模拟早期视觉皮层方面。研究人员发现,一个普遍的发现——即未经训练或局部训练的网络在早期视觉皮层表征中优于反向传播——高度依赖于评估分辨率,随着分辨率的提高,差距会显著扩大。研究表明,图像细节是这种效应的主要驱动因素,而不是池化机制,并且比较的敏感性受限于单个标量亮度值中包含的信息。

  4. TOOL · CL_198238 ·

    新理论统一AI硬件的物理反向传播

    研究人员开发了一种统一的物理反向传播理论,能够在物理计算系统中实现基于梯度的优化。该理论基于伴随方法,确定了硬件在何种条件下可以计算其自身性能的精确梯度。该框架涵盖了现有的方法,如平衡传播和哈密顿回声反向传播,并扩展到非厄米和时变系统,为物理学习算法提供了理论基础。

  5. TOOL · CL_188637 ·

    理解反向传播:神经网络中的链式法则

    本文解释了链式法则的数学概念及其在反向传播中的关键作用,反向传播是用于训练人工智能神经网络的算法。文章演示了如何手动计算导数并通过微小的数值扰动进行验证,这是一种对基于梯度的学习至关重要的调试技术。解释涵盖了一个简单的两层网络,详细介绍了计算输出的前向传播和计算每个参数的梯度的后向传播,并强调了该过程对大型模型的效率。

  6. RESEARCH · CL_174095 ·

    神经网络权重揭示时序数据结构和表征漂移

    研究人员正在探索如何在训练完成后从神经网络权重中恢复时序结构。一项研究提出使用隐马尔可夫模型来分析权重轨迹并识别不同的数据状态,当数据落在同一识别状态内时,泛化能力得到提高。另一项调查比较了反向传播和赫布学习,结果显示虽然两种方法都可以训练网络执行任务,但赫布学习会导致内部网络状态出现显著的表征漂移,即使在性能趋于平稳后也是如此,这与反向传播不同。

  7. TOOL · CL_171712 ·

    新方法仅使用前向波动重建反向传播

    研究人员开发了一种仅使用前向传递统计数据在噪声调制神经网络 (NNNs) 中重建反向传播算法的方法。该方法通过避免转置权重和反向数据路径,解决了传统反向传播在生物学和神经形态学上的不可能性。所提出的技术利用权重镜像从单元协方差估计权重矩阵,并在单元内进行局部微分估计以递归传播误差。当与局部 Adam 更新相结合时,这种仅前向的替代方法在回归任务上实现了与标准反向传播相当的准确性,并且其设计非常适合数字电路。

  8. TOOL · CL_167468 ·

    研究探索 Sign-Symmetry 学习规则以实现强大的神经网络微调

    一篇研究论文提出将 Sign-Symmetry 学习规则作为神经网络的微调方法,旨在提高鲁棒性而不牺牲性能,与标准反向传播相比。由 Aymene Berriche 进行的研究通过在各种任务和基准测试中的广泛实验证明了这种方法。尽管该论文后来被撤回,但其发现为在深度学习中使用受生物学启发的学习规则开辟了新途径。

  9. COMMENTARY · CL_158104 ·

    神经网络入门:受人脑启发的简单指南

    本文解释了神经网络的基本概念,将其与人脑的神经元和突触结构进行类比。文章分解了输入层、隐藏层和输出层这三个主要层级,详细说明了它们在处理数据和做出决策方面的各自功能。解释强调了神经网络如何通过一种称为反向传播的过程进行学习,通过调整“权重”来提高准确性,而无需深入复杂的数学公式。

  10. RESEARCH · CL_156493 ·

    新的条件直接反馈对齐方法改进神经网络训练

    研究人员开发了一种名为条件直接反馈对齐(nDFA)的新方法,该方法改进了深度神经网络的训练。该方法通过分析权重更新中的各向异性来解决直接反馈对齐(DFA)中的一种失效模式,这种各向异性可能源于突触前活动或局部误差。研究表明,基于活动进行条件化可以带来显著的收益,尤其是在高方差方向包含不相关信息时。进一步分析表明,基于误差进行条件化也能提高DFA的性能,而结合两者则能带来额外的优势。该研究将条件化DFA视为对局部外积规则的因子级研究,而…

  11. TOOL · CL_149709 ·

    Sakana AI 通过新颖的 Error Diffusion 训练绕过反向传播

    Sakana AI 的研究人员开发了一种名为 Error Diffusion (ED) 的新深度学习训练方法,该方法绕过了对反向传播的需求。这种新颖的方法通过使用局部学习规则和双流网络架构,遵循了 Dale 原则(神经活动的一项生物学约束)。该团队引入了三项关键创新——层特定的 sigmoid 宽度、批次中心类误差和不对称初始化——使 ED 在 MNIST 上达到了 96.7% 的准确率,在 CIFAR-10 上达到了 61.7%,这…

  12. RESEARCH · CL_151736 ·

    受限赫布学习优化神经网络效率

    研究人员开发了一种名为受限赫布学习(CHL)的新学习规则,旨在优化神经网络在结构约束下的表征效率。与传统的反向传播不同,CHL侧重于成本效益权衡,在保持功能性能的同时保留较少的输入信息。这种方法尤其适用于资源有限的生物系统,表明赫布学习在突触资源分配中的作用,而不仅仅是最大化准确性。

  13. TOOL · CL_145858 ·

    新的权重反馈方法增强了深度网络中的局部更新

    研究人员开发了一种名为基于激活的预测编码的权重反馈(WF-Act-PC)的新方法,该方法允许在深度神经网络中进行更局部的权重更新。该方法旨在克服对非局部操作(特别是雅可比矩阵转置)的依赖,而雅可比矩阵转置是传统预测编码方法中的瓶颈。通过将雅可比矩阵转置分解为局部可用的项,WF-Act-PC 消除了误差传输所需的完整自动微分反向传播。在 CIFAR-10、CIFAR-100 和 Tiny-ImageNet 数据集上的实验表明,WF-Ac…

  14. RESEARCH · CL_139614 ·

    新研究重新审视反向传播的机制和局限性 · 跟踪 4 个来源

    三篇最新的 arXiv 论文探讨了深度学习中反向传播的机制和局限性。其中一篇论文将反向传播重新表述为一个幂零线性系统,揭示了其数学结构以及对残差网络和迁移学习的影响。另一项研究将反向传播与前向模式自动微分和零阶优化等替代方法进行了比较,发现虽然这些替代方法节省了内存,但计算成本更高,准确性也随之降低。第三篇论文将语言模型头识别为一个重要的梯度瓶颈,表明从内部特征到词汇 logits 的投影抑制了很大一部分梯度范数,导致次优的训练动态和效率低下。

  15. RESEARCH · CL_135107 ·

    蒙特卡洛法为训练深度神经网络提供无梯度替代方案

    研究人员展示了一种使用简单蒙特卡洛算法训练深度神经网络的无梯度方法。该方法通过随机变异参数并在损失降低时保留它们,从而绕过了反向传播的常见问题,例如梯度消失和爆炸。该方法已被证明在训练具有20多层的网络甚至Transformer架构以完成图像分类和语言建模等任务方面是有效的。

  16. TOOL · CL_124941 ·

    通过代码和类比解释反向传播和矩阵微积分

    本文解释了反向传播和矩阵微积分在深度学习中的数学概念。它使用工厂装配线的类比来说明如何通过反向传播识别和纠正错误,这类似于神经网络中梯度的计算。解释中详细介绍了用于进行预测的前向传播、代表客户不满意的损失函数,以及通过层追溯错误以使用梯度下降调整参数的反向传播。

  17. TOOL · CL_123256 ·

    引入受神经科学启发的自监督学习框架

    研究人员引入了元表征预测编码(MPC),一种受神经科学启发的创新自监督学习框架。该方法旨在通过学习预测并行数据流而非原始输入的表征,来克服传统反向传播和监督学习的局限性。MPC利用自由能原理和主动推理,实现了一种仅编码器的学习方案,通过决策来采样信息性感官数据,从而驱动表征动力学。

  18. RESEARCH · CL_117152 ·

    新型统一复值神经网络整合连续和事件驱动学习

    研究人员开发了一种新颖的统一复值神经网络(UCNN),它整合了连续值表示和事件驱动的时间处理。该新模型基于统一复值神经元(UCN),使用幅度编码信号强度,并使用相位控制时间演化和脉冲发射。UCNN框架支持通过反向传播和反向传播随时间进行训练,并提供了一种事件驱动的自适应相位学习规则,作为一种计算效率更高的替代方案。在目标跟踪和洛伦兹吸引子学习中的评估表明,UCNN在保持稀疏、事件驱动的计算(适用于神经形态和边缘AI应用)的同时,能够实…

  19. COMMENTARY · CL_103162 ·

    大型语言模型如何工作:预测、Token、训练和注意力机制

    大型语言模型(LLMs)的根本运作方式是通过预测序列中的下一个词,这个过程会内隐地教会它们语法、事实和推理。在预测之前,文本会被分解成Token并转换为数值表示以进行数学处理。训练阶段涉及根据海量文本调整数十亿个参数,使模型能够在没有明确规则的情况下学习模式和信息。一个关键的创新是Transformer架构中的注意力机制,它使模型在预测后续词时能够权衡早期词的重要性,这对于理解上下文和解决歧义至关重要。

  20. TOOL · CL_104679 ·

    新协议揭示深度学习反馈对齐方法中的隐性故障

    研究人员发现,深度学习中反馈对齐(FA)技术的标准评估方法存在重大局限性。目前的评估依赖于任务准确率和梯度余弦相似度,但这会掩盖关键的故障模式。一个问题是测量退化,即在某些架构中梯度会崩溃,导致余弦相似度失去意义。另一个问题是聚合崩溃,即层级异质性被聚合分数所隐藏。为了解决这个问题,提出了一种使用尺度稳定性、参考有效性和深度效用检查的新诊断协议,以及逐层余弦报告,以更好地识别和指导有效的FA方法的开发。