PulseAugur
中
实时 19:18:47
实体 Gradient Flow

Gradient Flow

PulseAugur coverage of Gradient Flow — every cluster mentioning Gradient Flow across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
6
90 天内 6
发布 · 30天
0
90 天内 0
论文 · 30天
6
90 天内 6
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 6 条
  1. TOOL · CL_284640 ·

    对抗性训练使线性 Transformer 具备鲁棒的上下文内学习能力

    一篇新的研究论文探讨了对抗性训练在大型语言模型中实现鲁棒的上下文内学习的有效性。研究表明,在广泛任务上经过对抗性预训练的模型,可以通过上下文内学习在新的、未见过任务上实现最佳鲁棒性,而无需进一步进行特定任务的对抗性训练。这与标准训练的模型形成对比,后者无法在新的任务上达到相同的鲁棒性水平。该研究分析了收敛特性、准确性-鲁棒性权衡以及有效上下文内学习所需的演示复杂度。

  2. TOOL · CL_247452 ·

    新理论解释浅层神经网络中的增量学习

    研究人员开发了一个新的理论框架,用于理解浅层神经网络中的增量学习。这项工作侧重于在标准初始化下,在正交多指标目标上训练的多项式宽度两层网络。研究结果表明,增量学习仍然发生,损失根据目标的厄米展开式顺序下降,低阶分量先于高阶分量被学习。

  3. TOOL · CL_229324 ·

    物理学习模型梯度流与旋转动力学分析

    一篇新研究论文探讨了物理学习的概念,即可训练的材料或网络利用其物理响应来传播误差信号,从而减少显式反向计算的需求。该研究侧重于定向分层传输网络,展示了守恒定律如何约束学习方向。论文提出了响应中的互易性会导致加权梯度流,而反对称边界分量可以引入旋转学习路径。数值一致性检查证实了这些发现,并强调了轨迹漂移如何影响学习的有效性。

  4. TOOL · CL_72683 ·

    大步长梯度下降重新分配了深度网络中的信号

    研究人员已经证明,具有大步长的离散梯度下降与多通路深度线性网络中的梯度流会产生不同的结果。虽然梯度流预测会出现“赢家通吃”的情况,即特征集中在单个通路中,但本研究表明,大步长梯度下降会导致信号在通路之间重新分配。这种在稳定边缘发生的再平衡阶段,有利于共享表示而不是持续的单通路主导,从而阐明了网络深度如何影响通路竞争。

  5. RESEARCH · CL_38175 ·

    新理论推广了宽神经网络的正则化

    一篇新论文引入了一个新颖的框架,用于理解和推广宽神经网络中的正则化。研究发现,标准的岭正则化会扭曲特征学习网络的归纳偏置,尤其会影响预训练模型。为解决此问题,作者将一种与模型无关的规范正则化器公理化,并推导出了广义岭正则化,提出“arc ridge”作为一种实用、鲁棒的替代方法,它在不同学习模式下将早期停止与规范正则化联系起来。该理论通过图像处理和自然语言处理的实证研究得到了验证。

  6. RESEARCH · CL_05188 ·

    超越注意力投影的线性:非线性查询的论证

    研究人员正在探索 Transformer 注意力机制背后的基本原理,新论文分析了其梯度流结构和动态。一项研究将注意力解释为单位球面上的梯度流,识别影响多头设置中 token 聚类和稳定性的因素。另一篇论文研究了用于复杂性控制的关键训练窗口,确定 Transformer 何时优先考虑推理而非记忆。此外,研究还揭示了深度神经网络中几何连续性的起源,将其归因于残差连接和对称性破坏的非线性,并考察了“注意力汇聚”现象的结构原因。