Newton-Schulz
PulseAugur coverage of Newton-Schulz — every cluster mentioning Newton-Schulz across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新的无监督方法可在无真实数据的情况下自适应偏微分方程基础模型
研究人员开发了一种新的偏微分方程(PDE)基础模型的无监督微调框架,无需真实解。该方法利用了源自PDE残差和边界条件的基于物理的目标,并结合了一种称为NSLoRA的低秩自适应技术。该方法在不需要真实数据的情况下实现了与监督方法相当的性能,并在各种基准测试中优于现有的神经算子基线和PDE基础模型。
-
新的训练方法提高了循环记忆模型性能
一篇新的研究论文介绍了一种名为“正交化读出”(Orthogonalized Read)的训练技术,旨在提高循环记忆模型的性能。该方法应用于乘法长短期记忆网络(LSTMs)的读出阶段,充当支架,帮助模型更有效地摆脱训练瓶颈。研究表明,该技术具有自洽性,在不同的学习率和难度级别下表现一致,并且可以移除而不影响最终模型的准确性,这表明许多报告的召回基准测试的改进可能与可训练性有关,而非架构改进。
-
新的“Muse”优化器探索LLM的表示几何
研究人员推出了一系列新颖的优化器“Muse”,专为大型语言模型设计,用于探索参数表示的几何特性。与标准的Muon风格优化器不同,Muse的更新受到正交化前每个参数块表示的影响。在LLaMA2-130M和LLaMA2-600M上的实验表明,平衡的非原生表示可以达到与原生表示相当的性能,而减小较短的维度会削弱缩放和单通道支持。
-
Turbo-Muon 优化器通过新的预处理技术加速 AI 训练
研究人员开发了 Turbo-Muon,这是一种新的预处理程序,旨在加速 Muon。Muon 是一种以其在大规模 AI 训练中的强大性能而闻名的优化器。Turbo-Muon 增强了 Newton-Schulz 迭代的初始化,减少了所需的矩阵乘法次数,并能够移除一次迭代。这种优化显著降低了 Muon 的开销,在无需进行超参数调整的情况下,在各种基准测试中将训练时间缩短了约 3%。该方法还提供了关于更新几何形状和潜在的特征崩溃鲁棒性的理论见…
-
矩阵正交化增强RNN记忆,适用于长时任务
研究人员开发了一种方法,通过在读取操作中应用矩阵正交化来提高循环神经网络(RNN)的记忆能力。该技术借鉴了语言模型中使用的优化器,旨在增强联想回忆能力,尤其是在嘈杂的环境中。实验表明,对mLSTM记忆矩阵进行正交化处理,显著提高了在嘈杂联想回忆任务上的性能,尤其是在词汇量和序列长度较大时。
-
Muon 优化器所需的正交化程度低于预期
研究人员调查了 Muon 优化器所需的最佳正交化水平,这是一种通过改进动量更新来增强神经网络训练的技术。他们的研究利用简化的立方牛顿-舒尔茨计划来探索极坐标精度、频谱整形和训练性能之间的关系。研究结果表明,训练质量与极坐标分解精度并不严格相关,因为在 GPT-2 Small 上,各种方法实现了几乎相同的最终损失,而在更大的 MoE/Mamba 模型上,验证损失也相当。
-
研究人员提出用于Stiefel流形优化的新型二阶方法
研究人员开发了一种用于Stiefel流形的新型二阶优化方法,该方法避免了回缩,为高精度要求提供了更高的效率。该方法结合了切向分量以减小目标函数,以及使用牛顿-舒尔茨迭代进行正交化的法向分量,以减小不可行性。数值实验表明,与正交Procrustes和主成分分析等问题上的现有方法相比,该方法表现出优越的性能。