PulseAugur
中
实时 10:23:44
实体 Adam

Adam

PulseAugur coverage of Adam — every cluster mentioning Adam across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
167
90 天内 167
发布 · 30天
0
90 天内 0
论文 · 30天
156
90 天内 156
层级分布 · 90 天
主题
关系
情绪 · 30 天

15 天有情绪数据

最近 · 第 1/9 页 · 共 180 条
  1. TOOL · CL_284674 ·

    CNet框架通过Wirtinger导数实现复杂值深度学习

    研究人员开发了CNet,一个用于训练深度复杂值神经网络(CVNN)和使用Wirtinger导数优化复杂值函数的C++/CUDA框架。该框架采用物理原生方法,将神经网络视为复杂运算的级联,并将分类视为玻恩规则测量。CNet包含其层的CPU参考和CUDA内核,计算图跨批次克隆以进行GPU执行。该框架还集成了可学习的复杂卷积网络的信号处理原语和一个具有低内存推理模式的真实Adam优化器。初步研究表明,使用CNet构建的复杂值、FNet风格的…

  2. TOOL · CL_284505 ·

    用于约束机器学习的新型随机惩罚-障碍法

    研究人员推出了一种新颖的约束机器学习(CML)方法——随机惩罚-障碍法(SPBM)。SPBM通过结合偶对偶变量的指数平均、稳定的惩罚计划以及莫罗包络(Moreau envelope)来解决非光滑性问题,从而改进了经典方法。该方法分析了小批量(mini-batching)引入的障碍函数偏差,并证明了变换后问题的可行集保持在原始约束之内。实验表明,SPBM在公平性(fairness)和物理信息神经网络(physics-informed n…

  3. TOOL · CL_284462 ·

    新方法优化Adam优化器的内存参数\beta

    研究人员开发了一种优化Adam优化器中内存参数\beta的新颖方法。该技术涉及一个简短的试点训练阶段来选择最佳的\beta值,然后将其固定用于完整的训练过程。通过平衡采样变异性与平均过去梯度的延迟,该方法提出了一个立方内存规则,其系数从梯度探针中估计。对视觉和语言任务的回顾性评估表明,与标准的网格搜索和最佳拟合常数\beta值相比,验证差距显著减小。

  4. TOOL · CL_282938 ·

    AI生成内容在游戏和食谱领域面临下架和批评

    AI生成内容正面临不同领域的审查和下架。在游戏领域,使用先进AI辅助重制《辐射》和《使命召唤:现代战争2》等经典游戏的项目,在收到版权持有者发出的停止和终止通知后已被移除。另外,谷歌的AI Overviews因生成了将各种来源的元素组合在一起的“弗兰肯斯坦食谱”而受到批评,导致烹饪说明可能荒谬或无法使用。

  5. TOOL · CL_282888 ·

    自我生成反馈破坏 AI 模型测试时训练

    研究人员发现,测试时训练(TTT)中存在一个关键问题,即模型从自身生成输出来学习可能导致在独立数据上的性能下降。这种现象在包括 Qwen3-4B 在内的各种模型大小和配置中都有观察到,表明虽然写作本身不是失败原因,但基于自生成文本更新模型权重的过程可能导致重大的预测错误。该研究提出了解决方案,例如使用冻结模型进行生成,或使用“结算”机制在提交更新之前在独立文本上验证更新,这可以在保留适应能力的同时显著减少损害。

  6. TOOL · CL_277183 ·

    分析 Adam 优化器与自然梯度下降的几何偏差

    一篇新研究论文调查了深度学习中常用的优化算法 Adam 及其与自然梯度下降 (NGD) 的关系。该研究分析了 Adam 的更新规则,包括动量,并将其视为对经验 Fisher 矩阵的近似,并进行了多项修改。研究人员在各种损失曲面上测量了 Adam 相对于 NGD 的几何偏差,发现偏差是依赖于上下文的,在病态条件和非凸神经网络中显著增加。虽然较高的几何漂移与较慢的初始优化相关,但并未损害最终目标最小化,这表明 Adam 的有效性可能源于近…

  7. TOOL · CL_277135 ·

    微调LLM:内存成本解析,LoRA & QLoRA解决方案

    微调一个拥有70亿参数的模型所需的内存远超模型本身的权重大小,完全微调大约需要112GB。如此大的内存需求主要是因为梯度和优化器状态,它们大约占用了84GB,而模型fp16权重仅需14GB。LoRA和QLoRA等技术通过冻结基础模型权重并仅训练一小部分适配器参数,极大地降低了内存需求,其中QLoRA通过以4位精度存储基础模型进一步优化。

  8. TOOL · CL_275203 ·

    SoftServe:新的拟牛顿法应对深度学习挑战

    研究人员开发了SoftServe,一种新颖的拟牛顿(QN)方法系列,旨在解决深度学习中非凸性和海量参数规模的挑战。与传统的QN方法不同,SoftServe即使在负曲率区域也能获得正定曲率估计,并通过对角线和Kronecker分解变体扩展到大型神经网络。该方法利用耦合牛顿-舒尔茨迭代进行矩阵运算,用GPU友好的矩阵乘法取代了昂贵的分解。SoftServe在病态问题上表现出优越的性能,包括物理信息神经网络和扩散模型,实现了比Adam和Mu…

  9. TOOL · CL_275093 ·

    神经调质与激活选择结合打破AI进化瓶颈

    一篇新的研究论文探讨了在从单一基因型实现多样化能力方面,人工进化的局限性。研究发现,当使用单调激活函数时,单独的神经调质会产生一个进化搜索瓶颈,将奇偶校验任务的性能上限限制在75%。通过将神经调质与特定任务的激活函数选择相结合,克服了这一瓶颈,实现了跨多种行为的100%成功率。该研究表明,计算原语应该是开放式进化的可进化特征。

  10. RESEARCH · CL_268895 ·

    新研究以新方法解决在线学习中的动态遗憾问题 · 跟踪3个来源

    三篇新研究论文探讨了在线学习中的动态遗憾最小化问题。第一篇论文侧重于针对弯曲损失和Adam等自适应优化器的FTRL(Follow-the-Regularized-Leader)方法,提出了一种简化证明并提供新保证的约简。第二篇论文引入了一个用于具有指示器切换成本的动态遗憾的元学习框架,实现了跟踪分段常数比较器的最小最大最优界。第三篇论文分析了上下文线性优化中遗憾的曲率,推导了一个闭式度量,并展示了其在电池套利任务中将遗憾提高30.8%的应用。

  11. TOOL · CL_268869 ·

    研究人员探索自适应优化器中的负预处理指数

    研究人员调查了自适应优化器中负预处理指数的影响,特别是检查了它们与全局学习率的相互作用。通过在四个不同环境中的对照研究,他们发现最优指数几乎线性地随着学习率的对数而减小。这表明负指数并非普遍最优,而是由学习率和预处理的联合作用产生的状态,尤其是在较大的步长下。该研究还强调了模型选择中的一个冲突,即源域验证偏好与最大化对环境变化的鲁棒性的预处理状态不同。

  12. RESEARCH · CL_268749 ·

    AF-Muon 优化器取代 AdamW 用于绑定嵌入模型,节省内存

    研究人员开发了 AF-Muon,一种无需在绑定嵌入模型中使用 AdamW 的优化器,可能节省约 20% 的优化器状态内存。这种新方法在隐藏权重矩阵上保持了 Muon 的谱范数最陡下降更新,同时为绑定词汇表采用了支持感知线性最小化。AF-Muon 在包括语言模型、图像模型和蛋白质序列在内的各种模型架构和数据模态中,以最小的开销展示了平均验证损失和困惑度的稳健改进。

  13. TOOL · CL_269356 ·

    EvE 优化器为神经网络搜索提供比 Adam 更快的替代方案

    研究人员推出了一种名为 EvE (Evolutionary Explorer) 的新型优化器,旨在成为神经网络中超参数和架构搜索比 Adam 更快的替代方案。EvE 采用基于种群的差分进化方法,并结合了有针对性的 Adam 回退机制,显著降低了每次迭代的成本,同时保持了具有竞争力的性能。在对各种基准测试和神经网络任务的评估中,EvE 证明了搜索完成时间的缩短,以及与 Adam 相当或略低的最终质量,使其成为预算受限优化场景的有前途的工具。

  14. TOOL · CL_268230 ·

    新的 Rank-1 iKFAD 优化器将 Transformer 预训练的内存减半

    研究人员推出了一种新颖的优化技术 Rank-1 iKFAD (R-iKFAD),旨在提高 Transformer 预训练的内存效率。该方法通过将 iKFAD 优化器的完整摩擦张量替换为秩为 1 的外积分解,将每层的内存占用从 O(mn) 显著降低到 O(m+n)。在 GPT2-Nano 和 DistilBERT 等各种模型上的实验表明,R-iKFAD 在性能上与原始 iKFAD 相当,同时将优化器的内存需求几乎减半。

  15. RESEARCH · CL_269423 ·

    新研究解决 LLM 训练效率、容错性和微调优化问题 · 跟踪 9 个来源

    arXiv 上发布的多篇研究论文探讨了优化大型语言模型 (LLM) 训练和微调的新方法。Leto 引入了一个系统,用于在 LLM 训练期间从硬件故障中更快地就地恢复,显著提高了生产性训练时间。其他论文侧重于高效的微调技术,包括使用 LOOM 进行在线数据选择,使用零阶和一阶优化方法 (ZFO) 进行自适应步长选择,以及使用 LoRA-Norm 进行训练后归一化以平衡适应性增益。此外,TACO 为 LLM 微调提供了一种内存高效的优化器…

  16. TOOL · CL_261242 ·

    Adam 优化器的绑定动量参数揭示了独特的训练动态

    一篇新发表在 arXiv 上的论文探讨了 Adam 优化器的动态,Adam 是大规模 AI 训练的核心组件。该研究识别出与其两个动量参数 $\beta_1$ 和 $\beta_2$ 相关的特定机制。研究表明,当这些参数绑定时($\beta_1 = \beta_2$),更新坐标中的滞后项会消失,从而导致以符号为主的更新和更平滑的训练轨迹。这一发现为绑定动量配置为何具有动态独特性并能保持强劲性能提供了机制性解释。

  17. TOOL · CL_261224 ·

    Sharpness-Aware Minimization 提高了细菌分类准确性

    研究人员已将 Sharpness-Aware Minimization (SAM) 应用于提高细菌拉曼光谱数据的分类准确性,这项技术对于便携式诊断至关重要。该方法解决了当前算法在有限数据集上泛化能力不足以及需要复杂预处理的局限性。通过使用 SAM,研究表明与传统的 Adam 优化器相比,准确性提高了 10.5%,平均提高了 2.7%,为在临床环境中开发更有效的 AI 驱动的拉曼光谱工具铺平了道路。

  18. TOOL · CL_261219 ·

    新的OKSPCA监督降维方法得到分析

    研究人员开发了一种新的在线监督降维方法,称为在线核监督主成分分析(OKSPCA)。该技术将随机特征坐标中的中心化交叉矩与正交基的Adam风格更新相结合。该研究调查了优化谱目标与实现准确预测表示之间的区别,发现性能因声明的管道而异。虽然直接分类秩模型捕获了大部分目标能量,但中间状态显示出几何偏差。研究还强调了计算权衡,对于分类任务,按需精确计算速度更快,而Adam在某些回归任务中以持续的几何误差为代价提供速度优势。

  19. TOOL · CL_259382 ·

    研究发现寄生路径阻碍 RNN 状态跟踪

    一篇新研究论文提出了 Householder 线性 RNN 中“加性输入路径”的概念,并将其识别为阻碍状态跟踪的寄生吸引子。当移除此路径时,相同的架构能够学习并泛化到更长的序列,在某些任务上达到完美的准确率。该研究表明,加性路径会破坏并隐藏正确的自动机学习,实验表明,在禁用此路径的情况下初始化模型可以实现精确泛化。

  20. TOOL · CL_258958 ·

    研究人员揭示Adam优化器的稳定性相图

    研究人员为Adam优化器识别出了一个稳定性相图,揭示了其两个动量时间尺度如何控制训练不稳定性。他们发现在$(\beta_1,\beta_2)$平面上存在一个近似线性的边界,该边界将尖峰动态与非尖峰动态分开,这与损失函数的有效指数相关。该边界通过将Adam的动量时间尺度与二次损失之外的有限尺度超二次损失的几何形状联系起来,有助于解释损失尖峰。