matrix decomposition
PulseAugur coverage of matrix decomposition — every cluster mentioning matrix decomposition across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新研究论文质疑 Muon 优化器的有效性
一篇新发表在 arXiv 上的研究论文质疑了 Muon 优化器在大规模深度学习中的有效性,特别是在矩阵分解任务上。虽然有报道称 Muon 在大型语言模型训练中表现优于 Adam 和 AdamW 等优化器,因为它能近似正交化梯度更新,但本研究发现在受控的矩阵分解问题上,Muon 的表现并不持续优于 AdamW。研究表明,Muon 的一些报告优势可能是在之前测试其所处的复杂环境中的产物,而非其更新规则固有的好处。
-
在受控矩阵分解测试中,Muon 优化器的优势受到质疑
研究人员重新评估了 Muon 优化器,这是一种专为大规模深度学习设计的算法,在训练大型语言模型方面表现出优于 Adam 和 AdamW 的潜力。通过将 Muon 的性能隔离在更简单的低秩矩阵分解任务上,研究发现 Muon 的表现并不始终优于 AdamW。研究结果表明,Muon 的一些报告优势可能与现代深度网络的规模和复杂性有关,而不是其核心更新规则,这提倡在受控问题上对优化器进行更细致的评估。
-
新的对比因子分析框架融合了因子分析和对比学习
研究人员引入了一个名为对比因子分析(CFA)的新颖框架,它融合了因子分析和对比学习的原理。该方法旨在通过利用因子分析在不确定性建模和鲁棒性方面的优势来增强无监督表征学习,而这些优势在深度学习中历来被忽视。该论文还提出了一种CFA的非负版本,以提高可解释性并学习解耦的表征。实验结果表明,所提出的方法在表达能力、鲁棒性、可解释性和准确的不确定性估计方面有所改进。
-
Muon 优化器加速矩阵分解,绕过梯度下降的局限性
一篇新研究论文介绍 Muon 优化器,该优化器在矩阵分解任务中表现出比传统梯度下降更优的性能。Muon 避免了缓慢的鞍点到鞍点动力学,通过同时学习所有顶部模式来实现更快的收敛。它还以更高的学习率保持稳定性,并在优化过程中表现出不同的守恒量,从而能够通过定制的学习率计划在短短两步内实现快速对齐和近乎完美的收敛。
-
新研究探讨推荐系统中的单义性
研究人员探讨了推荐系统中的单义性概念,旨在使学习到的嵌入维度更具可解释性。通过将 Matryoshka Sparse Autoencoder (MSAE) 应用于在 Amazon Fashion 数据集上训练的大规模矩阵分解推荐系统的嵌入,他们识别出了可恢复的层次结构。MSAE 提供了一种原则性的方法来揭示可解释的潜在因素,并使用元数据对齐和 LLM 生成的标签进行语义一致性分析。该研究展示了对与性别相关的潜在神经元的干预,表明了在推…
-
新方法为Bregman ADMM提供二阶KKT保证
研究人员开发了一种新颖的方法来分析非凸和非Lipschitz优化问题的Bregman ADMM。该方法用双边相对平滑条件取代了标准的Lipschitz梯度假设,该条件涉及相对于Bregman核的Hessian比较。分析表明,在此条件下,迭代以高概率收敛到严格鞍点,从而导致极限KKT点的几乎确定性二阶平稳性。该工作通过多块星形共识公式扩展到分布式优化,并包括矩阵和张量分解的数值实验。
-
研究:文本评论对推荐系统的提升有限
一篇新发表在arXiv上的研究论文探讨了将文本评论数据纳入推荐系统矩阵分解模型的有效性。研究人员发现,尽管自适应融合机制和交叉注意力可以提高灵活性,但与传统的协同过滤方法相比,文本信号的边际贡献仍然有限。研究结果表明,在典型的评分预测场景中,协同信息仍然主导着性能,这促使人们重新考虑如何整合语义评论数据。
-
研究发现:Netflix推荐可提升4-12%的用户参与度
一项关于Netflix观看数据的新研究表明,个性化推荐系统显著提高了用户参与度。该研究量化了其影响,表明用更简单的矩阵分解或基于受欢迎程度的算法替换当前系统,可能会分别降低4%和12%的用户参与度,同时还会降低内容多样性。研究结果表明,推荐的最大收益来自于有效的定位,特别是针对中等受欢迎程度的内容,而不是简单地增加曝光。